본 연구는 광 네트워크 자동화에서 대규모 언어 모델(LLM)의 성능을 평가하기 위한 새로운 파이프라인인 HuGLEN을 제안합니다. HuGLEN은 LLM-as-a-judge 방식과 소수의 전문가 평가를 결합하여 LLM 간의 확장 가능하고 재현 가능한 비교를 가능하게 하며, 품질 효율성 점수(QES)를 통해 LLM을 순위 매깁니다. 광 네트워크 품질 예측 XAI 모델의 결과를 운영자 친화적인 설명으로 번역하는 작업에 HuGLEN을 적용한 결과, 중간 크기의 LLM이 품질과 효율성 측면에서 가장 우수한 균형을 보였습니다.