Sign In

Human Grounded Evaluation of Large Language Models for Optical Network Automation

Author
  • Haebom
Category
Empty

저자

Kiarash Rezaei, Omran Ayoub, Paolo Monti, Carlos Natalino

💡 개요

본 연구는 광 네트워크 자동화에서 대규모 언어 모델(LLM)의 성능을 평가하기 위한 새로운 파이프라인인 HuGLEN을 제안합니다. HuGLEN은 LLM-as-a-judge 방식과 소수의 전문가 평가를 결합하여 LLM 간의 확장 가능하고 재현 가능한 비교를 가능하게 하며, 품질 효율성 점수(QES)를 통해 LLM을 순위 매깁니다. 광 네트워크 품질 예측 XAI 모델의 결과를 운영자 친화적인 설명으로 번역하는 작업에 HuGLEN을 적용한 결과, 중간 크기의 LLM이 품질과 효율성 측면에서 가장 우수한 균형을 보였습니다.

🔑 시사점 및 한계

HuGLEN은 LLM-as-a-judge를 활용하여 인간 전문가의 레이블링 부담을 줄이면서도 LLM 평가의 확장성과 재현성을 높입니다.
제안된 품질 효율성 점수(QES)는 LLM의 설명 품질과 추론 효율성 간의 최적 균형을 찾아내어 실질적인 네트워크 자동화 애플리케이션에 적합한 LLM을 선택하는 데 유용합니다.
본 연구는 특정 광 네트워크 QoT 설명 생성 작업에 국한되어 있으며, 다양한 네트워크 자동화 작업 및 LLM 패밀리에 대한 HuGLEN의 일반화 가능성을 추가적으로 검증할 필요가 있습니다.
👍