AEVAL: From Anecdotal to Deterministic Testing for Agentic Skill Workflows
Author
Haebom
Category
Empty
저자
Tejas Singh Anand, Yuet Ying Christina Wang, Wanting Jiang, Steve Masson, Tian Zheng, Bingjie Zhou
💡 개요
본 논문은 LLM 에이전트의 핵심 기능인 '스킬'의 품질을 평가하는 현재의 주관적이고 재현 불가능한 방식을 자동화된 결정론적 테스트 파이프라인인 AEVAL로 대체합니다. AEVAL은 변경 사항 발생 시 에이전트 실행기와 평가자를 분리하여, 자체 수정으로 인한 평가 편향을 방지하고 재현 가능하며 검증 가능한 품질 신호를 생성합니다. 이를 통해 개발자는 수동 검증 없이도 스킬 변경의 영향을 즉각적으로 파악하고, 시장에서 발생하는 잠재적인 회귀 문제를 예방할 수 있습니다.
🔑 시사점 및 한계
•
LLM 에이전트 스킬 개발에서 CI/CD 통합을 통한 자동화된 결정론적 평가의 중요성 증대
•
에이전트의 자체 수정으로 인한 평가 편향(self-correction bias)을 형식적으로 정의하고 해결하는 방법론 제시
•
실행기(executor)와 평가자(grader)의 구조적 분리를 통해 평가의 신뢰성과 재현성 확보
•
(한계점 또는 향후 과제) AEVAL이 모든 종류의 에이전트 작업 워크플로우에 대해 완벽하게 적용될 수 있는지, 혹은 추가적인 스킬 유형에 대한 지원이 필요할 수 있음.