Sign In

Don't Blame the Large Language Model: How Agent Harness Evolution Shapes Coding Agent Quality

Author
  • Haebom
Category
Empty

저자

Oussama Ben Sghaier, Hao Li, Bram Adams, Ahmed E. Hassan

💡 개요

본 논문은 코딩 에이전트의 품질에 있어 LLM 자체보다 미들웨어인 에이전트 하네스의 진화가 미치는 영향을 최초로 제어된 종단 연구를 통해 분석합니다. 5개의 주요 오픈소스 에이전트 하네스의 급격한 개발 속도와 방대한 이슈들을 관찰하고, 특히 Qwen Code CLI의 35개 순차적 릴리스를 고정된 LLM 환경에서 평가하여 에이전트 하네스 업데이트가 에이전트의 효과성 및 효율성에 미치는 영향을 측정합니다. 연구 결과는 구체적인 개발 패턴과 아키텍처 구성 요소가 품질 변동의 원인임을 밝혀내고, 개별 풀 리퀘스트와 측정된 품질 변화를 연결하는 질적 증거를 제시합니다.

🔑 시사점 및 한계

코딩 에이전트의 품질 문제는 LLM 자체의 성능뿐만 아니라 이를 둘러싼 에이전트 하네스의 설계 및 업데이트 방식에 크게 좌우될 수 있습니다.
에이전트 하네스의 급격한 개발 속도와 복잡성은 의도치 않은 품질 회귀를 초래할 수 있으며, 개발자들은 이러한 요소들을 면밀히 모니터링하고 관리해야 합니다.
본 연구는 특정 에이전트 하네스(Qwen Code CLI)에 집중하여 분석했으며, 다른 에이전트 하네스나 다양한 LLM과의 조합에 대한 일반화 가능성은 추가 연구가 필요합니다.
👍