SWE-Milestone: Evaluating AI Agents on Continuous Software Evolution
Author
Haebom
Category
Empty
저자
Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin Yang, Dhruv Parikh, Rajgopal Kannan, Le Cong, Mengdi Wang, Qian Zhang, Viktor Prasanna, Xiangru Tang, Xingyao Wang
💡 개요
본 연구는 실세계 소프트웨어의 지속적인 진화 요구사항에 대응하기 위해 AI 에이전트를 평가하는 새로운 벤치마크인 SWE-Milestone을 제안합니다. 기존 벤치마크가 단편적인 코딩 작업에 집중하는 것과 달리, SWE-Milestone은 기능적으로 cohesive한 개발 목표를 나타내는 Milestone DAG를 재구성하여 연속적인 마일스톤 단위의 작업을 평가합니다. 이를 통해 AI 에이전트가 시스템 무결성을 유지하고 오류 축적을 제한하는 능력을 측정하며, 12개의 최첨단 모델을 평가한 결과 연속적인 환경에서 성능이 크게 하락하는 취약점을 발견했습니다.
🔑 시사점 및 한계
•
AI 에이전트가 장기적인 소프트웨어 유지보수 및 오류 확산에 심각한 어려움을 겪고 있음을 보여줍니다.
•
실제 소프트웨어 진화의 복잡성과 기술 부채를 고려한 새로운 평가 프레임워크의 필요성을 강조합니다.
•
현재 AI 에이전트의 성능이 단기적인 작업에는 뛰어나지만, 지속적이고 개방적인 요구사항을 다루는 데는 한계가 있음을 시사합니다.
•
Milestone DAG 구축 과정의 노이즈 처리 및 Milestone의 정의에 대한 추가적인 연구가 필요할 수 있습니다.