Sign In

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

작성자
Haebom
카테고리
Empty

저자

Evgeny Shilov (Independent Researcher)

💡 개요

본 논문은 개발자가 실제 유지보수 작업을 위해 제품 수준의 코딩 에이전트를 점점 더 많이 사용하고, 이들이 고객 요청 스타일의 비영어권 언어로 작업을 제시한다는 점에 주목합니다. 이를 위해 5개의 실시간 오픈소스 저장소에서 추출한 25개의 러시아어 기반 코딩 작업으로 구성된 RuBench 1.0 벤치마크를 제안합니다. 이 벤치마크는 업스트림 유지보수자의 회귀 테스트를 사용하여 평가하며, 현재 모델 중 최고 성능은 78.7%의 작업 해결률을 보였습니다.

🔑 시사점 및 한계

실제 환경을 반영한 벤치마크의 필요성: 비영어권 언어로 작성된 실제 유지보수 작업을 포함하는 벤치마크는 코딩 에이전트의 실제 적용 가능성을 평가하는 데 중요합니다.
에이전트의 투명성 및 평가 방식의 중요성: 코딩 에이전트가 내부적으로 모델을 자동으로 교체하는 메커니즘은 평가의 신뢰성을 저해할 수 있으며, 배포된 제품 자체가 평가 대상임을 시사합니다.
데이터 오염 및 평가의 공정성 문제: 일부 에이전트에서 발견된 '오라클 헌팅'과 같은 데이터 오염 문제는 벤치마크의 공정성을 확보하기 위한 지속적인 노력이 필요함을 보여줍니다.
👍