Sign In

What Does Multi-Harness RL Learn? Credit Assignment and Portability in Coding Agents

작성자
Haebom
카테고리
Empty

저자

Chenqian Le, Jiayi Cheng, Qijia He, Runhao Li, Yinghao Li, Xupeng Chen

💡 개요

본 연구는 코드 생성 에이전트 학습 시 여러 실행 환경(harness)을 활용하는 멀티-하네스 강화학습(RL)에서 학습 방식의 차이가 에이전트의 성능에 미치는 영향을 분석합니다. 여러 태스크-하네스 쌍마다 별도의 그룹을 설정하는 방식(Within)과 태스크별로 하네스를 통합하는 방식(Cross)을 비교한 결과, 평가 환경이 학습 방식보다 에이전트 성능에 훨씬 큰 영향을 미치는 것으로 나타났습니다.

🔑 시사점 및 한계

평가 환경의 중요성: 에이전트 학습에서 사용되는 환경(harness)의 차이가 학습 방식의 차이보다 에이전트 성능에 지배적인 영향을 미칩니다.
크로스-하네스 학습의 한계: 여러 하네스를 통합하여 학습하는 방식(Cross)은 특정 하네스에 대한 적응 능력은 향상시키지만, 전반적인 포트폴리오(portable capability)를 향상시키지는 못하는 것으로 보입니다.
보고의 투명성 요구: 멀티-하네스 RL 연구에서는 학습 시 사용된 그룹화 경계(grouping boundary)를 명확히 명시하고, 학습에 사용되지 않은 새로운 환경(unseen harness)에서의 성능을 평가해야 합니다.