Sign In

AutoFyn Technical Report: Non-Parametric Expert Iteration for Long-Horizon Agents

작성자
Haebom
카테고리
Empty

저자

Adib Hasan, Daniel Schaffield, Akashnil Dutta, Tarik Adnan Moon

💡 개요

본 논문은 Expert Iteration 알고리즘에서 영감을 받은 AutoFyn이라는 에이전트 프레임워크를 제안합니다. AutoFyn은 모델 가중치 대신 검증된 보상 신호를 통해 지속되는 상태를 업데이트함으로써 여러 라운드에 걸쳐 고정된 모델을 적응시킵니다. 각 라운드는 새로운 모델 세션에서 시작하며, 지속적인 정보는 명시적인 인터페이스를 통해서만 재도입되어, 탐색, 계획, 검증 및 보상 학습의 반복적인 루프를 통해 에이전트의 성능을 향상시킵니다.

🔑 시사점 및 한계

장기적인 목표 달성을 위한 에이전트 학습 프레임워크: AutoFyn은 고정된 모델을 반복적인 학습 루프를 통해 점진적으로 개선함으로써, 복잡하고 장기적인 과제를 해결할 수 있는 에이전트를 구축하는 데 효과적입니다.
실제 문제 해결 능력 입증: 올림피아드 수학, 데이터 과학, 사이버 보안 분야에서 AutoFyn은 기존 코딩 에이전트보다 높은 성과를 보였으며, 실제 소프트웨어 취약점 발견 및 보고에도 성공했습니다.
모델 재학습 비용 절감 가능성: 매 라운드마다 모델 전체를 재학습하는 대신, 지속되는 상태를 업데이트하는 방식으로 효율성을 높일 수 있습니다.
한계점: 본 기술 보고서에서는 AutoFyn의 프레임워크와 인터페이스를 형식화하고 시연하는 데 초점을 맞추었으며, 실제 프레임워크의 완전한 구현이나 다양한 환경에서의 포괄적인 성능 분석은 향후 연구 과제로 남을 수 있습니다. 지속적인 상태의 설계와 업데이트 방식이 에이전트 성능에 미치는 영향에 대한 심층적인 분석도 필요할 수 있습니다.