Public API 실시간 실행, Multi turn 워크플로우가 구축된 환경에서, 이 에이전트 자체를 학습시킨다.
이 학습을 통해, 에이전트는 리워드를 높이기 위해, 더 정답에 가까운 tool calling, 결과물을 만들게 된다.
보상 함수(Reward Function) 설계 방식
'무엇에 보상을 줄 것인가'
•
단위 테스트(Unit Tests): 코딩 에이전트의 경우, 모델이 작성한 코드가 테스트를 통과하면 보상을 준다.
•
실행 가능성: 도구 호출 문법이 올바른지, 실제 환경에서 에러 없이 실행되는지를 체크한다.
•
최종 결과 검증: 도구를 통해 가져온 정보가 사용자의 질문에 정확히 답했는지를 검증 루프(Verifier)가 판단한다.
성공적인 Agent RFT 를 위한 조건
1.
명확한 작업 정의: 성공에 대한 정의가 모호하지 않고 명확해야 합니다. 주관성을 배제해야 한다.
2.
데이터 일관성: 학습 및 평가 데이터셋이 실제 프로덕션의 데이터와 일치해야 한다.
3.
탐색을 통한 학습: 모델이 여러 번 시도했을 때 더 나은 결과를 낼 확률이 있어야 하며, 이를 통해 스스로 좋은 행동과 나쁜 행동의 차이를 배워야 한다.
4.
견고한 보상 함수: 모델이 보상 체계의 허점을 이용하지 않도록(Reward Hacking이 발생하지 않도록) 설계해야 하고, 단순히 성공/실패보다는 부분 점수를 주는 방식이 학습에 좋다.
Subscribe to 'Yejun Cheon'
Subscribe to my site to be the first to receive notifications and emails about the latest updates, including new posts.
Join Slashpage and subscribe to 'Yejun Cheon'!