Public API 실시간 실행, Multi turn 워크플로우가 구축된 환경에서, 이 에이전트 자체를 학습시킨다.
이 학습을 통해, 에이전트는 리워드를 높이기 위해, 더 정답에 가까운 tool calling, 결과물을 만들게 된다.
보상 함수(Reward Function) 설계 방식
'무엇에 보상을 줄 것인가'
•
단위 테스트(Unit Tests): 코딩 에이전트의 경우, 모델이 작성한 코드가 테스트를 통과하면 보상을 준다.
•
실행 가능성: 도구 호출 문법이 올바른지, 실제 환경에서 에러 없이 실행되는지를 체크한다.
•
최종 결과 검증: 도구를 통해 가져온 정보가 사용자의 질문에 정확히 답했는지를 검증 루프(Verifier)가 판단한다.
성공적인 Agent RFT 를 위한 조건
1.
명확한 작업 정의: 성공에 대한 정의가 모호하지 않고 명확해야 합니다. 주관성을 배제해야 한다.
2.
데이터 일관성: 학습 및 평가 데이터셋이 실제 프로덕션의 데이터와 일치해야 한다.
3.
탐색을 통한 학습: 모델이 여러 번 시도했을 때 더 나은 결과를 낼 확률이 있어야 하며, 이를 통해 스스로 좋은 행동과 나쁜 행동의 차이를 배워야 한다.
4.
견고한 보상 함수: 모델이 보상 체계의 허점을 이용하지 않도록(Reward Hacking이 발생하지 않도록) 설계해야 하고, 단순히 성공/실패보다는 부분 점수를 주는 방식이 학습에 좋다.
S’abonner à 'Yejun Cheon'
En vous abonnant à ce site, vous recevrez en avant-première les dernières mises à jour, comme les nouveaux articles, par notification et par e-mail.
Inscrivez-vous à Slashpage et abonnez-vous à 'Yejun Cheon' !