# Agent RFT

![Agent Reinforcement Fine Tuning – Will Hang & Cathy Zhou, OpenAI](https://youtu.be/p1CmPZ2j6Lk?si=OKTcW3b6h8mcPC_M)

### Agent RFT 란

도구 호출(Tool Calling)과 내부 워크플로우를 강화학습으로 학습시키는 방법론.

Public API 실시간 실행, Multi turn 워크플로우가 구축된 환경에서, 이 에이전트 자체를 학습시킨다.

이 학습을 통해, 에이전트는 리워드를 높이기 위해, 더 정답에 가까운 tool calling, 결과물을 만들게 된다.

### 보상 함수(Reward Function) 설계 방식

'무엇에 보상을 줄 것인가'

- **단위 테스트(Unit Tests):** 코딩 에이전트의 경우, 모델이 작성한 코드가 테스트를 통과하면 보상을 준다.

- **실행 가능성:** 도구 호출 문법이 올바른지, 실제 환경에서 에러 없이 실행되는지를 체크한다.

- **최종 결과 검증:** 도구를 통해 가져온 정보가 사용자의 질문에 정확히 답했는지를 검증 루프(Verifier)가 판단한다.

### 성공적인 Agent RFT 를 위한 조건

1. **명확한 작업 정의:** 성공에 대한 정의가 모호하지 않고 명확해야 합니다. 주관성을 배제해야 한다.

2. **데이터 일관성:** 학습 및 평가 데이터셋이 실제 프로덕션의 데이터와 일치해야 한다.

3. **탐색을 통한 학습:** 모델이 여러 번 시도했을 때 더 나은 결과를 낼 확률이 있어야 하며, 이를 통해 스스로 좋은 행동과 나쁜 행동의 차이를 배워야 한다.

4. **견고한 보상 함수:** 모델이 보상 체계의 허점을 이용하지 않도록(Reward Hacking이 발생하지 않도록) 설계해야 하고, 단순히 성공/실패보다는 부분 점수를 주는 방식이 학습에 좋다.

For the site tree, see the [root Markdown](https://slashpage.com/yejun-cheon.md).
