Mingxuan Xia, Yuhang Yang, Chao Ye, Shuai Zhu, Shenzhi Yang, Guangcheng Zhu, Yuhang Zhang, Cheng Peng, Haobo Wang, Siqing Wang
💡 개요
본 논문은 루브릭 기반 강화학습(Rubric-based RL)에서 발생하는 탐색 부족 문제(Unexplored Criteria, UC)와 억제된 기준 문제(Suppressed Criteria, SC)를 동시에 해결하기 위한 새로운 방법론인 CriPO(Criterion-Distilled Policy Optimization)를 제안합니다. CriPO는 온폴리시 자기 증류(on-policy self-distillation)를 활용하여, UC에 대해서는 지역적 KL 손실을 통해 누락된 행동을 주입하고, SC에 대해서는 반사실적 자기 증류를 통해 억제된 학습 신호를 복구합니다. 이를 통해 기존 방법론의 훈련-추론 불일치 문제를 해결하고, 의학 및 과학 벤치마크에서 2배 적은 최적화 단계로도 더 나은 성능을 달성함을 입증했습니다.
🔑 시사점 및 한계
•
루브릭 기반 강화학습에서 발생하는 두 가지 주요 문제점(UC, SC)을 동시에 해결하는 효과적인 방법론을 제시했습니다.
•
훈련-추론 불일치 문제를 해결하여 실제 추론 시 성능 저하를 방지했습니다.
•
온폴리시 자기 증류라는 독창적인 접근 방식을 통해 기존 방법보다 효율적인 학습을 달성했습니다.
•
본 연구는 향후 LLM의 개방형 작업 수행 능력 향상을 위한 새로운 방향을 제시할 것으로 기대됩니다.
•
SC 문제의 해결을 위해 모든 롤아웃의 모든 토큰에 대한 반사실적 학습 신호를 계산하는 것은 계산적으로 부담이 클 수 있으며, 이에 대한 효율적인 구현 방안이 추가적으로 연구될 필요가 있습니다.