본 논문은 대규모 언어 모델(LLM)의 강화학습(RL) 훈련 시 발생하는 불안정성을 해결하기 위해 ARMOR(Anchor Rollout and Mixed Optimization for RL) 프레임워크를 제안합니다. ARMOR은 오프라인 정책(off-policy) 데이터를 활용하여 기존의 솔루션 패턴을 보존하는 '앵커 롤아웃'과, 보조 손실 함수 없이 제어된 탐색을 가능하게 하는 '혼합 최적화'라는 두 가지 핵심 구성 요소를 통해 훈련 불안정성의 주요 원인인 과최적화를 방지합니다. 이를 통해 ARMOR은 검증 성능 저하(validation collapse)를 효과적으로 완화하고 장기간 훈련에서도 지속적인 성능 향상을 가능하게 합니다.
🔑 시사점 및 한계
•
LLM 강화학습 훈련의 고질적인 불안정성 문제를 해결하기 위한 새로운 접근 방식을 제시합니다.