Sign In

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

Author
  • Haebom
Category
Empty

저자

Kexin Huang, Junkang Wu, Jinda Lu, Shuo Yang, Chiyu Ma, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

💡 개요

본 논문은 대규모 언어 모델(LLM)의 강화학습(RL) 훈련 시 발생하는 불안정성을 해결하기 위해 ARMOR(Anchor Rollout and Mixed Optimization for RL) 프레임워크를 제안합니다. ARMOR은 오프라인 정책(off-policy) 데이터를 활용하여 기존의 솔루션 패턴을 보존하는 '앵커 롤아웃'과, 보조 손실 함수 없이 제어된 탐색을 가능하게 하는 '혼합 최적화'라는 두 가지 핵심 구성 요소를 통해 훈련 불안정성의 주요 원인인 과최적화를 방지합니다. 이를 통해 ARMOR은 검증 성능 저하(validation collapse)를 효과적으로 완화하고 장기간 훈련에서도 지속적인 성능 향상을 가능하게 합니다.

🔑 시사점 및 한계

LLM 강화학습 훈련의 고질적인 불안정성 문제를 해결하기 위한 새로운 접근 방식을 제시합니다.
기존의 KL 발산 정규화만으로는 부족했던 참조 분포의 포괄적인 커버리지를 보장하는 메커니즘을 도입했습니다.
제안된 ARMOR 프레임워크는 오프라인 데이터를 능동적으로 활용하여 훈련 안정성을 높이고 일반화 성능을 개선할 수 있습니다.
추가적인 보조 손실 함수 없이도 제어된 탐색을 가능하게 하여 훈련 파이프라인을 간소화할 수 있습니다.
특정 추론 벤치마크에서의 효과를 검증하였지만, 다양한 LLM 아키텍처 및 태스크에 대한 일반화 성능 추가 검증이 필요합니다.
👍