GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning

작성자
Haebom
카테고리
Vacío

저자

Ningyuan Yang, Weihua Du, Weiwei Sun, Sean Welleck, Yiming Yang

💡 개요

기존 강화학습(RL) 기반 대규모 언어 모델(LLM) 학습은 학습 문제의 품질에 매우 민감하나, 수동 큐레이션이나 단순 휴리스틱 필터에 의존하여 비효율적이었습니다. 본 논문은 소규모 신뢰할 수 있는 검증 데이터를 활용하여 학습 문제의 정책 그래디언트와 검증 그래디언트의 정렬을 기반으로 학습 문제를 선택하는 GradAlign 방법을 제안합니다. GradAlign은 불안정한 보상 신호, 분포 불균형, 낮은 유용성의 학습 데이터 환경에서 기존 방법보다 일관되게 우수한 성능을 보여주며, 방향성 그래디언트 신호의 중요성을 강조합니다.

🔑 시사점 및 한계

RL 학습에서 학습 문제 선택의 중요성을 강조하며, 그래디언트 정렬을 통한 적응형 커리큘럼 학습의 효과성을 입증했습니다.
불안정한 학습 환경에서도 안정적인 정책 최적화와 최종 성능 향상에 기여할 수 있는 새로운 데이터 선택 방법론을 제시합니다.
제안된 방법론의 효율성을 검증하기 위해 사용된 검증 데이터셋의 크기와 품질에 대한 추가적인 연구가 필요할 수 있습니다.
👍