기존 강화학습(RL) 기반 대규모 언어 모델(LLM) 학습은 학습 문제의 품질에 매우 민감하나, 수동 큐레이션이나 단순 휴리스틱 필터에 의존하여 비효율적이었습니다. 본 논문은 소규모 신뢰할 수 있는 검증 데이터를 활용하여 학습 문제의 정책 그래디언트와 검증 그래디언트의 정렬을 기반으로 학습 문제를 선택하는 GradAlign 방법을 제안합니다. GradAlign은 불안정한 보상 신호, 분포 불균형, 낮은 유용성의 학습 데이터 환경에서 기존 방법보다 일관되게 우수한 성능을 보여주며, 방향성 그래디언트 신호의 중요성을 강조합니다.