본 논문은 대규모 언어 모델(LLM)이 생성된 샘플과 평가 점수를 문맥 내 학습(In-Context Learning, ICL)의 예시로 활용하여 출력을 반복적으로 개선하는 현상의 이론적 근거를 제시합니다. 연구진은 점수 조건부 ICL이 정책 경사 최적화(policy gradient optimization)와 구조적으로 일치함을 보였으며, 자기 주의 메커니즘이 특정 가중치 행렬 구성 하에서 REINFORCE 알고리즘과 유사한 보상 가중치 집계를 구현할 수 있음을 증명합니다. 이를 통해 LLM이 점수 정보를 활용하여 출력 분포를 고득점 예시 쪽으로 이동시키며, 주의 가중치가 예시 점수와 높은 상관관계를 보인다는 것을 실험적으로 입증합니다.