본 논문은 LLM의 추론 능력 향상을 위해 기존의 방법론들이 가진 단점을 극복할 새로운 접근법을 제안합니다. 테스트 시점 스케일링의 핵심인 후보 추론 체인 선택 문제를 다루며, 개별 모델의 오류에 취약한 자기 일관성(self-consistency)과 레이블링 데이터 및 분포 외 성능 저하 문제가 있는 학습된 보상 모델(trained reward models)의 대안으로, 독립적으로 훈련된 모델들 간의 최종 답안 일치 정도를 활용하는 '교차 모델 합의(cross-model consensus)'를 제안합니다.