Evaluating LLMs When They Do Not Know the Answer: Statistical Evaluation of Mathematical Reasoning via Comparative Signals
작성자
Haebom
카테고리
未設定
저자
Zihan Dong, Zhixian Zhang, Yang Zhou, Can Jin, Ruijia Wu, Linjun Zhang
💡 개요
본 연구는 LLM의 수학적 추론 능력을 평가할 때 발생하는 높은 편차와 불안정한 순위 문제를 해결하기 위해, 정답을 모를 때도 생성하는 비교 신호(pairwise comparison signals)를 활용하는 통계적으로 효율적인 평가 프레임워크를 제안합니다. 제안된 방법은 표준적인 정답 결과와 보조 추론 체인에 대한 LLM의 비교 판단을 결합하여, 효율적인 영향 함수(EIF) 기반의 준모수적 추정기를 개발했습니다. 이를 통해 기존 방식 대비 분산 감소 및 더 정확한 모델 순위 평가를 달성했습니다.
🔑 시사점 및 한계
•
LLM이 어려운 문제에 대해 정답을 도출하지 못하더라도, 두 후보 해법 중 더 나은 것을 선택하는 비교 신호는 유용하게 활용될 수 있음을 시사합니다.
•
제안된 준모수적 추정기는 기존 샘플 평균 방식보다 통계적 효율성이 뛰어나며, 특히 샘플 수가 적거나 모델의 출력 노이즈가 클 때 더 안정적이고 정확한 성능 평가 및 모델 순위 정보를 제공합니다.
•
보조 추론 체인 생성 과정에서의 잠재적 편향성이나, 비교 신호 자체의 신뢰성을 더욱 심층적으로 분석하고 개선하는 연구가 필요합니다.