Sign In

LLM Evaluation as Tensor Completion: Low Rank Structure and Semiparametric Efficiency

작성자
Haebom
카테고리
Empty

저자

Jiachun Li, David Simchi-Levi, Will Wei Sun

💡 개요

이 논문은 pairwise human judgments를 기반으로 하는 LLM 평가 데이터의 노이즈, 희소성, 비균일성 문제를 해결하고자 합니다. Bradley-Terry-Luce 모델 하에서 low-rank latent score tensor를 완성하는 semiparametric inference 문제로 접근하며, 이를 통해 ability gaps, win probabilities 등 다양한 추정치를 비편향적으로 계산하고 불확실성을 정량화하는 방법을 제시합니다. 특히, 정보 연산자가 등방적이지 않고 tangent space projection과 교환되지 않는 문제를 해결하기 위해 score-whitening 기법을 제안하여 안정적인 추론을 가능하게 합니다.

🔑 시사점 및 한계

LLM 평가에서 pairwise human judgments 데이터를 활용한 불확실성 정량화를 위한 원칙적인 프레임워크를 제공합니다.
pairwise 데이터를 이용한 low-rank 구조 추론에 대한 일반적인 접근 방식을 제시합니다.
정보 연산자의 비등방성과 tangent space projection과의 비-교환성 문제를 해결하기 위한 score-whitening 기법은 이론적으로 복잡성을 가지며, 실제 구현 및 대규모 데이터셋에서의 효율성 검증이 추가적으로 필요할 수 있습니다.