본 연구는 기존의 언어 모델 평가 방식이 형식 준수 여부에 과도하게 집중하여 모델의 실제 문제 해결 능력을 제대로 평가하지 못하는 한계를 지적합니다. 이러한 문제를 해결하기 위해, 제안된 BERT-as-a-Judge는 문장 구조의 변화에 강인하면서도 의미적 정확성을 평가할 수 있는 경량화된 접근 방식을 제시합니다. 실험 결과, BERT-as-a-Judge는 기존 언어 모델 기반 평가와 유사한 성능을 보이면서도 계산 비용을 크게 줄여, 신뢰할 수 있고 확장 가능한 평가 방법을 제공합니다.