Sign In

Robust Reasoning Benchmark

Author
  • Haebom
Category
Empty

저자

Pavel Golikov, Evgenii Opryshko, Gennady Pekhimenko, Mark C. Jeffrey

💡 개요

대규모 언어 모델(LLM)은 표준 수학 벤치마크에서 높은 성능을 보이지만, 문제 해결 능력은 컨텍스트와 텍스트 형식에 따라 달라집니다. 본 논문은 AIME 2024 및 2025 데이터셋에 13가지 결정론적 텍스트 교란을 적용한 Robust Reasoning Benchmark(RRB)를 제안하며, 최신 모델들을 평가합니다. 그 결과, 최첨단 모델들은 대체로 견고했지만 Claude는 변환된 프롬프트를 거부하는 특이점을 보였고, 오픈 웨이트 모델들은 구조적 노이즈에 최대 54%의 정확도 하락을 보였습니다.

🔑 시사점 및 한계

LLM의 수학적 추론 능력은 텍스트 형식 변화에 매우 민감하며, 이는 단순히 성능 저하를 넘어 모델의 근본적인 추론 메커니즘을 와해시킬 수 있습니다.
특히 오픈 웨이트 모델들은 연쇄적 사고(chain-of-thought) 과정 자체에 의해 발생하는 주의력 희석(attention dilution) 문제에 취약하며, 이는 모델 크기에 관계없이 발생합니다.
미래의 LLM 아키텍처는 모델 자체의 연쇄적 사고 과정 내에 명시적인 컨텍스트 재설정 메커니즘을 통합하여 신뢰할 수 있는 추론을 달성해야 합니다.
👍