대규모 언어 모델(LLM)은 표준 수학 벤치마크에서 높은 성능을 보이지만, 문제 해결 능력은 컨텍스트와 텍스트 형식에 따라 달라집니다. 본 논문은 AIME 2024 및 2025 데이터셋에 13가지 결정론적 텍스트 교란을 적용한 Robust Reasoning Benchmark(RRB)를 제안하며, 최신 모델들을 평가합니다. 그 결과, 최첨단 모델들은 대체로 견고했지만 Claude는 변환된 프롬프트를 거부하는 특이점을 보였고, 오픈 웨이트 모델들은 구조적 노이즈에 최대 54%의 정확도 하락을 보였습니다.