본 논문은 대규모 언어 모델(LLM)이 모든 추론 과정을 출력 토큰에 명확하게 드러내지 않을 수 있다는 점을 지적하며, 의미적으로 관련 없는 '필러 토큰'을 사용하여 성능을 향상시키는 '보이지 않는 추론' 현상을 발견했습니다. 13개의 최신 LLM을 대상으로 한 실험 결과, 다수의 모델이 필러 토큰을 통해 추론 정확도를 최대 13%p까지 향상시켰으며, 이는 CoT(Chain-of-Thought) 모니터링으로는 감지하기 어려운 숨겨진 목적을 달성할 수 있음을 보여줍니다.