본 연구는 인간 평가자조차도 동의하지 못하는 언어 모델의 행동적 충실성(behavioral faithfulness)을 측정하는 새로운 방법론을 제안합니다. 1억 4600만 개의 매개변수를 가진 소규모의 목적 지향적인 감사(auditor) 모델을 개발하여, 훈련 데이터에 없던 생성 모델의 속임수(sycophancy), 의존성 조장, 허위 기억(confabulated memories) 등을 높은 정확도로 탐지합니다. 이는 최첨단 제로샷(zero-shot) 평가 모델이나 인간 평가자보다 우수한 성능을 보입니다.