본 연구는 언어 모델의 내부 활성화를 이해하기 위한 도구인 Activation Oracles(AOs)가 학습 데이터와 목표에 따라 학습된 시스템이며, 객관적인 정보 추출기가 아님을 보여줍니다. 특히, 특정 개념을 내부적으로 활용하면서도 직접적인 표현을 회피하도록 미세 조정된 모델에 대해 훈련된 AOs가 해당 개념을 회복하지 못하는 '개념별 비읽기(anti-readers)' 현상을 발견했습니다. 이러한 실패는 모델의 표현력 부족이 아닌, AO 자체의 읽기 경로에서 발생하는 것으로 나타났습니다.