본 논문은 Vision-Language-Action (VLA) 모델이 사전 학습된 Vision-Language 모델로부터 얻는 풍부한 의미론적 표현이 로봇 시연 데이터에 대한 파인튜닝 과정에서 손상되어 일반화 성능이 저하되는 문제를 다룹니다. 이를 해결하기 위해, 인간의 거울 신경세포 이론에서 영감을 받아 로봇의 행동 표현이 의미론적 구조를 유지하는지 탐색하고, 플러그 앤 플레이 방식의 "Semantic Anchoring" 기법을 제안하여 의미론적 다양체에 행동 표현을 고정하고 공유 및 개별 채널로 분해합니다. 이 방법은 실험 결과, 인-디스트리뷰션 및 아웃-오브-디스트리뷰션 일반화 성능을 크게 향상시켰습니다.