Sign In

Semantic Anchoring for Robotic Action Representations

작성자
Haebom
카테고리
Empty

저자

Yuan Xu, Youheng Shi, Chengyang Li, Wentao Zhu, Yizhou Wang

💡 개요

본 논문은 Vision-Language-Action (VLA) 모델이 사전 학습된 Vision-Language 모델로부터 얻는 풍부한 의미론적 표현이 로봇 시연 데이터에 대한 파인튜닝 과정에서 손상되어 일반화 성능이 저하되는 문제를 다룹니다. 이를 해결하기 위해, 인간의 거울 신경세포 이론에서 영감을 받아 로봇의 행동 표현이 의미론적 구조를 유지하는지 탐색하고, 플러그 앤 플레이 방식의 "Semantic Anchoring" 기법을 제안하여 의미론적 다양체에 행동 표현을 고정하고 공유 및 개별 채널로 분해합니다. 이 방법은 실험 결과, 인-디스트리뷰션 및 아웃-오브-디스트리뷰션 일반화 성능을 크게 향상시켰습니다.

🔑 시사점 및 한계

VLA 모델에서 행동 표현의 의미론적 구조 유지가 작업 성공 및 일반화 성능에 필수적임을 입증했습니다.
제안된 Semantic Anchoring 기법은 기존 VLA 백본에 쉽게 적용 가능하며, 별도의 학습 없이 성능 향상을 가져올 수 있습니다.
제안된 방식은 추론 시 별도의 채널을 제거하므로 실제 배포되는 모델에는 영향을 미치지 않아 효율적입니다.
향후 연구에서는 다양한 종류의 로봇 작업 및 복잡한 환경에서의 일반화 성능 향상을 위한 추가적인 탐색이 필요합니다.
👍