Sign In

LightEMMA: A Longitudinal Evaluation of Vision-Language Models for Autonomous Driving

작성자
Haebom
카테고리
Empty

저자

Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu

💡 개요

본 논문은 자율 주행 분야에서 비전-언어 모델(VLM)의 성능 향상이라는 가정을 체계적으로 검증하기 위해 LightEMMA라는 새로운 장기 평가 프레임워크를 제안합니다. 이 프레임워크는 모델별 미세 조정, 구조 변경, 프롬프트 엔지니어링 없이 VLM의 본질적인 주행 능력을 평가합니다. 15개의 VLM을 nuScenes 예측 벤치마크에서 평가한 결과, 모델 규모 증가 및 일반 추론 능력 향상에도 불구하고 VLM 세대가 일관적으로 더 나은 주행 성능을 달성하지 못한다는 사실을 발견했습니다.

🔑 시사점 및 한계

현재 VLM 기술의 발전이 자율 주행 성능 향상으로 직접적으로 이어지지 않을 수 있으며, 모델의 일반적인 능력 향상이 특정 도메인에서의 성능 보장을 의미하지는 않습니다.
VLM은 과거 행동에 과도하게 의존하거나 시각적 단서를 통합하는 데 어려움을 겪는 등 반복적인 실패 모드를 보이며, 이는 자율 주행 시스템의 안전성 확보에 대한 심층적인 연구의 필요성을 시사합니다.
본 연구는 VLM의 본질적인 주행 능력을 평가했지만, 실제 자율 주행 환경에서 필요한 복잡한 시나리오나 장기적인 의사 결정 능력에 대한 평가 부족은 한계로 남습니다. 또한, 도메인 특화 적응의 구체적인 방법론 개발이 향후 연구 과제로 남아있습니다.