Sign In

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

작성자
Haebom
카테고리
Empty

저자

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

💡 개요

본 논문은 Vision-Language Model (VLM)에서 질문을 이미지 앞에 배치할 때 발생하는 "질문-먼저 패러독스" 현상을 규명합니다. 질문을 먼저 제시하면 VLM이 질문과 관련된 정보에 집중하게 되지만, 정작 답변 토큰은 질문에 거의 주의를 기울이지 못해 이미지 중심의 잘못된 답변을 생성하는 문제가 발생합니다. 이를 해결하기 위해 질문을 이미지의 앞뒤 모두에 배치하는 "질문 에코잉" 기법을 제안하며, 이 기법은 추가적인 학습 없이 성능을 크게 향상시킵니다.

🔑 시사점 및 한계

질문 에코잉은 VLM의 시각적 인식 단계를 질문과 답변 단계를 분리하여, 각 단계에 최적화된 프롬프트 설계를 통해 질문-먼저 패러독스를 효과적으로 해결합니다.
이미지 에코잉을 추가하면 디코더가 전체 이미지 뷰를 유지하는 데 도움을 주어 성능을 더욱 향상시킬 수 있습니다.
본 연구는 학습 없이 프롬프트 설계를 통해 VLM 성능을 개선할 수 있음을 입증했으며, 이는 향후 VLM 프롬프트 엔지니어링 연구에 중요한 기반을 제공합니다.
제안된 기법은 특정 VLM 아키텍처나 벤치마크에 국한되지 않고 여러 모델에서 일관된 성능 향상을 보여주지만, 복잡하거나 미묘한 시각적-언어적 추론이 요구되는 작업에서는 추가적인 연구가 필요할 수 있습니다.