Sign In

T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

Author
  • Haebom
Category
Empty

저자

Shao-Jun Xia, Huixin Zhang, Zhengzhong Tu

💡 개요

본 논문은 시각적 인-컨텍스트 학습(VICL)에서 발생하는 데모와 쿼리 간의 작업 불일치 문제를 해결하기 위해 T2T-VICL이라는 프레임워크를 제안합니다. T2T-VICL은 묵시적인 텍스트 안내를 통해 서로 다른 시각적 작업 간의 관계를 학습하고, 이를 바탕으로 작업 불일치 상황에서도 효율적인 VICL 성능을 달성합니다.

🔑 시사점 및 한계

묵시적 텍스트 안내를 통한 작업 불일치 VICL 가능성 입증: T2T-VICL은 명시적으로 작업 이름을 언급하지 않고도 데모와 쿼리 간의 시각적 변화를 텍스트로 표현하여 서로 다른 작업 간의 VICL을 성공적으로 수행할 수 있음을 보여줍니다.
경량 모델에서도 효과적인 교차 작업 VICL 능력 구현: 대규모 교사 VLM이 생성한 교차 작업 관계 데이터를 활용하여 경량 학생 VLM에 능력을 증류함으로써, 효율적인 교차 작업 VICL을 가능하게 합니다.
성능 향상 및 향후 연구 방향 제시: 12개의 저수준 시각 작업 및 20개 이상의 교차 작업 쌍에 대한 실험에서 일관된 성능 향상을 보였으며, 이는 교차 작업 VICL의 잠재력과 한계를 동시에 드러내며 향후 연구 방향을 제시합니다.
👍