TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment
작성자
Haebom
카테고리
Empty
저자
Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele
💡 개요
본 논문은 CLIP과 같은 시각-언어 모델에서 이미지와 텍스트 임베딩 간의 정렬 불균형 문제를 해결하기 위한 TEVI 프레임워크를 제안합니다. TEVI는 이미지 임베딩을 분리하기 위해 희소 오토인코더를 사용하고, 주어진 캡션을 기반으로 임베딩을 선택적으로 재구성하는 마스킹 모듈을 훈련합니다. 이를 통해 캡션에 설명된 속성은 보존하면서 불필요한 속성을 제거하여 시각-언어 정렬을 개선하고 검색 성능을 향상시킵니다.
🔑 시사점 및 한계
•
이미지 캡션의 정보 부족으로 인한 시각-언어 모델의 정렬 불균형 문제를 효과적으로 해결할 수 있습니다.
•
희소 오토인코더와 캡션 기반 마스킹 모듈을 통해 이미지 임베딩의 특정 부분을 제어하여 시각-언어 정렬을 개선할 수 있습니다.
•
실제 데이터셋에서 검색 성능 향상을 입증하여 다양한 시각-언어 관련 응용 분야에 기여할 수 있습니다.