Why Do Vision Language Models Struggle To Recognize Human Emotions?
Author
Haebom
Category
Empty
저자
Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh
💡 개요
최신 비전-언어 모델(VLM)이 인간의 감정을 인식하는 데 어려움을 겪는 이유를 탐구합니다. 연구에 따르면 VLM은 감정 데이터셋의 긴 꼬리 분포와 희귀 감정의 일반화 오류, 그리고 프레임 시퀀스의 시간적 정보를 효과적으로 처리하지 못하는 두 가지 취약점을 가지고 있습니다. 이를 해결하기 위해 본 논문은 대안적인 샘플링 전략과 '중간' 프레임의 정보를 자연어 요약으로 변환하여 VLM에 제공하는 다단계 맥락 풍부화 전략을 제안합니다.
🔑 시사점 및 한계
•
VLM이 감정 인식에서 실패하는 주요 원인을 데이터셋의 특성과 모델의 시간 정보 처리 능력 부족으로 규명했습니다.
•
제안된 맥락 풍부화 전략이 VLM의 감정 인식 성능을 향상시킬 수 있는 가능성을 제시했습니다.
•
마이크로 표현과 같이 짧고 미묘한 감정 신호를 포착하기 위한 VLM의 근본적인 시간 정보 처리 능력 개선이 여전히 중요한 과제로 남아있습니다.