Sign In

Why Do Vision Language Models Struggle To Recognize Human Emotions?

Author
  • Haebom
Category
Empty

저자

Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh

💡 개요

최신 비전-언어 모델(VLM)이 인간의 감정을 인식하는 데 어려움을 겪는 이유를 탐구합니다. 연구에 따르면 VLM은 감정 데이터셋의 긴 꼬리 분포와 희귀 감정의 일반화 오류, 그리고 프레임 시퀀스의 시간적 정보를 효과적으로 처리하지 못하는 두 가지 취약점을 가지고 있습니다. 이를 해결하기 위해 본 논문은 대안적인 샘플링 전략과 '중간' 프레임의 정보를 자연어 요약으로 변환하여 VLM에 제공하는 다단계 맥락 풍부화 전략을 제안합니다.

🔑 시사점 및 한계

VLM이 감정 인식에서 실패하는 주요 원인을 데이터셋의 특성과 모델의 시간 정보 처리 능력 부족으로 규명했습니다.
제안된 맥락 풍부화 전략이 VLM의 감정 인식 성능을 향상시킬 수 있는 가능성을 제시했습니다.
마이크로 표현과 같이 짧고 미묘한 감정 신호를 포착하기 위한 VLM의 근본적인 시간 정보 처리 능력 개선이 여전히 중요한 과제로 남아있습니다.
👍