Sign In

Explaining BiomedCLIP with Weighted Banzhaf Interactions Supported by Tree-Gram Parsing

작성자
Haebom
카테고리
Empty

저자

Jakub Rymarski (University of Warsaw, Poland), Adam Rempa{\l}a (University of Warsaw, Poland), Bart{\l}omiej Sobieski (University of Warsaw, Poland), Przemys{\l}aw Biecek (University of Warsaw, Poland)

💡 개요

본 연구는 의료 분야에서 Vision-Language Model (VLM)의 해석 가능성을 높이기 위한 새로운 설명 방법론인 ParseFIxLIP을 제안합니다. 기존 방법론은 의료 용어의 토큰화 단편화로 인해 의미론적으로 일관되지 않은 설명이 발생하는 문제를 해결하기 위해, Tree-Gram Parsing을 Banzhaf 상호작용 게임에 통합하여 의미론적으로 관련된 토큰을 그룹화합니다. 이 방법을 통해 복잡한 의료 개념의 단편화를 완화하고, VLM의 의사 결정 과정에 대한 직관적이고 임상적으로 관련된 통찰력을 제공합니다.

🔑 시사점 및 한계

의료 분야 VLM의 설명 가능성 향상에 기여하며, 임상 환경에서의 책임감 있는 배포를 위한 중요한 발판을 마련합니다.
기존 설명 방법론의 토큰화 단편화 문제를 해결하여, 더 정확하고 의미론적으로 일관된 교차 모달리티 속성 분석을 가능하게 합니다.
특히 긴 캡션이나 복잡한 의료 용어에 대해 높은 차원의 데이터 속에서도 통계적 강건성과 의미론적 간결성을 유지합니다.
향후 연구에서는 다양한 VLM 아키텍처 및 다른 의료 도메인으로의 확장 가능성을 탐색할 필요가 있습니다.
👍