Sign In

Benchmarking Multimodal Large Language Models for Scientific Visualization Literacy

Author
  • Haebom
Category
Empty

저자

Patrick Phuoc Do, Chau M. Ta, Chaoli Wang

💡 개요

본 연구는 과학 시각화(SciVis) 리터러시 평가를 위한 멀티모달 대형 언어 모델(MLLM)들의 성능을 벤치마킹합니다. 49개 항목으로 구성된 표준화된 SciVis 리터러시 평가 테스트를 통해 6개의 MLLM을 평가했으며, 그 결과 MLLM들이 SciVis 리터러시에서 일관되지 않은 성능을 보이며, Gemini 모델이 가장 우수했지만 전반적으로 인간 참여자들의 성능에 미치지 못하는 경우가 많았습니다. 특히, 특정 시각화 기법 및 작업 유형에 따라 성능 차이가 크게 나타났습니다.

🔑 시사점 및 한계

MLLM의 SciVis 리터러시 평가는 AI 시스템의 전반적인 이해도를 측정하는 중요한 척도로 활용될 수 있습니다.
현재 MLLM들은 정량적 추정, 흐름 방향 해석, 근거 기반 인코딩 해석 등 특정 SciVis 작업에서 어려움을 겪고 있어 개선이 필요합니다.
본 연구는 닫힌 세계(closed-world) 프로토콜을 사용하였으며, 실제 다양한 환경에서의 MLLM 성능을 파악하기 위한 추가적인 연구가 필요합니다.
👍