본 연구는 과학 시각화(SciVis) 리터러시 평가를 위한 멀티모달 대형 언어 모델(MLLM)들의 성능을 벤치마킹합니다. 49개 항목으로 구성된 표준화된 SciVis 리터러시 평가 테스트를 통해 6개의 MLLM을 평가했으며, 그 결과 MLLM들이 SciVis 리터러시에서 일관되지 않은 성능을 보이며, Gemini 모델이 가장 우수했지만 전반적으로 인간 참여자들의 성능에 미치지 못하는 경우가 많았습니다. 특히, 특정 시각화 기법 및 작업 유형에 따라 성능 차이가 크게 나타났습니다.