Doctorina MedBench-ICD10: A Dialogue-Based Benchmark and Evaluation Framework for Agent-Based Medical AI
Author
Haebom
Category
Empty
저자
Anna Kozlova, Stanislau Salavei, Pavel Satalkin, Hanna Plotnitskaya, Sergey Parfenyuk
💡 개요
본 논문은 실제 의사-환자 상호작용을 시뮬레이션하는 Agent 기반 의료 AI 평가 프레임워크인 Doctorina MedBench를 제안합니다. 이 프레임워크는 전통적인 정형화된 시험 문제 풀이 방식 대신, 다단계 임상 대화를 모델링하여 진단, 검사, 치료 계획 수립 및 개인화된 추천까지 평가합니다. D.O.T.S.라는 독자적인 지표를 사용하여 임상적 정확성과 대화 효율성을 종합적으로 평가합니다.
🔑 시사점 및 한계
•
Agent 기반 의료 AI의 임상적 능력 평가에 있어 대화 시뮬레이션 방식이 전통적인 시험 방식보다 더 현실적인 평가를 제공할 수 있습니다.
•
D.O.T.S. 지표는 진단 정확성뿐만 아니라 의료 대화의 효율성까지 측정할 수 있어, AI 시스템의 실질적인 임상 적용 가능성을 높이는 데 기여합니다.
•
본 프레임워크는 AI 시스템뿐만 아니라 실제 의사의 임상 추론 능력 향상 및 평가에도 활용될 수 있는 잠재력을 가집니다.
•
향후 더 다양하고 복잡한 임상 시나리오를 포괄하고, 다양한 유형의 의료 AI 모델에 대한 적용성을 확장하는 연구가 필요합니다.