Sign In

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

Author
  • Haebom
Category
Empty

저자

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Sagnik Ray Choudhury, Atriya Sen

💡 개요

본 논문은 대규모 언어 모델(LLM)의 프롬프트 강건성이 객관적인 질문과 주관적인 질문에서 어떻게 다른지를 탐구합니다. 연구팀은 다양한 LLM 모델군을 대상으로 객관적 데이터셋과 주관적 데이터셋을 평가하며, 여러 유형의 프롬프트 변화에 대한 모델의 일관성을 측정했습니다. 그 결과, 프롬프트 강건성이 질문 유형, 프롬프트 변화 방식, 그리고 모델 자체에 따라 달라진다는 것을 밝혔습니다.

🔑 시사점 및 한계

LLM의 가치나 신념을 평가할 때, 객관적인 질문과 주관적인 질문에 대한 프롬프트 강건성 차이를 고려해야 합니다.
프롬프트의 미묘한 변화에도 LLM의 응답이 달라질 수 있으며, 특히 주관적인 질문에서는 이러한 변화가 더 두드러질 수 있습니다.
본 연구는 특정 모델군과 데이터셋에 집중하였으므로, 더 광범위한 모델과 데이터셋을 대상으로 한 추가적인 연구가 필요합니다.
👍