Sign In

Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

작성자
Haebom
카테고리
Empty

저자

Rares A. C. Diaconescu, Iulia Slanina, Alina Florea, Andrei B. Trache, Miruna E. Coroi, Anne Arzberger, Jie Yang, Enrico Liscio

💡 개요

본 연구는 언어 모델의 독성(toxicity) 감소가 보편적인 규범을 넘어 개인의 민감도에 맞춰져야 함을 주장하며, 재학습 없이 사용자의 독성 민감도에 맞춰 언어 생성을 개인화하는 새로운 훈련 없는(training-free) 방법론들을 제안합니다. 제안된 방법론들은 디코딩 전, 중, 후 단계에서 평가되었으며, PRISM 데이터셋을 기반으로 한 독성 민감도 목표에 대해 28-47%의 오류 감소 효과를 보였습니다. 하지만, 이러한 개인화는 언어 모델의 전반적인 품질과 효과성 간의 근본적인 상충 관계를 드러내며, 독성 민감도 조정이 본질적으로 다중 목표 문제임을 시사합니다.

🔑 시사점 및 한계

사용자의 주관적이고 맥락 의존적인 독성 민감도를 반영하여 언어 모델의 유해 콘텐츠 생성을 개인화할 수 있는 훈련 없는 효과적인 방법론이 존재함을 보여줍니다.
개인화된 독성 민감도 조정은 언어 모델의 전반적인 언어 품질을 저하시킬 수 있다는 중요한 상충 관계를 제시하며, 실제 적용 시 균형점을 찾아야 함을 시사합니다.
다양한 추론 시간 개입 단계를 포괄적으로 평가하고 그 효과를 비교 분석하여, 향후 개인화된 언어 모델 정렬 연구에 대한 중요한 기초 자료를 제공합니다.
👍