Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks
작성자
Haebom
카테고리
Empty
저자
Andrey Labunets
💡 개요
이 논문은 AI 모델의 안전성 강화를 위한 거부 훈련(refusal training)의 작동 원리를 탐구합니다. 특히, 거부 훈련이 모델 내부에 저차원의 거부 벡터 또는 부분 공간을 형성하며, 이는 안전하지 않은 질의에 대한 거부 반응을 매개한다는 것을 발견했습니다. 더 나아가, 다양한 거부 시작 구문(refusal prefixes)을 사용한 훈련이 거부 벡터의 안정성을 높여 벡터 제거 공격에 대한 방어력을 강화할 수 있음을 제시합니다.
🔑 시사점 및 한계
•
거부 훈련 과정에서 발생하는 활성화 값 변화가 거부 행동의 기하학적 구조를 형성하며, 이는 특정 벡터 또는 부분 공간으로 응축되는 경향이 있습니다.
•
다양한 거부 시작 구문을 훈련에 활용하는 것이 거부 벡터의 안정성을 증대시켜, 거부 훈련의 효과를 약화시키려는 공격에 대한 모델의 방어력을 강화합니다.
•
거부 훈련의 특성이 모델 구조에 어떻게 영구적으로 각인되는지에 대한 더 깊은 이론적 이해와 함께, 이러한 기하학적 특성이 다른 안전성 관련 특징에도 유사하게 나타나는지에 대한 추가 연구가 필요합니다.