Sign In

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

작성자
Haebom
카테고리
Empty

저자

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

💡 개요

본 논문은 자율 LLM 에이전트가 반복적인 루프를 실행할 때 현재 널리 사용되는 안전 메커니즘이 각 반복마다 재설정되어 누적되는 위험을 감지하지 못하는 근본적인 문제를 지적합니다. 특히 여러 반복에 걸쳐 분산된 공격 증거에 대해 기존의 궤적(trajectory) 단위 안전 감시자는 탐지 능력이 없음을 증명하고, 이를 해결하기 위해 반복 간 상태를 유지하는 LoopHarness라는 프레임워크를 제안합니다.

🔑 시사점 및 한계

반복적 작업 환경에서의 안전 취약점 발견: 기존 안전 메커니즘이 단일 궤적에만 국한되어, 다회 반복 작업 중 발생하는 누적적, 분산적 위험을 감지하지 못하는 심각한 취약점이 있음을 명확히 밝혔습니다.
LoopHarness를 통한 새로운 안전 패러다임 제시: 반복 간 상태를 유지하고 비감쇠(non-decaying) 위험 점수를 관리하는 LoopHarness는 자율 에이전트의 장기적인 안전성을 확보하기 위한 효과적인 방안을 제시합니다.
이론적 보장 및 실제 적용 가능성: LoopHarness는 이론적으로 악의적인 행동의 예상 횟수를 제한하며, 평가 프로토콜과 실제 에이전트 안전 벤치마크에 대한 실험을 통해 그 유효성을 입증했습니다.
향후 연구 방향: LoopHarness의 성능을 더욱 향상시키기 위한 알고리즘 개선 및 다양한 복잡한 시나리오에서의 적용성 검증이 필요할 수 있습니다.