Sign In

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment

Author
  • Haebom
Category
Empty

저자

Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

💡 개요

AI 에이전트가 생명 과학 분야에 도입되면서 발견 속도를 높이는 능력은 오용 가능성도 내포합니다. 본 연구는 생물학 연구에서 위험 식별 및 거부 행동을 위한 벤치마크인 BioSecBench-Refusal을 제안합니다. 합법적인 분석인 61개의 Routine 태스크와 생물 보안 위험을 숨긴 46개의 Red-Team 태스크를 쌍으로 구성하여 평가했습니다.

🔑 시사점 및 한계

AI 에이전트는 합법적인 작업에 대해서도 과도하게 거부하는 경향을 보이며, 이는 실제 위험을 식별하는 능력을 저해할 수 있습니다.
에이전트의 추론 능력을 제한하는 API 필터는 위험 탐지에 비효율적이며, 충분한 추론 공간이 주어졌을 때 모델이 실제 위협을 더 잘 식별할 잠재력을 보여줍니다.
현재 벤치마크는 다양한 모델 구성 및 실제 생물 보안 시나리오를 포괄하지만, 복잡한 의학적, 사회적 맥락을 고려한 추가적인 평가가 필요합니다.
👍