ClawBench: Can AI Agents Complete Everyday Online Tasks?

작성자
Haebom
카테고리
Vacío

저자

Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du, Junwen Miao, Xuan Lu, Zhuofeng Li, Xingwei Qu, Zhengkang Guo, Yuanzhe Shen, Dingjie Song, Han Zhou, Tuney Zheng, Xian Wu, Hao Yu, Songcheng Cai, Yi Lu, Yunzhuo Hao, Minyi Lei, Liang Chen, Kai Zou, Huifeng Yin, Wendong Xu, Dongfu Jiang, Ping Nie, Jiaheng Liu, Wenhu Chen, Kelsey R. Allen

💡 개요

본 논문은 AI 에이전트가 실제 웹사이트에서 일상적인 온라인 업무를 얼마나 잘 수행할 수 있는지 평가하기 위한 새로운 벤치마크인 ClawBench를 제안합니다. ClawBench는 구매, 예약, 지원서 제출 등 144개 플랫폼에서 153가지의 실제 온라인 작업을 포함하며, 기존 벤치마크보다 복잡하고 현실적인 웹 환경을 반영합니다. 8개의 최첨단 AI 모델을 평가한 결과, 현재 모델들은 이러한 작업들을 성공적으로 완료하는 데 큰 어려움을 겪고 있으며, 이는 AI 에이전트의 발전 방향을 제시합니다.

🔑 시사점 및 한계

AI 에이전트의 실세계 적용 가능성을 평가하는 데 있어 실제 웹사이트 기반 벤치마크의 중요성을 강조합니다.
현재 AI 에이전트가 문서 기반 정보 활용, 다단계 웹 탐색, 복잡한 양식 작성 등 일상적인 온라인 업무 수행에 있어 상당한 성능 격차를 가지고 있음을 보여줍니다.
ClawBench는 AI 에이전트의 일반적인 보조 업무 수행 능력을 향상시키기 위한 연구 개발의 필요성을 제시합니다.
실제 웹사이트를 사용하므로 잠재적인 보안 및 윤리적 고려 사항이 필요하며, 벤치마크의 복잡성과 현실성으로 인해 평가 및 재현에 어려움이 있을 수 있습니다.
👍