본 논문은 LLM 기반 AI 에이전트가 전자 설계 자동화(EDA)의 복잡한 RTL-to-GDS 흐름을 얼마나 잘 수행하는지 평가하기 위해 FluxBench라는 체계적인 벤치마킹 프레임워크를 제안한다. 다양한 EDA 워크플로우에서 에이전트의 RTL 생성, 오류 수정, 도구 피드백 활용, 합성, 배치 및 라우팅, ECO 자동화 능력을 평가했으며, 토큰 효율성을 측정하는 Token ROI 지표를 도입했다.
🔑 시사점 및 한계
•
다양한 AI 에이전트 시스템 아키텍처는 동일한 기반 모델을 사용하더라도 최대 86.27%의 성능 차이를 보이며, 아키텍처 설계가 중요하다.
•
유사한 작업 성능을 보이는 시스템이라도 토큰 ROI는 최대 105.92배까지 차이가 날 수 있어, 비용 효율적인 설계 자동화에 대한 고려가 필요하다.
•
도메인 특화 스킬만으로는 대규모 EDA 시나리오에서 에이전트 성능 향상에 충분하지 않으며, 기반 모델의 능력과 에이전트 시스템 설계 모두 필수적이다.
•
본 연구는 현재 LLM 에이전트의 RTL-to-GDS 흐름 자동화 능력에 대한 현실적인 평가를 제공하지만, 더 광범위한 EDA 작업 및 다양한 기술 라이브러리에 대한 추가적인 벤치마킹과 에이전트 개선이 필요하다.