Sign In

QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture

Author
  • Haebom
Category
Empty

저자

Shvetank Prakash, Andrew Cheng, Mark Mazumder, Arya Tschand, Varun Gohil, Jeffrey Ma, Jason Yik, Zishen Wan, Jessica Quaye, Elisavet Lydia Alvanaki, Avinash Kumar, Chandrashis Mazumdar, Tuhin Khare, Alexander Ingare, Ikechukwu Uchendu, Radhika Ghosal, Abhishek Tyagi, Chenyu Wang, Andrea Mattia Garavagno, Sarah Gu, Alice Guo, Grace Hur, Luca P. Carloni, Tushar Krishna, Ankita Nayak, Amir Yazdanbakhsh, Vijay Janapa Reddi

💡 개요

본 논문은 컴퓨터 아키텍처 분야의 LLM 평가를 위한 최초의 벤치마크인 QuArch를 제안합니다. QuArch는 프로세서 설계, 메모리 시스템 등 다양한 컴퓨터 아키텍처 영역을 포괄하는 2,671개의 질문-답변 쌍으로 구성되어 있으며, 최첨단 LLM들이 도메인 지식은 갖추었으나 분석, 설계, 구현 등 고차원적 사고를 요구하는 영역에서는 어려움을 겪는다는 점을 발견했습니다. 나아가 QuArch를 활용한 미세 조정이 현실적인 메모리 계층 설계 작업에서 성능을 향상시켜, 더 적은 면적과 더 많은 유효해결책을 얻을 수 있음을 보여주었습니다.

🔑 시사점 및 한계

컴퓨터 아키텍처 분야에서 LLM의 지식과 추론 능력을 체계적으로 평가하고 발전시킬 수 있는 첫 번째 벤치마크를 제공합니다.
최첨단 LLM이 컴퓨터 아키텍처의 고급 추론 능력, 특히 분석, 설계, 구현과 관련된 영역에서 여전히 개선의 여지가 있음을 명확히 보여줍니다.
QuArch 벤치마크를 활용한 미세 조정이 실제 컴퓨터 아키텍처 설계 작업에서 LLM의 성능을 유의미하게 향상시킬 수 있음을 입증합니다.
QuArch v1.0은 2,671개의 QA 쌍으로 구성되지만, 컴퓨터 아키텍처 분야의 모든 세부 영역을 완벽하게 포괄하기에는 한계가 있을 수 있으며, 향후 더 방대하고 다양한 문제 유형을 포함한 확장이 필요합니다.
👍