Sign In

GQLA: Group-Query Latent Attention for Hardware-Adaptive Large Language Model Decoding

Author
  • Haebom
Category
Empty

저자

Fanxu Meng

💡 개요

본 논문은 하드웨어 적응성을 높인 대규모 언어 모델(LLM) 디코딩을 위해 Group-Query Latent Attention (GQLA)이라는 새로운 어텐션 메커니즘을 제안합니다. GQLA는 기존 Multi-head Latent Attention (MLA)의 단일 디코딩 경로를 MQA와 GQA 두 가지 경로로 확장하여, 특정 하드웨어에 최적화된 경로를 재학습 없이 선택할 수 있게 합니다. 이를 통해 H100과 H20과 같은 다양한 GPU 환경에서 성능을 극대화하고, 텐서 병렬 처리와 멀티 토큰 예측(MTP)을 지원합니다.

🔑 시사점 및 한계

하드웨어 유연성 극대화: 단일 모델 가중치로 서로 다른 하드웨어 특성(H100의 높은 메모리 대역폭, H20의 일반적인 GPU)에 최적화된 디코딩 경로를 선택할 수 있어, 재학습 없이 광범위한 GPU 환경에서 효율적인 LLM 추론이 가능합니다.
성능 향상 및 확장성: GQA 경로를 통해 그룹별 캐시 확장을 지원하며, 최대 8-way 제로-중복 텐서 병렬 처리가 가능하여 모델 추론 성능과 확장성을 높입니다. 또한, TransGQLA 변환을 통해 기존 GQA 모델을 GQLA로 효율적으로 전환할 수 있습니다.
KV 캐시 압축 및 훈련 필요성: GQLA는 MLA 대비 KV 캐시를 크게 압축할 수 있지만, GQA 경로에서는 캐시 확장이 필요하며, 최적의 성능을 위해서는 모델 전환 및 검증 과정이 요구될 수 있습니다.
👍