본 논문은 하드웨어 적응성을 높인 대규모 언어 모델(LLM) 디코딩을 위해 Group-Query Latent Attention (GQLA)이라는 새로운 어텐션 메커니즘을 제안합니다. GQLA는 기존 Multi-head Latent Attention (MLA)의 단일 디코딩 경로를 MQA와 GQA 두 가지 경로로 확장하여, 특정 하드웨어에 최적화된 경로를 재학습 없이 선택할 수 있게 합니다. 이를 통해 H100과 H20과 같은 다양한 GPU 환경에서 성능을 극대화하고, 텐서 병렬 처리와 멀티 토큰 예측(MTP)을 지원합니다.