Sign In

Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models

작성자
Haebom
카테고리
Empty

저자

Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan

💡 개요

본 연구는 DeepSeek-V2에서 도입된 Multi-head Latent Attention (MLA)의 핵심 메커니즘인 저랭크 병목(cKV)이 추론 시 KV 캐시를 81%까지 줄이는 효과에도 불구하고, 이 병목이 어떤 정보를 보존하고 어떤 정보를 버리는지, 그리고 트랜스포머 회로를 어떻게 재구성하는지에 대한 첫 번째 포괄적인 기계적 해석학적 연구를 제시합니다. 연구 결과, cKV 병목은 순수한 내용 표현을 학습하여 개체 정체성은 보존하지만 위치 정보는 폐기하며, 이는 RoPE를 통해 내용과 위치를 분리하는 MLA의 작동 방식을 입증합니다.

🔑 시사점 및 한계

내용과 위치 정보의 분리: MLA의 저랭크 병목(cKV)은 개체 정체성과 같은 순수한 내용 정보를 효과적으로 보존하는 반면, 위치 정보는 폐기하여 내용과 위치 정보를 명확하게 분리합니다.
트랜스포머 회로 재구성: MLA는 기존의 다중 헤드 어텐션(MHA)과 달리 귀납 헤드가 단일 계층에 집중되고, 특정 계층이 '의미론적 허브' 역할을 수행하는 등 트랜스포머 내부 회로 구조를 재구성합니다.
병목의 과도한 용량: 분석 결과, MLA의 병목은 평균적으로 46%의 용량만 사용하며, 이는 MLA가 단순히 주의를 수동적으로 압축하는 것이 아니라 내용, 위치, 회로 구조를 조직하는 방식을 적극적으로 재편함을 시사합니다.
연구 범위 제한: 본 연구는 114M 파라미터 모델에 대한 분석 결과를 제시하며, 더 큰 모델이나 다른 데이터셋에서의 일반화 가능성은 추가 연구가 필요합니다.
👍