본 연구는 Mixture-of-Experts (MoE) 모델의 라우터가 토큰의 은닉 상태만을 활용하는 기존 방식의 한계를 극복하기 위해, 시간적 및 스펙트럼적 특징을 활용하는 Attention-Aware Routing (AAR)을 제안합니다. AAR은 동결된 트랜스포머 구조에서 라우팅 파라미터만을 학습하여, 라우팅과 어텐션 메커니즘이 서로 연관되어 있음을 보여주며 성능 향상을 달성합니다.
🔑 시사점 및 한계
•
AAR은 기존 라우팅 방식 대비 GSM8K 성능을 +3.37%p 향상시키며, 특히 수학적 추론 능력을 개선합니다.
•
라우팅 변화가 어텐션 메커니즘 자체를 직접 수정하지 않으면서도 어텐션 가중치에 영향을 미쳐 모델의 문맥 이해를 재구성함을 입증합니다.
•
AAR은 생성되는 답변의 길이 조절에 영향을 미쳐, 잘못된 답변은 짧아지고 올바른 답변은 유지되는 경향을 보입니다.
•
AAR을 모든 레이어에 무분별하게 적용할 경우 사실 검색 성능이 저하될 수 있으며, 수학적 추론 성능은 네트워크 깊숙한 곳에 적용할 때 더 큰 이점을 얻습니다. 이는 깊이에 따른 검색-추론 간의 상충 관계를 시사하며, 레이어 선택적 AAR 적용이 각 레이어의 라우팅 관련 정보를 탐구하는 도구가 될 수 있습니다.