본 논문은 MoE LLM의 세 가지 주요 문제점인 부하 불균형, 파라미터 중복, 통신 오버헤드를 해결하기 위해 동적 전문가 클러스터링과 구조적 압축을 결합한 통합 프레임워크를 제안합니다. 제안된 방법은 파라미터 및 활성화 유사성을 융합한 메트릭을 사용하여 전문가를 주기적으로 재그룹화하는 온라인 클러스터링 기법을 통해 전문가 활용을 안정화하며, 라우터의 의미론적 임베딩 능력을 활용하여 훈련 중 모델 아키텍처를 동적으로 재구성하여 상당한 효율성 향상을 달성합니다.
🔑 시사점 및 한계
•
MoE LLM의 핵심 난제인 부하 불균형, 파라미터 중복, 통신 오버헤드를 효과적으로 동시에 해결하는 새로운 통합 프레임워크를 제시합니다.
•
동적 전문가 클러스터링과 구조적 압축을 통해 파라미터 수를 획기적으로 줄이고(약 80%), 처리량을 향상시키며(10~20%), 전문가 부하 분산을 개선하는(3배 이상) 우수한 성능을 입증합니다.
•
훈련 중 동적으로 모델 아키텍처를 재구성하는 능력을 활용하여 MoE LLM의 확장성, 효율성 및 메모리 효율성을 향상시킬 수 있는 새로운 가능성을 제시합니다.
•
제안된 클러스터링 및 압축 기법의 최적화 정도와 동적 재구성 빈도에 따른 성능 변화에 대한 추가적인 연구가 필요하며, 다양한 하드웨어 환경에서의 성능 검증이 요구됩니다.