본 논문은 음성 및 3D 얼굴 애니메이션 생성을 통합하는 옴니모달 대규모 언어 모델(OLLM)의 연구 공백을 해결합니다. 제안된 Ex-Omni 프레임워크는 LLM의 이산적인 의미론적 추론과 3D 얼굴 움직임에 필요한 조밀한 시간적 역학 사이의 불일치를 극복합니다. Ex-Omni는 블렌드셰이프 공동 지도와 비자회귀 블렌드셰이프 디코더를 통해 음성 단위 생성기를 활용하여 의미론적 추론과 시간적 생성을 분리하며, 이는 텍스트, 음성, 3D 얼굴 애니메이션을 동시에 생성하는 데 성공했습니다.