Sign In

Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models

작성자
Haebom
카테고리
Empty

저자

Haoyu Zhang, Zhipeng Li, Yiwen Guo, Tianshu Yu

💡 개요

본 논문은 음성 및 3D 얼굴 애니메이션 생성을 통합하는 옴니모달 대규모 언어 모델(OLLM)의 연구 공백을 해결합니다. 제안된 Ex-Omni 프레임워크는 LLM의 이산적인 의미론적 추론과 3D 얼굴 움직임에 필요한 조밀한 시간적 역학 사이의 불일치를 극복합니다. Ex-Omni는 블렌드셰이프 공동 지도와 비자회귀 블렌드셰이프 디코더를 통해 음성 단위 생성기를 활용하여 의미론적 추론과 시간적 생성을 분리하며, 이는 텍스트, 음성, 3D 얼굴 애니메이션을 동시에 생성하는 데 성공했습니다.

🔑 시사점 및 한계

옴니모달 언어 모델이 텍스트, 음성, 3D 얼굴 애니메이션을 통합하여 생성할 수 있는 가능성을 보여주었습니다.
제안된 Ex-Omni 프레임워크는 의미론적 추론과 시간적 생성의 분리를 통해 3D 얼굴 애니메이션 생성의 정확성을 높였습니다.
1.2M 샘플의 InstructS2SF-1200K 데이터셋 구축은 향후 관련 연구에 기여할 것입니다.
대규모 음성-얼굴 애니메이션 데이터셋의 부족 및 생성된 애니메이션의 디테일 및 감정 표현의 깊이 향상이 필요합니다.