기존의 단편 비디오 생성 방법은 서사적 구조와 장면 간 시각적 일관성을 유지하는 데 한계가 있었습니다. 본 논문은 이러한 문제를 해결하기 위해 다중 에이전트 협업을 기반으로 하는 ViMax 프레임워크를 제안합니다. ViMax는 계층적 서사 엔진과 의존성 인식 시각적 일관성 메커니즘을 통해 전역적인 스토리 일관성과 장면 간 캐릭터 및 환경 상태를 유지하며, VLM(Vision-Language Model) 기반 에이전트들이 이를 지속적으로 감시하고 개선합니다.
🔑 시사점 및 한계
•
장문의 비디오 생성에서 요구되는 체계적인 서사 계획과 시각적 일관성을 달성하는 새로운 패러다임을 제시합니다.
•
다중 에이전트의 협업을 통해 스토리텔링의 무결성과 시각적 일관성을 동시에 유지하며, 복잡한 멀티-씬 타임라인을 가진 비디오 생성을 가능하게 합니다.
•
아직 시각적 일관성 메커니즘의 복잡성과 에이전트 간의 효과적인 조정 및 효율성에 대한 추가적인 연구가 필요할 수 있습니다.