본 논문은 Subject-to-Video (S2V) 생성을 위한 강력한 기반 시설인 OpenS2V-Nexus를 제안합니다. OpenS2V-Nexus는 세분화된 벤치마크인 OpenS2V-Eval과 백만 스케일 데이터셋인 OpenS2V-5M으로 구성됩니다. 기존의 전반적이고 조잡한 평가에 중점을 둔 S2V 벤치마크와 달리, OpenS2V-Eval은 주제 일관성, 자연스러운 외관, 신원 충실도에 중점을 둡니다. OpenS2V-Eval은 7가지 주요 S2V 범주에서 180개의 프롬프트를 포함하며 실제 및 합성 테스트 데이터를 모두 포함합니다. 또한, NexusScore, NaturalScore, GmeScore라는 세 가지 자동 메트릭을 제안하여 주제 일관성, 자연스러움, 텍스트 관련성을 개별적으로 정량화합니다. 16개의 대표적인 S2V 모델을 평가하고, 5백만 개의 고품질 720P 주제-텍스트-비디오 트리플로 구성된 대규모 S2V 생성 데이터셋 OpenS2V-5M을 생성합니다. OpenS2V-5M은 주제 정보의 다양성을 보장하기 위해 비디오 간 연관을 통한 주제 분할 및 쌍 정보 구축, GPT-Image-1을 사용한 다중 뷰 표현 합성 등의 방법을 사용합니다.