标签
Temporal Context Routing通过将脚本时间映射到共享的视频-音频时间轴,提升了联合音视频生成中脚本对齐的时间准确性,减少了镜头边界和对话的错误。
VA-Judger是首个用于联合视频-音频生成的奖励模型,它使用人类偏好反馈来评估整体质量,包括一个数据集和基准测试,并在应用于像LTX-2这样的模型时展示了人类偏好率的显著提升。
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。