VideoRAE:通过表示自编码器驯服视频基础模型进行生成建模
摘要
本文介绍了VideoRAE,一种表示自编码器,它利用冻结的视频基础模型来创建紧凑、可重建且利于生成的视频潜在表示。该模型在UCF-101上取得了最先进的结果,且收敛速度优于其他自编码器。
查看缓存全文
缓存时间: 2026/07/20 09:39
论文页面 - VideoRAE: 通过表征自编码器驯服视频基础模型进行生成建模
来源:https://huggingface.co/papers/2607.14088
摘要
视频生成模型通常依赖由3D变分自编码器(3D-VAEs)学得的潜空间。然而,传统3D-VAE主要针对像素级重建进行优化,这限制了其潜变量所捕获的语义与时空结构。与此同时,视频基础模型(VFM)如V-JEPA2和VideoMAEv2展现了强大的视频理解能力,但其冻结表征能否转化为紧凑、可重建且适用于生成的视频潜变量,这一问题尚待深入探索。我们用VideoRAE回答了这个问题——它是一种表征自编码器,利用来自冻结视频基础编码器的多尺度层次化特征,并通过轻量级1D自注意力投影器对其进行压缩。VideoRAE既支持扩散Transformer的连续潜变量,也通过多码书高维量化支持自回归模型的离散token。在解码过程中,与冻结VFM教师模型的局部与全局表征对齐目标提升了语义保持能力,并使得无需KL正则化的训练成为可能。实验表明,VideoRAE在连续和离散模式下均实现了强大的重建性能。在UCF-101上,使用AR和DiT生成器分别获得了40和93的类到视频gFVD最先进结果,同时收敛速度相比竞争自编码器基线快约5倍。在受控的20B参数文本到视频研究中,用VideoRAE替换LTX-VAE可在可比设置下实现更快的收敛。这些结果验证了冻结VFM表征作为多功能且适用于生成的视频潜变量的有效性。模型和代码将在https://zhxie0117.github.io/VideoRAE/上发布。
查看arXiv页面(https://arxiv.org/abs/2607.14088)查看PDF(https://arxiv.org/pdf/2607.14088)项目页面(https://zhxie0117.github.io/VideoRAE/)GitHub33(https://github.com/zhxie0117/VideoRAE)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.14088)
在您的代理中获取这篇论文:
hf papers read 2607.14088
还没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
尚无模型链接此论文
在模型README.md中引用arxiv.org/abs/2607.14088,即可从本页面链接。
引用此论文的数据集0
尚无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2607.14088,即可从本页面链接。
引用此论文的Space0
尚无Space链接此论文
在Space README.md中引用arxiv.org/abs/2607.14088,即可从本页面链接。
包含此论文的收藏集0
尚无收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)即可从本页面链接。
相似文章
视频生成器作为通用视觉模型(8分钟阅读)
GenCeption 将预训练的视频生成模型重新利用为一个统一的单次前馈视觉模型,在多个任务上以极高的数据效率实现了最先进的性能,标志着向通用视觉智能的转变。
视频生成模型是通用视觉学习者
本文提出,大规模文本到视频生成可作为计算机视觉的强大预训练范式,介绍了GenCeption,它在多种视觉任务上实现了最先进的性能,具有高数据效率和向未见领域的涌现泛化能力。
使用NVIDIA NeMo训练视频基础模型
本文介绍了一种可扩展的开源管道,利用NVIDIA NeMo进行视频基础模型的训练和推理,通过加速数据集管理和并行化训练来解决生成高质量视频的挑战。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。
长视频生成(阅读时间 4 分钟)
本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。