V-RAE:重新思考视频潜在空间用于生成
摘要
V-RAE提出了一种视频表示自编码器,它从冻结的视觉表示中构建语义组织的潜在表示,以提升视频生成质量、收敛速度和预测建模。
查看缓存全文
缓存时间: 2026/08/19 11:57
论文页面 - V-RAE:重新思考用于生成的视频潜在空间
来源:https://huggingface.co/papers/2608.13556
摘要
V-RAE 基于冻结的视觉表征构建语义组织的视频潜在表征,以提升生成质量、收敛速度和预测建模能力。
潜在视频生成依赖自动编码器来定义一个紧凑空间,生成模型在其中进行操作。尽管视频自动编码器的架构已显著演进,但其潜在空间的优化仍然主要侧重于像素级重建,提供的高层语义组织有限。然而,为重建优化的潜在空间未必适合生成建模。我们提出了 V-RAE (https://huggingface.co/papers?q=V-RAE),一种 视频表征自动编码器 (https://huggingface.co/papers?q=video%20representation%20autoencoder),它基于 冻结的视觉基础模型 (https://huggingface.co/papers?q=frozen%20vision%20foundation%20model) 表征构建紧凑的生成潜在表征。一个轻量级的 时间池化 (https://huggingface.co/papers?q=temporal%20pooling) 模块在保留语义结构的同时移除时间冗余,而一个 视频解码器 (https://huggingface.co/papers?q=video%20decoder) 从压缩特征中重建连续运动。我们使用四个代表性的冻结编码器对 V-RAE (https://huggingface.co/papers?q=V-RAE) 在视频重建、语义探针和类条件生成方面进行了评估。V-RAE (https://huggingface.co/papers?q=V-RAE) 在 K600 数据集上取得了 2.13 的 rFVD (https://huggingface.co/papers?q=rFVD) 分数,超越了所有评估的大规模预训练视频 VAE。其潜在表征保留的语义信息显著多于传统的 视频分词器 (https://huggingface.co/papers?q=video%20tokenizer) 潜在表征。在匹配的生成设置下,我们最好的变体在 UCF101 和 K600 数据集上分别取得了 117.86 和 19.16 的 gFVD (https://huggingface.co/papers?q=gFVD) 分数,同时收敛速度提升高达 6倍。我们进一步证明,仅靠重建质量不足以表征生成效用,并引入了 tFVD (https://huggingface.co/papers?q=tFVD),一种时间连贯性诊断指标,与下游生成质量的相关性更可靠。除了视频生成,V-RAE (https://huggingface.co/papers?q=V-RAE) 在匹配的预测设置下,也在 Cityscapes 数据集上的 未来视频预测 (https://huggingface.co/papers?q=future%20video%20prediction) 方面优于 Wan 2.2 VAE 的潜在空间。综合实验表明,冻结的语义表征可以支持视频重建、生成和预测建模。项目页面:https://v-rae.github.io/。
查看 arXiv 页面 (https://arxiv.org/abs/2608.13556) 查看 PDF (https://arxiv.org/pdf/2608.13556) 项目页面 (https://v-rae.github.io/) GitHub34 (https://github.com/V-RAE/V-RAE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.13556)
在你的智能体中获取本文:
hf papers read 2608.13556
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型1
Guomh0707/V-RAE-Models 视频到视频 • 4 天前更新 • 6 (https://huggingface.co/Guomh0707/V-RAE-Models)
引用本文的数据集0
无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2608.13556 以从本页面链接。
引用本文的空间0
无空间链接本文
在空间 README.md 中引用 arxiv.org/abs/2608.13556 以从本页面链接。
包含本文的收藏集0
无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
VideoRAE:通过表示自编码器驯服视频基础模型进行生成建模
本文介绍了VideoRAE,一种表示自编码器,它利用冻结的视频基础模型来创建紧凑、可重建且利于生成的视频潜在表示。该模型在UCF-101上取得了最先进的结果,且收敛速度优于其他自编码器。
AVA-Encoder:迈向智能体原生的视频表征学习
AVA-Encoder 通过基于知识图谱的智能体自编码学习结构化视频表征,能够实现电影级视频生成与推理,同时减少 Token 使用量。
变分有损自编码器
# 变分有损自编码器 来源: [https://openai.com/index/variational-lossy-autoencoder/](https://openai.com/index/variational-lossy-autoencoder/) ## 摘要 表示学习旨在将观测数据的某些方面暴露在学习表示中,这种表示便于分类等下游任务。例如,对于二维图像,一个好的表示可能是只描述全局结构并丢弃有关详细纹理信息的表示。在本文中,我们提出
长视频生成(阅读时间 4 分钟)
本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。
重新思考长视频中的RAG:检索什么以及如何使用?
本文介绍了V-RAGBench,一个用于评估长自我中心视频中检索增强生成的基准,以及CARVE,一种自适应地为每个片段选择检索配置以提升VideoRAG性能的方法。