V-RAE:重新思考视频潜在空间用于生成

Hugging Face Daily Papers 论文

摘要

V-RAE提出了一种视频表示自编码器,它从冻结的视觉表示中构建语义组织的潜在表示,以提升视频生成质量、收敛速度和预测建模。

潜在视频生成依赖于自编码器来定义一个紧凑空间,生成模型在此空间中操作。尽管视频自编码器架构已大幅演进,但其潜在空间仍主要针对像素级重建进行优化,提供的高层语义组织有限。然而,重建优化的潜在空间未必适合生成建模。我们提出V-RAE,一种视频表示自编码器,它在冻结的视觉基础模型表示之上构建紧凑的生成潜在表示。一个轻量级时间池化模块去除时间冗余同时保留语义结构,视频解码器从压缩特征中重建连续运动。我们使用四个代表性的冻结编码器在视频重建、语义探测和类别条件生成上评估V-RAE。V-RAE在K600上达到2.13 rFVD,优于所有评估的大规模预训练视频VAE。其潜在表示保留了比传统视频分词器潜在表示更多的语义信息。在匹配的生成设置下,我们最好的变体在UCF101和K600上分别达到117.86和19.16的gFVD分数,同时收敛速度快达6倍。我们进一步表明,仅重建质量不足以表征生成实用性,并引入tFVD,一种时间连贯性诊断工具,与下游生成质量更可靠地相关。除了视频生成,V-RAE还在Cityscapes上改进了未来视频预测,相比Wan 2.2 VAE潜在空间在匹配预测设置下。综合来看,实验表明冻结的语义表示可以支持视频重建、生成和预测建模。项目页面:https://v-rae.github.io/.
查看原文
查看缓存全文

缓存时间: 2026/08/19 11:57

论文页面 - V-RAE:重新思考用于生成的视频潜在空间

来源:https://huggingface.co/papers/2608.13556

摘要

V-RAE 基于冻结的视觉表征构建语义组织的视频潜在表征,以提升生成质量、收敛速度和预测建模能力。

潜在视频生成依赖自动编码器来定义一个紧凑空间,生成模型在其中进行操作。尽管视频自动编码器的架构已显著演进,但其潜在空间的优化仍然主要侧重于像素级重建,提供的高层语义组织有限。然而,为重建优化的潜在空间未必适合生成建模。我们提出了 V-RAE (https://huggingface.co/papers?q=V-RAE),一种 视频表征自动编码器 (https://huggingface.co/papers?q=video%20representation%20autoencoder),它基于 冻结的视觉基础模型 (https://huggingface.co/papers?q=frozen%20vision%20foundation%20model) 表征构建紧凑的生成潜在表征。一个轻量级的 时间池化 (https://huggingface.co/papers?q=temporal%20pooling) 模块在保留语义结构的同时移除时间冗余,而一个 视频解码器 (https://huggingface.co/papers?q=video%20decoder) 从压缩特征中重建连续运动。我们使用四个代表性的冻结编码器对 V-RAE (https://huggingface.co/papers?q=V-RAE) 在视频重建、语义探针和类条件生成方面进行了评估。V-RAE (https://huggingface.co/papers?q=V-RAE) 在 K600 数据集上取得了 2.13 的 rFVD (https://huggingface.co/papers?q=rFVD) 分数,超越了所有评估的大规模预训练视频 VAE。其潜在表征保留的语义信息显著多于传统的 视频分词器 (https://huggingface.co/papers?q=video%20tokenizer) 潜在表征。在匹配的生成设置下,我们最好的变体在 UCF101 和 K600 数据集上分别取得了 117.86 和 19.16 的 gFVD (https://huggingface.co/papers?q=gFVD) 分数,同时收敛速度提升高达 6倍。我们进一步证明,仅靠重建质量不足以表征生成效用,并引入了 tFVD (https://huggingface.co/papers?q=tFVD),一种时间连贯性诊断指标,与下游生成质量的相关性更可靠。除了视频生成,V-RAE (https://huggingface.co/papers?q=V-RAE) 在匹配的预测设置下,也在 Cityscapes 数据集上的 未来视频预测 (https://huggingface.co/papers?q=future%20video%20prediction) 方面优于 Wan 2.2 VAE 的潜在空间。综合实验表明,冻结的语义表征可以支持视频重建、生成和预测建模。项目页面:https://v-rae.github.io/。

查看 arXiv 页面 (https://arxiv.org/abs/2608.13556) 查看 PDF (https://arxiv.org/pdf/2608.13556) 项目页面 (https://v-rae.github.io/) GitHub34 (https://github.com/V-RAE/V-RAE) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.13556)

在你的智能体中获取本文:

hf papers read 2608.13556

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型1

Guomh0707/V-RAE-Models 视频到视频 • 4 天前更新 • 6 (https://huggingface.co/Guomh0707/V-RAE-Models)

引用本文的数据集0

无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2608.13556 以从本页面链接。

引用本文的空间0

无空间链接本文

在空间 README.md 中引用 arxiv.org/abs/2608.13556 以从本页面链接。

包含本文的收藏集0

无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

变分有损自编码器

OpenAI Blog

# 变分有损自编码器 来源: [https://openai.com/index/variational-lossy-autoencoder/](https://openai.com/index/variational-lossy-autoencoder/) ## 摘要 表示学习旨在将观测数据的某些方面暴露在学习表示中,这种表示便于分类等下游任务。例如,对于二维图像,一个好的表示可能是只描述全局结构并丢弃有关详细纹理信息的表示。在本文中,我们提出

长视频生成(阅读时间 4 分钟)

TLDR AI

本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。