Causal-rCM: 用于流式视频生成和交互世界模型的自回归扩散蒸馏的统一教师强制与自强制开放方案

Hugging Face Daily Papers 论文

摘要

本文介绍了Causal-rCM,这是一个统一的教师强制与自强制框架,用于流式视频生成和交互世界模型中的自回归扩散蒸馏,以快速收敛实现了最先进的性能。

基于因果扩散变换器的自回归视频扩散已成为实时流式视频生成和动作条件交互世界模型的主要范式。在这项工作中,我们将先进的扩散蒸馏框架rCM扩展到自回归视频扩散。rCM的核心哲学在于前向散度和反向散度之间的互补性,在扩散蒸馏中分别由一致性模型(CM)和分布匹配蒸馏(DMD)表示。这一哲学自然延续到自回归设置中,其中教师强制(TF)提供了一种离线、前向散度的因果训练范式,而自强制(SF)则对应一种在策略、反向散度的精炼过程。 我们的贡献如下:(1) 通过大量实验,我们表明教师强制CM是目前作为自强制DMD初始化策略的最佳补充。(2) 我们首次实现了基于教师强制的连续时间CM(例如sCM/MeanFlow)用于自回归视频扩散,这得益于我们定制的掩码FlashAttention-2 JVP内核,实现了比离散时间CM(dCM)快10倍的收敛速度。(3) 我们引入了Causal-rCM,这是一个领先、统一且可扩展的算法-基础设施开放配方,用于扩散蒸馏和因果训练。(4) 我们在帧级和块级设置中都实现了最先进的流式视频生成性能,仅使用合成数据进行训练。 值得注意的是,我们蒸馏后的2步因果Wan2.1-1.3B模型仅需1或2步采样,即可达到84.63的VBench-T2V分数。我们进一步将Causal-rCM应用于Cosmos 3,这是一个用于物理AI的先进全模态世界基础模型,具有动作条件生成能力,从而实现了交互世界模型。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:17

论文页面 - Causal-rCM:面向流式视频生成与交互式世界模型的自回归扩散蒸馏的统一教师强制与自我强制开源方案

来源:https://huggingface.co/papers/2606.25473

摘要

自回归视频扩散通过因果训练范式将扩散蒸馏框架扩展到实时流式生成,以快速收敛和交互式世界建模能力实现了最先进的性能。

自回归视频扩散(https://huggingface.co/papers?q=Autoregressive%20video%20diffusion)与因果扩散变换器(https://huggingface.co/papers?q=causal%20diffusion%20transformers)已成为实时流式视频生成和动作条件交互式世界模型的主要范式。在这项工作中,我们将 rCM(一种先进的扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)框架)扩展到自回归视频扩散(https://huggingface.co/papers?q=autoregressive%20video%20diffusion)。rCM 的核心思想在于前向散度与反向散度之间的互补性,在扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)中分别由一致性模型(https://huggingface.co/papers?q=consistency%20models)(CMs)和分布匹配蒸馏(https://huggingface.co/papers?q=distribution%20matching%20distillation)(DMD)体现。这一思想自然地延续到自回归设定中:教师强制(teacher-forcing,TF)提供了一种离线的、前向散度因果训练范式,而自我强制(self-forcing,SF)则对应一种在线的、反向散度精炼。我们的贡献包括:(1) 通过大量实验,我们表明教师强制(https://huggingface.co/papers?q=teacher-forcing)CM 是当前与自我强制(https://huggingface.co/papers?q=self-forcing)DMD 相结合的最佳初始化策略;(2) 我们首次实现了基于教师强制(https://huggingface.co/papers?q=teacher-forcing)的连续时间 CM(https://huggingface.co/papers?q=continuous-time%20CMs)(如 sCM/MeanFlow)用于自回归视频扩散(https://huggingface.co/papers?q=autoregressive%20video%20diffusion),这得益于我们自定义的掩码 FlashAttention-2(https://huggingface.co/papers?q=FlashAttention-2)JVP 内核(https://huggingface.co/papers?q=JVP%20kernel),与离散时间 CM(https://huggingface.co/papers?q=discrete-time%20CMs)(dCMs)相比实现了 10 倍更快的收敛;(3) 我们提出了 Causal-rCM(https://huggingface.co/papers?q=Causal-rCM),一个领先、统一且可扩展的算法-基础设施开源方案,用于扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)和因果训练;(4) 我们在逐帧和逐块两种设定下均实现了最先进的流式视频生成性能,且仅使用合成数据进行训练。值得注意的是,我们蒸馏得到的 2 步因果 Wan2.1-1.3B 模型在仅 1 或 2 个采样步数下就达到了 84.63 的 VBench-T2V(https://huggingface.co/papers?q=VBench-T2V)分数。我们进一步将 Causal-rCM(https://huggingface.co/papers?q=Causal-rCM)应用于 Cosmos 3(一个用于物理 AI 的先进全模态世界基础模型(https://huggingface.co/papers?q=omnimodal%20world%20foundation%20model),具备动作条件生成(https://huggingface.co/papers?q=action-conditioned%20generation)能力),从而构建了一个交互式世界模型。

查看 arXiv 页面(https://arxiv.org/abs/2606.25473) | 查看 PDF(https://arxiv.org/pdf/2606.25473) | 添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2606.25473)

在您的 agent 中获取本文:

hf papers read 2606.25473

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

没有模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2606.25473 以从此页面链接。

引用本文的数据集 0

没有数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2606.25473 以从此页面链接。

引用本文的 Space 0

没有 Space 链接本文

在 Space README.md 中引用 arxiv.org/abs/2606.25473 以从此页面链接。

包含本文的收藏集 0

没有收藏集包含本文

将本文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。