Causal-rCM: 用于流式视频生成和交互世界模型的自回归扩散蒸馏的统一教师强制与自强制开放方案
摘要
本文介绍了Causal-rCM,这是一个统一的教师强制与自强制框架,用于流式视频生成和交互世界模型中的自回归扩散蒸馏,以快速收敛实现了最先进的性能。
查看缓存全文
缓存时间: 2026/06/25 05:17
论文页面 - Causal-rCM:面向流式视频生成与交互式世界模型的自回归扩散蒸馏的统一教师强制与自我强制开源方案
来源:https://huggingface.co/papers/2606.25473
摘要
自回归视频扩散通过因果训练范式将扩散蒸馏框架扩展到实时流式生成,以快速收敛和交互式世界建模能力实现了最先进的性能。
自回归视频扩散(https://huggingface.co/papers?q=Autoregressive%20video%20diffusion)与因果扩散变换器(https://huggingface.co/papers?q=causal%20diffusion%20transformers)已成为实时流式视频生成和动作条件交互式世界模型的主要范式。在这项工作中,我们将 rCM(一种先进的扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)框架)扩展到自回归视频扩散(https://huggingface.co/papers?q=autoregressive%20video%20diffusion)。rCM 的核心思想在于前向散度与反向散度之间的互补性,在扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)中分别由一致性模型(https://huggingface.co/papers?q=consistency%20models)(CMs)和分布匹配蒸馏(https://huggingface.co/papers?q=distribution%20matching%20distillation)(DMD)体现。这一思想自然地延续到自回归设定中:教师强制(teacher-forcing,TF)提供了一种离线的、前向散度因果训练范式,而自我强制(self-forcing,SF)则对应一种在线的、反向散度精炼。我们的贡献包括:(1) 通过大量实验,我们表明教师强制(https://huggingface.co/papers?q=teacher-forcing)CM 是当前与自我强制(https://huggingface.co/papers?q=self-forcing)DMD 相结合的最佳初始化策略;(2) 我们首次实现了基于教师强制(https://huggingface.co/papers?q=teacher-forcing)的连续时间 CM(https://huggingface.co/papers?q=continuous-time%20CMs)(如 sCM/MeanFlow)用于自回归视频扩散(https://huggingface.co/papers?q=autoregressive%20video%20diffusion),这得益于我们自定义的掩码 FlashAttention-2(https://huggingface.co/papers?q=FlashAttention-2)JVP 内核(https://huggingface.co/papers?q=JVP%20kernel),与离散时间 CM(https://huggingface.co/papers?q=discrete-time%20CMs)(dCMs)相比实现了 10 倍更快的收敛;(3) 我们提出了 Causal-rCM(https://huggingface.co/papers?q=Causal-rCM),一个领先、统一且可扩展的算法-基础设施开源方案,用于扩散蒸馏(https://huggingface.co/papers?q=diffusion%20distillation)和因果训练;(4) 我们在逐帧和逐块两种设定下均实现了最先进的流式视频生成性能,且仅使用合成数据进行训练。值得注意的是,我们蒸馏得到的 2 步因果 Wan2.1-1.3B 模型在仅 1 或 2 个采样步数下就达到了 84.63 的 VBench-T2V(https://huggingface.co/papers?q=VBench-T2V)分数。我们进一步将 Causal-rCM(https://huggingface.co/papers?q=Causal-rCM)应用于 Cosmos 3(一个用于物理 AI 的先进全模态世界基础模型(https://huggingface.co/papers?q=omnimodal%20world%20foundation%20model),具备动作条件生成(https://huggingface.co/papers?q=action-conditioned%20generation)能力),从而构建了一个交互式世界模型。
查看 arXiv 页面(https://arxiv.org/abs/2606.25473) | 查看 PDF(https://arxiv.org/pdf/2606.25473) | 添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2606.25473)
在您的 agent 中获取本文:
hf papers read 2606.25473
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
没有模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2606.25473 以从此页面链接。
引用本文的数据集 0
没有数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2606.25473 以从此页面链接。
引用本文的 Space 0
没有 Space 链接本文
在 Space README.md 中引用 arxiv.org/abs/2606.25473 以从此页面链接。
包含本文的收藏集 0
没有收藏集包含本文
将本文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
Causal Forcing++:可扩展的少步自回归扩散蒸馏,用于实时交互式视频生成
Causal Forcing++提出了一种新颖的因果一致性蒸馏方法,用于逐帧自回归视频生成,在降低延迟和训练成本的同时实现了最先进的质量。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
A^2RD:用于长视频一致性的代理式自回归扩散
A^2RD 是一篇新论文,介绍了一种用于长视频合成的代理式自回归扩散架构,通过闭环自改进流程实现了更好的一致性和叙事连贯性。
Stream-R1:流式视频生成的可靠性-困惑度感知奖励蒸馏
Stream-R1 提出了一种针对流式视频生成的可靠性-困惑度感知奖励蒸馏框架,通过自适应加权监督信号来提升视觉和动态质量,且不增加额外的计算开销。
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。