Mask Forcing: 通过双噪声掩码滚动改进自回归视频扩散蒸馏
摘要
Mask Forcing通过在自回归视频扩散蒸馏的自滚动过程中注入掩码清洁信号来缓解模式崩溃,在不需要额外训练数据的情况下提高视觉质量。
查看缓存全文
缓存时间: 2026/09/09 08:33
论文页面 - Mask Forcing:通过双噪声掩码展开改进自回归视频扩散蒸馏
来源: https://huggingface.co/papers/2609.09123
摘要
Mask Forcing 通过在自展开过程中注入掩码后的更清晰信号,缓解了蒸馏自回归视频扩散中的模式坍塌问题,在无需额外训练数据的情况下提升了视觉质量。
自回归(AR)视频扩散模型在实时视频生成领域展现出巨大潜力。近期研究通过分布匹配蒸馏(https://huggingface.co/papers?q=Distribution%20Matching%20Distillation)(DMD)方法,将预训练的双向视频扩散模型蒸馏为因果自回归模型,但生成的视频常出现过度饱和与过度平滑问题,导致视觉质量和真实感受限。其关键诱因是DMD中反向KL(https://huggingface.co/papers?q=reverse%20KL)目标的模式寻求行为,这可能导致学生模型分布坍塌至教师分布的少数模式上。为此,我们提出 Mask Forcing(https://huggingface.co/papers?q=Mask%20Forcing)策略,这是一种双噪声掩码展开(https://huggingface.co/papers?q=Dual-Noise%20Masking%20Rollout)方法,通过扰动AR学生的自展开(https://huggingface.co/papers?q=self-rollout)过程,缓解反向KL模式寻求引发的模式坍塌(https://huggingface.co/papers?q=mode%20collapse)。核心思想是在AR扩散蒸馏的自展开(https://huggingface.co/papers?q=self-rollout)过程中,通过沿空间和时间轴的随机掩码,向含噪展开输入注入更清晰的信号。这种扰动促使学生模型展开过程探索教师分布的更广区域,使DMD能提供超越学生已覆盖模式的学习信号。此外,清晰token作为去噪引导(https://huggingface.co/papers?q=denoising%20guidance)指导其他含噪token,改善中间展开预测并减少误差累积。大量实验表明,该方法无需引入真实视频数据或额外后训练阶段,即可高效提升多种AR视频扩散蒸馏方法的视觉质量。
查看arXiv页面(https://arxiv.org/abs/2609.09123)查看PDF(https://arxiv.org/pdf/2609.09123)项目页面(https://alicezrzhao.github.io/mask_forcing/)GitHub11(https://github.com/delaprada/Mask-Forcing)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.09123)
通过智能体获取此论文:
hf papers read 2609\.09123
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无关联此论文的模型
在模型README.md中引用arxiv.org/abs/2609.09123以从本页建立链接。
引用此论文的数据集0
暂无关联此论文的数据集
在数据集README.md中引用arxiv.org/abs/2609.09123以从本页建立链接。
引用此论文的Spaces0
暂无关联此论文的Spaces
在Space README.md中引用arxiv.org/abs/2609.09123以从本页建立链接。
包含此论文的收藏夹0
暂无包含此论文的收藏夹
将此论文添加至收藏夹(https://huggingface.co/new-collection)以从本页建立链接。
相似文章
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
Causal Forcing++:可扩展的少步自回归扩散蒸馏,用于实时交互式视频生成
Causal Forcing++提出了一种新颖的因果一致性蒸馏方法,用于逐帧自回归视频生成,在降低延迟和训练成本的同时实现了最先进的质量。
强化多模态掩码扩散模型的生成顺序
本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。
Ring Forcing:迈向自回归视频扩散的精确长期记忆
Ring Forcing 是一个自回归视频扩散框架,通过环形结构训练、历史压缩和稀疏旋转嵌入,增强长期记忆以实现精确的分钟级视频连贯性。