Mask Forcing: 通过双噪声掩码滚动改进自回归视频扩散蒸馏

Hugging Face Daily Papers 论文

摘要

Mask Forcing通过在自回归视频扩散蒸馏的自滚动过程中注入掩码清洁信号来缓解模式崩溃,在不需要额外训练数据的情况下提高视觉质量。

自回归(AR)视频扩散模型在实时视频生成方面显示出巨大潜力。最近的方法通过分布匹配蒸馏(DMD)将预训练的双向视频扩散模型蒸馏成因果AR学生模型,但生成的视频经常出现过饱和和平滑过度的问题,导致视觉质量和真实感有限。关键因素是DMD中反向KL目标的模式寻求行为,这可能导致学生分布仅塌缩到教师分布的少数几个模式。为了解决这个问题,我们提出了Mask Forcing,一种双噪声掩码滚动策略,它扰动AR学生自滚动以缓解由反向KL模式寻求引起的模式崩溃。核心思想是在AR扩散蒸馏的自滚动过程中,通过在空间和时间轴上使用随机掩码,将清洁信号注入噪声滚动输入中。这种扰动鼓励学生滚动探索教师分布的更多区域,使DMD能够提供超出学生已覆盖模式的学习信号。此外,清洁令牌作为其他噪声令牌的去噪引导,改善中间滚动预测并减少误差积累。大量实验表明,我们的方法高效地提高了多种AR视频扩散蒸馏方法的视觉质量,无需结合真实视频数据或额外的后训练阶段。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:33

论文页面 - Mask Forcing:通过双噪声掩码展开改进自回归视频扩散蒸馏

来源: https://huggingface.co/papers/2609.09123

摘要

Mask Forcing 通过在自展开过程中注入掩码后的更清晰信号,缓解了蒸馏自回归视频扩散中的模式坍塌问题,在无需额外训练数据的情况下提升了视觉质量。

自回归(AR)视频扩散模型在实时视频生成领域展现出巨大潜力。近期研究通过分布匹配蒸馏(https://huggingface.co/papers?q=Distribution%20Matching%20Distillation)(DMD)方法,将预训练的双向视频扩散模型蒸馏为因果自回归模型,但生成的视频常出现过度饱和与过度平滑问题,导致视觉质量和真实感受限。其关键诱因是DMD中反向KL(https://huggingface.co/papers?q=reverse%20KL)目标的模式寻求行为,这可能导致学生模型分布坍塌至教师分布的少数模式上。为此,我们提出 Mask Forcing(https://huggingface.co/papers?q=Mask%20Forcing)策略,这是一种双噪声掩码展开(https://huggingface.co/papers?q=Dual-Noise%20Masking%20Rollout)方法,通过扰动AR学生的自展开(https://huggingface.co/papers?q=self-rollout)过程,缓解反向KL模式寻求引发的模式坍塌(https://huggingface.co/papers?q=mode%20collapse)。核心思想是在AR扩散蒸馏的自展开(https://huggingface.co/papers?q=self-rollout)过程中,通过沿空间和时间轴的随机掩码,向含噪展开输入注入更清晰的信号。这种扰动促使学生模型展开过程探索教师分布的更广区域,使DMD能提供超越学生已覆盖模式的学习信号。此外,清晰token作为去噪引导(https://huggingface.co/papers?q=denoising%20guidance)指导其他含噪token,改善中间展开预测并减少误差累积。大量实验表明,该方法无需引入真实视频数据或额外后训练阶段,即可高效提升多种AR视频扩散蒸馏方法的视觉质量。

查看arXiv页面(https://arxiv.org/abs/2609.09123)查看PDF(https://arxiv.org/pdf/2609.09123)项目页面(https://alicezrzhao.github.io/mask_forcing/)GitHub11(https://github.com/delaprada/Mask-Forcing)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2609.09123)

通过智能体获取此论文:

hf papers read 2609\.09123

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无关联此论文的模型

在模型README.md中引用arxiv.org/abs/2609.09123以从本页建立链接。

引用此论文的数据集0

暂无关联此论文的数据集

在数据集README.md中引用arxiv.org/abs/2609.09123以从本页建立链接。

引用此论文的Spaces0

暂无关联此论文的Spaces

在Space README.md中引用arxiv.org/abs/2609.09123以从本页建立链接。

包含此论文的收藏夹0

暂无包含此论文的收藏夹

将此论文添加至收藏夹(https://huggingface.co/new-collection)以从本页建立链接。

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。

强化多模态掩码扩散模型的生成顺序

arXiv cs.LG

本文提出了一种可学习的控制模块,通过组相对策略优化(GRPO)进行训练,以优化多模态掩码扩散模型中的生成顺序,从而在文本到图像对齐和多模态理解方面取得了改进。