上下文匹配蒸馏:用于自回归视频蒸馏的教师因果性
摘要
上下文匹配蒸馏引入了一个因果框架,用于蒸馏自回归视频模型,通过将教师监督与学生的因果信息上下文对齐,提高了控制遵循性和长视频质量。
查看缓存全文
缓存时间: 2026/08/14 19:29
论文页面 - 上下文匹配蒸馏:自回归视频蒸馏中的教师因果性
来源:https://huggingface.co/papers/2608.13391
摘要
上下文匹配蒸馏将教师监督与少步自回归视频模型的因果生成上下文对齐,从而提升控制遵循度和长视频质量。
交互式自回归视频生成(https://huggingface.co/papers?q=autoregressive%20video%20generation)需要低延迟生成和精确的在线控制。少步蒸馏(https://huggingface.co/papers?q=Few-step%20distillation)通过减少去噪步骤来加速生成,而在线控制则施加了因果约束:帧和片段的生成应仅依赖于生成时可用的历史信息和控制信号。然而,现有的视频分布匹配蒸馏(https://huggingface.co/papers?q=video%20distribution%20matching%20distillation)(DMD)流程,通常使用双向教师来评估完整片段,从而对因果少步学生进行监督。因此,对目标的评分可能依赖于学生生成时尚未出现的未来帧和控制信号,导致教师监督与学生的因果信息集不匹配。
我们引入了上下文匹配蒸馏(https://huggingface.co/papers?q=Context-Matched%20Distillation)(CMD),一个因果DMD框架,将教师监督与每个目标生成时可用的信息对齐。CMD用因果教师(https://huggingface.co/papers?q=causal%20teacher)替代了双向完整片段评分,该教师评估每个目标时无需访问未来的帧或控制信号。同一个因果教师(https://huggingface.co/papers?q=causal%20teacher)用于初始化少步学生,在教师训练、学生蒸馏和推理之间建立了统一的因果表述。
除了对齐时间信息边界外,前缀评分(https://huggingface.co/papers?q=Prefix%20Scoring)通过在缓存的、由学生生成的产生该目标的前缀下评估每个目标,将监督与学生实际的生成上下文相匹配。前缀扰动(https://huggingface.co/papers?q=Prefix%20Corruption)进一步通过扰动训练早期产生的不可靠前缀来稳定训练,同时保持这种目标-上下文对齐。
凭借简洁的因果表述,CMD自然地扩展到逐帧和分块生成、长视频蒸馏以及相机条件蒸馏(https://huggingface.co/papers?q=camera-conditioned%20distillation)。实验表明,在短视频和长视频基准测试中,CMD在自回归方法中取得了最先进的综合性能,同时显著提升了对时变相机控制的遵循度。
查看 arXiv 页面 (https://arxiv.org/abs/2608.13391) 查看 PDF (https://arxiv.org/pdf/2608.13391) 项目页面 (https://hmrishavbandy.github.io/cmd-site/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.13391)
在您的代理中获取此论文:
hf papers read 2608\.13391
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型关联此论文。
在模型 README.md 中引用 arxiv.org/abs/2608.13391 以从本页面关联。
引用此论文的数据集0
无数据集关联此论文。
在数据集 README.md 中引用 arxiv.org/abs/2608.13391 以从本页面关联。
引用此论文的 Space0
无 Space 关联此论文。
在 Space README.md 中引用 arxiv.org/abs/2608.13391 以从本页面关联。
包含此论文的收藏集0
无收藏集包含此论文。
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联。
相似文章
Causal-rCM: 用于流式视频生成和交互世界模型的自回归扩散蒸馏的统一教师强制与自强制开放方案
本文介绍了Causal-rCM,这是一个统一的教师强制与自强制框架,用于流式视频生成和交互世界模型中的自回归扩散蒸馏,以快速收敛实现了最先进的性能。
Causal Forcing++:可扩展的少步自回归扩散蒸馏,用于实时交互式视频生成
Causal Forcing++提出了一种新颖的因果一致性蒸馏方法,用于逐帧自回归视频生成,在降低延迟和训练成本的同时实现了最先进的质量。
当上下文回归:面向策略内蒸馏的稳健内化
论文发现,将特权上下文重新引入蒸馏后的学生模型会导致性能下降(上下文诱导退化),并提出了一种轻量级一致性正则化器,该正则化器锚定无上下文输出以缓解此问题,从而在12种配置中提高了稳健性。
ContextMaster:通过固定预算稀疏上下文路由实现交互式多镜头视频生成
ContextMaster是一个统一的交互式多镜头视频生成模型,在生成、参考条件控制和编辑中维护共享历史,同时采用固定预算稀疏上下文路由和两阶段特权上下文蒸馏以提高效率。
VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因
介绍了视觉归因蒸馏(VAD),这是一种用于多模态在线策略蒸馏的反事实目标重建方法,可估计教师纠正中可归因于视觉的部分。在4B和9B规模下的细粒度视觉基准测试中,该方法优于现有方法。