自梯度强制:原生长视频外推

Papers with Code Trending 论文

摘要

提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。

最近的自回归视频扩散方法越来越多地基于自强制(Self Forcing),其中学生模型在其自身生成的历史序列上进行训练,而非使用真实视频上下文。这减少了曝光偏差,但历史键值缓存仍然仅作为冻结的展开状态供未来帧使用。因此,未来的损失无法监督早期生成的潜在变量如何被编码成更有效的键和值,以供后续视频潜在变量生成。我们将此称为历史上下文梯度鸿沟。我们提出自梯度强制(SGF),一种双通训练策略,无需通过完整的串行展开进行反向传播即可恢复缺失的监督信号。第一遍执行无梯度的自回归展开以匹配推理过程,并在采样的去噪退出步骤中,记录自生成的上下文和输入模型的带噪潜在变量。第二遍针对记录的退出步骤执行并行上下文梯度重建:生成的上下文作为停止梯度的干净潜在输入,而模型重新计算上下文的键值表示及未来到上下文的因果注意力。因此,SGF在原生自回归训练目标中提供了缺失的记忆写入监督,利用未来视频潜在变量的损失来训练模型将上下文编码为更有效的因果记忆。在多种初始化条件下的广泛长序列逐帧和逐块实验中,SGF在原生长视频外推方面优于自强制,尤其在主体一致性、背景/布局一致性和时间稳定性方面。值得注意的是,仅使用5秒的训练窗口,SGF即可外推至持续数分钟的视频。代码和模型将发布,以推进自回归视频生成的研究。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - Self Gradient Forcing: 原生长视频外推

来源: https://huggingface.co/papers/2607.20368 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

近年来,自回归视频扩散方法越来越多地建立在SelfForcing之上,即学生模型使用自身展开生成的历史而非真实视频上下文进行训练。这减少了曝光偏差,但历史键值缓存仍仅作为冻结的展开状态供未来帧使用。因此,未来帧的损失无法监督早期生成的潜在变量应如何被写入对后续视频潜在变量生成更有用的键和值中。我们称此问题为历史上下文-梯度鸿沟。我们提出Self Gradient Forcing (SGF),一种两阶段训练策略,在不通过完整串行展开进行反向传播的情况下恢复这一缺失的监督信号。第一阶段执行无梯度的自回归展开以匹配推理,并在采样的去噪退出步骤记录自生成上下文和输入模型的带噪潜在变量。第二阶段对记录的退出步骤执行并行上下文-梯度重建。生成的上下文用作停止梯度的清晰潜在变量输入,而模型重新计算上下文KV表示和未来到上下文的因果注意力。因此,SGF在原生自回归训练目标中提供了缺失的记忆写入监督,利用未来视频潜在变量的损失来训练模型将上下文编码为更有效的因果记忆。在不同初始化条件下进行的广泛长序列帧级和块级实验中,SGF实现了比SelfForcing更强的原生长视频外推能力,尤其在主体身份、背景/布局一致性和时间稳定性方面表现突出。值得注意的是,仅使用5秒的训练窗口,SGF即可外推至长达数分钟的视频。代码和模型将发布以推动自回归视频生成研究。

查看arXiv页面 (https://arxiv.org/abs/2607.20368) 查看PDF (https://arxiv.org/pdf/2607.20368) 项目页面 (https://zhuang2002.github.io/SelfGradientForcing/) GitHub73 (https://github.com/zhuang2002/Self_Gradient_Forcing) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20368)

在你的代理中获取这篇论文:

hf papers read 2607\.20368

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

JunhaoZhuang/Self_Gradient_Forcing 更新于1天前 • 61 • 4 (https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing)

引用此论文的数据集0

没有链接此论文的数据集

在数据集的README.md中引用arxiv.org/abs/2607.20368以从本页链接。

引用此论文的Space0

没有链接此论文的Space

在Space的README.md中引用arxiv.org/abs/2607.20368以从本页链接。

包含此论文的合集1

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。