自梯度强制:原生长视频外推
摘要
提出自梯度强制(SGF),一种用于自回归视频扩散模型的双通训练策略,为写入有用的上下文记忆提供缺失的监督,即使在短训练窗口下也能实现强大的长视频外推。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - Self Gradient Forcing: 原生长视频外推
来源: https://huggingface.co/papers/2607.20368 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
近年来,自回归视频扩散方法越来越多地建立在SelfForcing之上,即学生模型使用自身展开生成的历史而非真实视频上下文进行训练。这减少了曝光偏差,但历史键值缓存仍仅作为冻结的展开状态供未来帧使用。因此,未来帧的损失无法监督早期生成的潜在变量应如何被写入对后续视频潜在变量生成更有用的键和值中。我们称此问题为历史上下文-梯度鸿沟。我们提出Self Gradient Forcing (SGF),一种两阶段训练策略,在不通过完整串行展开进行反向传播的情况下恢复这一缺失的监督信号。第一阶段执行无梯度的自回归展开以匹配推理,并在采样的去噪退出步骤记录自生成上下文和输入模型的带噪潜在变量。第二阶段对记录的退出步骤执行并行上下文-梯度重建。生成的上下文用作停止梯度的清晰潜在变量输入,而模型重新计算上下文KV表示和未来到上下文的因果注意力。因此,SGF在原生自回归训练目标中提供了缺失的记忆写入监督,利用未来视频潜在变量的损失来训练模型将上下文编码为更有效的因果记忆。在不同初始化条件下进行的广泛长序列帧级和块级实验中,SGF实现了比SelfForcing更强的原生长视频外推能力,尤其在主体身份、背景/布局一致性和时间稳定性方面表现突出。值得注意的是,仅使用5秒的训练窗口,SGF即可外推至长达数分钟的视频。代码和模型将发布以推动自回归视频生成研究。
查看arXiv页面 (https://arxiv.org/abs/2607.20368) 查看PDF (https://arxiv.org/pdf/2607.20368) 项目页面 (https://zhuang2002.github.io/SelfGradientForcing/) GitHub73 (https://github.com/zhuang2002/Self_Gradient_Forcing) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20368)
在你的代理中获取这篇论文:
hf papers read 2607\.20368
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
JunhaoZhuang/Self_Gradient_Forcing 更新于1天前 • 61 • 4 (https://huggingface.co/JunhaoZhuang/Self_Gradient_Forcing)
引用此论文的数据集0
没有链接此论文的数据集
在数据集的README.md中引用arxiv.org/abs/2607.20368以从本页链接。
引用此论文的Space0
没有链接此论文的Space
在Space的README.md中引用arxiv.org/abs/2607.20368以从本页链接。
包含此论文的合集1
相似文章
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
OPSD-V: 面向后训练少步自回归视频生成器的在线策略自蒸馏
OPSD-V 通过使用真实长视频数据作为训练时的时间上下文,提供密集的轨迹级监督,从而增强视觉质量和运动动态,同时不改变推理机制,改进了少步自回归视频扩散模型。
Steady-Forcing: 在长时域自然视频扩散中平衡空间持久性与运动连续性
Steady-Forcing 提出了一种记忆与训练框架,旨在长时域自然视频生成中平衡空间稳定性与运动连续性,在保持流体动态持续多分钟滚动生成的同时,提升背景一致性。
One-Forcing: 迈向稳定的单步自回归视频生成
One-Forcing 通过用辅助 GAN 损失增强 DMD 目标,改进了单步视频生成,以更低的训练成本实现了最先进的性能。