Ring Forcing:迈向自回归视频扩散的精确长期记忆
摘要
Ring Forcing 是一个自回归视频扩散框架,通过环形结构训练、历史压缩和稀疏旋转嵌入,增强长期记忆以实现精确的分钟级视频连贯性。
查看缓存全文
缓存时间: 2026/09/01 12:09
论文页面 - Ring Forcing:迈向精确长期记忆的自回归视频扩散
来源:https://huggingface.co/papers/2608.26794
摘要
Ring Forcing 是一种自回归视频扩散框架,通过环式训练、历史压缩和稀疏旋转嵌入来提升长期记忆能力,以实现分钟级的生成连贯性。
将视频生成扩展到长时间序列时,一个关键瓶颈显现出来:现有模型缺乏强大的长期记忆能力。这一缺陷可以从两个关键方面进行研究:物体恒存性(https://huggingface.co/papers?q=object%20permanence),即物体再次出现时精确再现其外观的能力;以及记忆容量(https://huggingface.co/papers?q=memory%20capacity),即处理超长上下文并利用遥远历史信息的能力。强大的长期记忆需要两者兼备:仅有物体恒存性而上下文处理能力不足会限制时间跨度;反之,仅有长上下文长度而无恒存性则无法维持身份一致性。为解决此问题,我们提出了Ring Forcing(https://huggingface.co/papers?q=Ring%20Forcing),一个自回归视频扩散(https://huggingface.co/papers?q=autoregressive%20video%20diffusion)框架,旨在稳健地构建和精确利用长期记忆。我们的环式训练(https://huggingface.co/papers?q=ring-structured%20training)策略强制从遥远历史中检索信息,有效调和了严格历史依循性与生成多样性之间的权衡。为扩展记忆容量(https://huggingface.co/papers?q=memory%20capacity),我们引入了一种压缩与时间步组合(https://huggingface.co/papers?q=compression%20and%20timestep%20composition)策略。在固定序列长度约束下,该方法将有效历史跨度延长至分钟级,并实现了对整个历史的全面感受野。此外,我们提出了一种稀疏RoPE(https://huggingface.co/papers?q=sparse%20RoPE)机制,以实现灵活、可扩展的记忆适应,同时充分利用预训练先验知识。大量实验表明,Ring Forcing(https://huggingface.co/papers?q=Ring%20Forcing)实现了卓越的分钟级连贯性和物体恒存性(https://huggingface.co/papers?q=object%20permanence),显著优于当前最先进方法。
查看arXiv页面 (https://arxiv.org/abs/2608.26794) 查看PDF (https://arxiv.org/pdf/2608.26794) 项目页面 (https://ringforcing.com/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26794)
在您的代理中获取此论文:
hf papers read 2608.26794
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文 在模型的README.md中引用 arxiv.org/abs/2608.26794 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文 在数据集的README.md中引用 arxiv.org/abs/2608.26794 以从此页面链接它。
引用此论文的Spaces 0
没有Space链接此论文 在Space的README.md中引用 arxiv.org/abs/2608.26794 以从此页面链接它。
包含此论文的集合 0
没有包含此论文的集合 将此论文添加到集合以从此页面链接它。
相似文章
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成
MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。
Causal-rCM: 用于流式视频生成和交互世界模型的自回归扩散蒸馏的统一教师强制与自强制开放方案
本文介绍了Causal-rCM,这是一个统一的教师强制与自强制框架,用于流式视频生成和交互世界模型中的自回归扩散蒸馏,以快速收敛实现了最先进的性能。
Causal Forcing++:可扩展的少步自回归扩散蒸馏,用于实时交互式视频生成
Causal Forcing++提出了一种新颖的因果一致性蒸馏方法,用于逐帧自回归视频生成,在降低延迟和训练成本的同时实现了最先进的质量。
Steady-Forcing: 在长时域自然视频扩散中平衡空间持久性与运动连续性
Steady-Forcing 提出了一种记忆与训练框架,旨在长时域自然视频生成中平衡空间稳定性与运动连续性,在保持流体动态持续多分钟滚动生成的同时,提升背景一致性。