Ring Forcing:迈向自回归视频扩散的精确长期记忆

Hugging Face Daily Papers 论文

摘要

Ring Forcing 是一个自回归视频扩散框架,通过环形结构训练、历史压缩和稀疏旋转嵌入,增强长期记忆以实现精确的分钟级视频连贯性。

将视频生成扩展到长时长时,揭示了一个关键瓶颈:当前模型缺乏稳健的长期记忆。这一缺陷可以从两个关键方面研究:物体恒存性,即物体重新出现时精确再现其外观的能力;以及记忆容量,即处理超长上下文并使用遥远历史信息的能力。稳健的长期记忆需要两者兼备:没有充分的上下文处理的物体恒存性会限制时间范围,而没有恒存性的长上下文长度则无法维持身份。为了解决这个问题,我们提出了 Ring Forcing,一个自回归视频扩散框架,旨在稳健地构建和精确利用长期记忆。我们的环形结构训练策略强制从遥远历史中检索信息,有效地调和了严格历史遵循与生成多样性之间的权衡。为了扩展记忆容量,我们引入了一种压缩和时间步组合策略。在固定序列长度约束下,该方法将有效历史跨度扩展到分钟级时长,并实现了对整个历史的综合感受野。此外,我们提出了一种稀疏 RoPE 机制,以实现灵活、可扩展的记忆适应,同时充分利用预训练先验。大量实验表明,Ring Forcing 实现了卓越的分钟级连贯性和物体恒存性,显著优于最先进方法。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:09

论文页面 - Ring Forcing:迈向精确长期记忆的自回归视频扩散

来源:https://huggingface.co/papers/2608.26794

摘要

Ring Forcing 是一种自回归视频扩散框架,通过环式训练、历史压缩和稀疏旋转嵌入来提升长期记忆能力,以实现分钟级的生成连贯性。

将视频生成扩展到长时间序列时,一个关键瓶颈显现出来:现有模型缺乏强大的长期记忆能力。这一缺陷可以从两个关键方面进行研究:物体恒存性(https://huggingface.co/papers?q=object%20permanence),即物体再次出现时精确再现其外观的能力;以及记忆容量(https://huggingface.co/papers?q=memory%20capacity),即处理超长上下文并利用遥远历史信息的能力。强大的长期记忆需要两者兼备:仅有物体恒存性而上下文处理能力不足会限制时间跨度;反之,仅有长上下文长度而无恒存性则无法维持身份一致性。为解决此问题,我们提出了Ring Forcing(https://huggingface.co/papers?q=Ring%20Forcing),一个自回归视频扩散(https://huggingface.co/papers?q=autoregressive%20video%20diffusion)框架,旨在稳健地构建和精确利用长期记忆。我们的环式训练(https://huggingface.co/papers?q=ring-structured%20training)策略强制从遥远历史中检索信息,有效调和了严格历史依循性与生成多样性之间的权衡。为扩展记忆容量(https://huggingface.co/papers?q=memory%20capacity),我们引入了一种压缩与时间步组合(https://huggingface.co/papers?q=compression%20and%20timestep%20composition)策略。在固定序列长度约束下,该方法将有效历史跨度延长至分钟级,并实现了对整个历史的全面感受野。此外,我们提出了一种稀疏RoPE(https://huggingface.co/papers?q=sparse%20RoPE)机制,以实现灵活、可扩展的记忆适应,同时充分利用预训练先验知识。大量实验表明,Ring Forcing(https://huggingface.co/papers?q=Ring%20Forcing)实现了卓越的分钟级连贯性和物体恒存性(https://huggingface.co/papers?q=object%20permanence),显著优于当前最先进方法。

查看arXiv页面 (https://arxiv.org/abs/2608.26794) 查看PDF (https://arxiv.org/pdf/2608.26794) 项目页面 (https://ringforcing.com/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.26794)

在您的代理中获取此论文:

hf papers read 2608.26794

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文 在模型的README.md中引用 arxiv.org/abs/2608.26794 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文 在数据集的README.md中引用 arxiv.org/abs/2608.26794 以从此页面链接它。

引用此论文的Spaces 0

没有Space链接此论文 在Space的README.md中引用 arxiv.org/abs/2608.26794 以从此页面链接它。

包含此论文的集合 0

没有包含此论文的集合 将此论文添加到集合以从此页面链接它。

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。