过去框架未来:自回归视频生成的记忆
摘要
本文全面回顾了自回归视频生成中的记忆机制,解决了在扩展序列中维护历史信息以确保时间持续性的挑战。
查看缓存全文
缓存时间: 2026/09/24 03:39
论文页面 - 过去塑造未来:记忆在自回归视频生成中的作用
来源:https://huggingface.co/papers/2609.28466
发布于9月23日
#1 每日精选论文 (https://huggingface.co/papers/date/2026-09-24)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
生成模型的进步提升了视频保真度,使得长时域生成、交互式世界建模和动态视觉环境得以实现。自回归(AR)视频生成通过因果推演扩展视觉序列。然而,一个根本性的瓶颈随之出现:随着生成序列的扩展,实际模型必须在严格限定的上下文窗口、存储和计算资源下运行。因此,关键的历史信息——例如实体身份、动态状态以及干预引起的因果变化——常常在相关性尚未减弱时就已脱离活跃上下文。克服这一限制并维持时间上的持续性构成了一个根本性的记忆问题。我们对AR视频生成中的记忆机制进行了系统而全面的综述。我们从操作角度将记忆定义为:在外部AR步骤中维持的持久化历史信息,即使其原始证据不再局部可访问,仍能影响未来的生成过程。基于这一统一框架,我们从五个互补视角组织相关文献:(I)形式,即历史的表征载体;(II)功能,即需要保存的特定语义和物理信息;(III)操作,即记忆的写入、读取、更新、管理和整合的生命周期;(IV)学习,即在闭环推演中记忆行为的优化;以及(V)评估,即诊断真实记忆能力的范式。我们最后综合了开放挑战,包括可组合且资源感知的记忆架构、可信的状态更新、自推演学习以及标准化评估。通过连接表征、机制和学习范式,本文为开发可靠、记忆条件化的视频生成系统奠定了结构化基础。
查看 arXiv 页面 (https://arxiv.org/abs/2609.28466)查看 PDF (https://arxiv.org/pdf/2609.28466)GitHub30 (https://github.com/HaroldChen19/Awesome-AR-Video-Memory)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.28466)
在您的代理中获取此论文:
hf papers read 2609\.28466
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型链接此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.28466 以从本页面链接它。
引用本文的数据集 0
暂无数据集链接此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.28466 以从本页面链接它。
引用本文的 Space 0
暂无 Space 链接此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.28466 以从本页面链接它。
包含本文的收藏 0
暂无收藏包含此论文。
将本文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接它。
相似文章
FadeMem: 距离感知的记忆整合用于自回归视频扩散
FadeMem 引入了一种距离感知的键值记忆整合机制,将历史视频数据组织成时间层次结构,在固定缓存约束下改进长视频生成。
Echo-Infinity: 学习演化记忆用于实时无限视频生成
Echo-Infinity 提出了一种可学习的演化记忆机制,用于自回归视频生成,以恒定的内存成本实现了实时无限视频生成,并达到了最先进的性能。
长视频生成(阅读时间 4 分钟)
本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
LongLive-RAG:一种通用的检索增强长视频生成框架
LongLive-RAG将长视频生成形式化为检索增强生成问题,利用先前生成潜变量的动态记忆来减少误差积累和身份漂移,在多种自回归骨干网络上提升了生成质量。