过去框架未来:自回归视频生成的记忆

Hugging Face Daily Papers 论文

摘要

本文全面回顾了自回归视频生成中的记忆机制,解决了在扩展序列中维护历史信息以确保时间持续性的挑战。

生成模型的进步提高了视频保真度,使得长时间生成、交互式世界建模和演化视觉环境成为可能。自回归 (AR) 视频生成通过因果展开扩展视觉序列。然而,一个根本瓶颈出现了:随着生成序列的扩展,实际模型必须在严格受限的上下文窗口、存储和计算限制下运行。因此,关键的历史信息,例如实体身份、动态状态和干预引起的因果变化,往往在其相关性降低之前就离开了活跃上下文。克服这一限制并维持时间持续性构成了一个基本的记忆问题。我们呈现了自回归 (AR) 视频生成中记忆机制的系统性和全面回顾。我们从操作上将记忆定义为在外部AR步骤中维护的持久历史信息,即使在原始证据不再局部可访问后也能影响未来生成。基于这一统一框架,我们通过五个互补的视角组织文献:(I) 形式,历史的表示载体;(II) 功能,需要保存的具体语义和物理信息;(III) 操作,记忆的写入、读取、更新、管理和集成的生命周期;(IV) 学习,在闭环展开下记忆行为的优化;(V) 评估,诊断真实记忆能力的范式。我们通过综合开放挑战来结束,包括可组合和资源感知的记忆架构、可信赖的状态更新、自展开学习和标准化评估。通过桥接表示、机制和学习范式,本文为开发可靠的、记忆条件化的视频生成系统奠定了结构化基础。
查看原文
查看缓存全文

缓存时间: 2026/09/24 03:39

论文页面 - 过去塑造未来:记忆在自回归视频生成中的作用

来源:https://huggingface.co/papers/2609.28466
发布于9月23日

#1 每日精选论文 (https://huggingface.co/papers/date/2026-09-24)
作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

生成模型的进步提升了视频保真度,使得长时域生成、交互式世界建模和动态视觉环境得以实现。自回归(AR)视频生成通过因果推演扩展视觉序列。然而,一个根本性的瓶颈随之出现:随着生成序列的扩展,实际模型必须在严格限定的上下文窗口、存储和计算资源下运行。因此,关键的历史信息——例如实体身份、动态状态以及干预引起的因果变化——常常在相关性尚未减弱时就已脱离活跃上下文。克服这一限制并维持时间上的持续性构成了一个根本性的记忆问题。我们对AR视频生成中的记忆机制进行了系统而全面的综述。我们从操作角度将记忆定义为:在外部AR步骤中维持的持久化历史信息,即使其原始证据不再局部可访问,仍能影响未来的生成过程。基于这一统一框架,我们从五个互补视角组织相关文献:(I)形式,即历史的表征载体;(II)功能,即需要保存的特定语义和物理信息;(III)操作,即记忆的写入、读取、更新、管理和整合的生命周期;(IV)学习,即在闭环推演中记忆行为的优化;以及(V)评估,即诊断真实记忆能力的范式。我们最后综合了开放挑战,包括可组合且资源感知的记忆架构、可信的状态更新、自推演学习以及标准化评估。通过连接表征、机制和学习范式,本文为开发可靠、记忆条件化的视频生成系统奠定了结构化基础。

查看 arXiv 页面 (https://arxiv.org/abs/2609.28466)查看 PDF (https://arxiv.org/pdf/2609.28466)GitHub30 (https://github.com/HaroldChen19/Awesome-AR-Video-Memory)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.28466)

在您的代理中获取此论文:

hf papers read 2609\.28466

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型链接此论文。

在模型的 README.md 中引用 arxiv.org/abs/2609.28466 以从本页面链接它。

引用本文的数据集 0

暂无数据集链接此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2609.28466 以从本页面链接它。

引用本文的 Space 0

暂无 Space 链接此论文。

在 Space 的 README.md 中引用 arxiv.org/abs/2609.28466 以从本页面链接它。

包含本文的收藏 0

暂无收藏包含此论文。

将本文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接它。

相似文章

长视频生成(阅读时间 4 分钟)

TLDR AI

本文介绍了 A²RD,这是一种利用智能体自回归扩散生成一致性长视频的新型架构。该架构提出了检索-合成-优化-更新(Retrieve–Synthesize–Refine–Update)循环机制,并推出了一个新的基准测试 LVBench-C,以解决长时视频合成中的语义漂移问题。