面向视频世界模型的可寻址记忆
摘要
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
查看缓存全文
缓存时间: 2026/08/10 02:12
论文页 - 视频世界模型的可寻址记忆
来源:https://huggingface.co/papers/2608.07408
摘要
我们研究交互式视频世界模型中的视觉持久性。这些模型依靠键值(Key-Value,KV)缓存作为不断增长的视觉记忆,以继承先前生成的帧。然而,我们发现一旦 rollout 超出训练范围,模型便无法可靠地寻址已存储内容,因为时间旋转位置编码(RoPE)的偏移量落到了训练期间未见过的范围之外,模型难以通过注意力检索相关视觉信息。此外,在 RoPE 旋转空间中朴素地压缩缓存会因将不兼容的位置相位平均在一起而破坏记忆。为解决这一问题,我们提出 WorldTrace,一个无需训练的记忆框架,用于长程视觉持久性。WorldTrace 通过为每个摘要槽位分配一个不同的、分布内的虚拟位置,来保持压缩记忆的可寻址性。在这个可寻址缓存中,我们研究了两种记忆压缩方法:WorldTrace-Field 压缩历史以实现时间一致性,而 WorldTrace-Landmark 在检测到的转换处存储逐字的场景轨迹以实现情景回忆。我们进一步推出 LoopBench,一个评估压缩缓存能否在长时间绕路后重建先前访问场景的基准。在 LoopBench 上,WorldTrace-Field 将时间一致性提升 +15.5%,WorldTrace-Landmark 将情景回忆提升 +19.5%,无需重新训练即可扩展视觉持久生成。
查看 arXiv 页面 (https://arxiv.org/abs/2608.07408) 查看 PDF (https://arxiv.org/pdf/2608.07408) 项目页面 (https://research.nvidia.com/labs/sil/projects/WorldTrace/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07408)
在您的 agent 中获取此论文:
hf papers read 2608\.07408
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型
0
暂无模型引用此论文。
在模型 README.md 中引用 arxiv.org/abs/2608.07408,即可从本页面链接到该模型。
引用该论文的数据集
0
暂无数据集引用此论文。
在数据集 README.md 中引用 arxiv.org/abs/2608.07408,即可从本页面链接到该数据集。
引用该论文的 Spaces
0
暂无 Space 引用此论文。
在 Space README.md 中引用 arxiv.org/abs/2608.07408,即可从本页面链接到该 Space。
包含此论文的合集
0
暂无合集包含此论文。
将此论文添加到一个合集 (https://huggingface.co/new-collection) 中,即可从本页面链接到该合集。
相似文章
MBench:面向视频世界模型记忆能力的综合基准
本文介绍了MBench,一个用于评估视频世界模型在长时间跨度下对实体、环境和因果一致性记忆能力的基准。
用于视频世界模型的潜在空间记忆
本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。
@HaochengXiUCB: 新博客文章:视频与世界模型中的遗忘墙——长时域视频生成不仅仅受限于计算……
这篇博客文章介绍了长时域视频生成和世界模型中'Forgetting Wall'的概念,认为主要瓶颈是内存(KV缓存增长)而非计算,并探讨了压缩作为未来模型的关键方向。
基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架
ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。
DecMem:面向分钟级一致世界生成的解耦记忆方法
DecMem 提出了一种解耦记忆架构,结合稀疏全局记忆和锚定局部记忆,实现了分钟级一致视频生成,性能优于现有最优方法。