面向视频世界模型的可寻址记忆

Hugging Face Daily Papers 论文

摘要

本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。

我们研究交互式视频世界模型中的视觉持久性。这些模型依赖键值(KV)缓存作为不断增长的视觉记忆,以携带先前生成的帧。然而,我们发现一旦推演超出训练时程,模型就无法再可靠地寻址存储的内容,因为时间旋转位置编码(RoPE)的偏移随后会超出训练期间看到的范围,模型难以通过注意力检索相关的视觉信息。此外,在RoPE旋转后的空间中朴素地压缩缓存,会因平均不相容的位置相位而破坏记忆。为解决这一问题,我们提出了WorldTrace,一种面向长时程视觉持久性的免训练记忆框架。WorldTrace通过为每个摘要槽分配一个不同的、分布内的虚拟位置,使压缩后的记忆保持可寻址。在这个可寻址缓存中,我们研究了两种记忆压缩方法:WorldTrace-Field压缩历史以保持时间一致性,而WorldTrace-Landmark在检测到的转换处存储逐字场景痕迹以用于情景回想。我们进一步引入了LoopBench,一个评估压缩缓存是否能在长时间绕行后重建先前访问场景的基准测试。WorldTrace-Field在LoopBench上将时间一致性提升了+15.5%,WorldTrace-Landmark将情景回想提升了+19.5%,从而在无需重新训练的情况下扩展了视觉持久生成。
查看原文
查看缓存全文

缓存时间: 2026/08/10 02:12

论文页 - 视频世界模型的可寻址记忆

来源:https://huggingface.co/papers/2608.07408

摘要

我们研究交互式视频世界模型中的视觉持久性。这些模型依靠键值(Key-Value,KV)缓存作为不断增长的视觉记忆,以继承先前生成的帧。然而,我们发现一旦 rollout 超出训练范围,模型便无法可靠地寻址已存储内容,因为时间旋转位置编码(RoPE)的偏移量落到了训练期间未见过的范围之外,模型难以通过注意力检索相关视觉信息。此外,在 RoPE 旋转空间中朴素地压缩缓存会因将不兼容的位置相位平均在一起而破坏记忆。为解决这一问题,我们提出 WorldTrace,一个无需训练的记忆框架,用于长程视觉持久性。WorldTrace 通过为每个摘要槽位分配一个不同的、分布内的虚拟位置,来保持压缩记忆的可寻址性。在这个可寻址缓存中,我们研究了两种记忆压缩方法:WorldTrace-Field 压缩历史以实现时间一致性,而 WorldTrace-Landmark 在检测到的转换处存储逐字的场景轨迹以实现情景回忆。我们进一步推出 LoopBench,一个评估压缩缓存能否在长时间绕路后重建先前访问场景的基准。在 LoopBench 上,WorldTrace-Field 将时间一致性提升 +15.5%,WorldTrace-Landmark 将情景回忆提升 +19.5%,无需重新训练即可扩展视觉持久生成。

查看 arXiv 页面 (https://arxiv.org/abs/2608.07408) 查看 PDF (https://arxiv.org/pdf/2608.07408) 项目页面 (https://research.nvidia.com/labs/sil/projects/WorldTrace/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.07408)

在您的 agent 中获取此论文:

hf papers read 2608\.07408

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型

0

暂无模型引用此论文。

在模型 README.md 中引用 arxiv.org/abs/2608.07408,即可从本页面链接到该模型。

引用该论文的数据集

0

暂无数据集引用此论文。

在数据集 README.md 中引用 arxiv.org/abs/2608.07408,即可从本页面链接到该数据集。

引用该论文的 Spaces

0

暂无 Space 引用此论文。

在 Space README.md 中引用 arxiv.org/abs/2608.07408,即可从本页面链接到该 Space。

包含此论文的合集

0

暂无合集包含此论文。

将此论文添加到一个合集 (https://huggingface.co/new-collection) 中,即可从本页面链接到该合集。

相似文章

用于视频世界模型的潜在空间记忆

Hugging Face Daily Papers

本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。