视频世界模型中的记忆(6分钟阅读)

TLDR AI 论文

摘要

NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。

NVIDIA的WorldTrace是一个无需训练的框架,通过为压缩记忆分配稳定的分布内位置偏移,使其在长时间的自回归视频生成过程中保持可访问。
查看原文
查看缓存全文

缓存时间: 2026/08/12 20:20

# 视频世界模型的可寻址内存 来源:https://research.nvidia.com/labs/sil/projects/WorldTrace/ ICML 2026 F2S Workshop(https://icml2026-f2s-workshop.github.io/),最佳论文 - Xindi Wu (https://xindiwu.github.io/)1, 2 - Sven Elflein (https://selflein.github.io/)1, 3, 4 - James Lucas (https://www.cs.toronto.edu/~jlucas/)1 - Olga Russakovsky (https://www.cs.princeton.edu/~olgarus/)2 - Laura Leal\-Taixé (https://dvl.in.tum.de/team/lealtaixe/)1 - Despoina Paschalidou (https://paschalidoud.github.io/)1 - Jonathan Lorraine (https://www.jonlorraine.com/)1 - Aljosa Osep (https://aljosaosep.github.io/)1 - 1NVIDIA (https://nv-tlabs.github.io/) - 2Princeton University (https://www.princeton.edu/) - 3University of Toronto (https://www.utoronto.ca/) - 4Vector Institute (https://vectorinstitute.ai/) **TL;DR.** WorldTrace 通过固定的分布内槽位位置保持压缩内存可寻址,然后使用规范键写入器实现两个目标:**WorldTrace-Field** 用于更平滑的长距离展开,**WorldTrace-Landmark** 用于回忆之前访问过的场景,且无需重新训练生成器。 ## 摘要 我们研究了自回归视频世界模型中的视觉持久性,其中键值(KV)缓存存储不断增长的视觉记忆,但一旦超出训练视界,这些记忆就难以检索。我们识别出分布外的时间RoPE偏移是根本原因:过去的观测可能仍然被缓存,但变得无法被注意力寻址。WorldTrace 是一种免训练框架,通过为每个槽位分配一个相对于当前帧固定的、分布内的位置,保持压缩内存可寻址。基于这种可寻址缓存,**WorldTrace-Field** 通过旋转不变的历史聚合改进连贯的长距离展开,而 **WorldTrace-Landmark** 则保留逐字的场景轨迹用于长程召回。 自回归视频世界模型有望提供交互式世界,但一旦生成超过训练视界,**视觉持久性**就会崩溃。 自回归视频世界模型能否在任意生成长度下可靠地记住它去过哪里? ## 为什么超越训练视界后记忆会失效 一旦生成超过训练上下文窗口,就会出现两个耦合的瓶颈: ### 1. 可寻址性 时间RoPE偏移超出训练范围,因此即使缓存记忆物理上存在,也变得**不可读**。超过训练窗口后,注意力查询会看到模型从未学会寻址的相位。 ### 2. 内容保真度 在RoPE旋转空间中进行朴素的键平均会混合不兼容的相位。由此产生的相位抵消会破坏压缩摘要本应携带的信号。 ## 方法:WorldTrace 双层KV缓存:一个逐字的近期窗口加上 $N_s$ 个摘要槽位,位置**仅按槽位等级分配**(与视界无关),因此每个摘要在任何生成长度下都保持分布内。两个互补的写入器填充这些槽位: WorldTrace 缓存流水线:近期窗口加上具有槽位等级位置的摘要槽位;两个写入器,WT-Field 和 WT-Landmark。 ### 槽位等级位置分配 摘要槽位 $s$ 的虚拟位置: $$v_s = q \- \bigl\(L_{\mathrm{train}} \- 1 \- s\bigr\)\cdot F$$ 其中 $q$ 是当前查询位置,$L_{\mathrm{train}}$ 是训练上下文长度,$F$ 是每个自回归块的帧数。槽位位置取决于等级,而不是展开长度。 ### 规范 WT-Field 写入器 $$K_{\mathrm{field}}^{(k)}(t_v) = R(\theta_k t_v)\,\frac{1}{M}\sum_{m=1}^{M} R(\-\theta_k t_m)\, K_{t_m}^{(k)}$$ 键首先被对齐到共享的规范相位,求平均,然后重新旋转到摘要槽位位置。这避免了相位抵消,并保留平均注意力logits。WT-Field 针对压缩下的时间一致性,**而非**召回机制。 ### 冻结的 WT-Landmark 写入器 $$K_{\mathrm{land}}^{(k)}(t_v) = R(\theta_k t_v)\, R(\-\theta_k t_{\ell^\*})\, K_{t_{\ell^\*}}^{(k)}$$ 场景进入帧从规范键信号中检测,原样存储到摘要槽位,并在插入时冻结,以避免重复的取消旋转→重新旋转位移导致的bfloat16漂移。WT-Landmark 保持槽位等级位置不变,并针对长距离展开中的情节召回。 ## 结果 ### WorldTrace-Landmark:情节召回 LoopMem 通过要求模型返回之前访问过的场景,并使用位置对齐CLIP(PAC)对重新生成的视图进行评分来测试情节召回。在拓扑、路径长度、相机朝向和多次回访设置下,WT-Landmark 始终优于滑动窗口召回:在长ABA路径上为0.825对0.627,在标准ABA上为0.864对0.723,在ABABA上为0.941对0.892。最难的 $360^\circ$ 全景旋转增益最小(0.577对0.559),使局限可见,而非被汇总结果掩盖。 #### 拓扑 改变返回起始场景前中间路径点的数量。 #### 边长度 增加每条边的生成块数,以拉长上下文距离。 #### 朝向 在相机朝向变化(包括宽全景旋转)下测试召回。 #### 多次回访 多次回访同一地点,测试重复的情节召回。 LoopMem 基准场景:不同的拓扑、边长度、相机朝向和多次回访模式。 海报中的 LoopMem 基准场景:拓扑、边长度、相机朝向和多次回访召回。 LoopMem PAC 结果,比较滑动窗口和 WorldTrace-Landmark 在不同拓扑、边长度、朝向和多次回访场景下的表现。 完整 LoopMem 套件的 PAC 结果。WT-Landmark 在每个评估场景中都提升了召回率,在较长路径上增益最大,在 $360^\circ$ 相机全景旋转上增益最小。 #### 全景召回视频 ##### 全景路径 #### ABA 召回视频 ##### ABA 路径 ### WorldTrace-Field:一致性展开 保持内容操作符固定(规范平均),仅改变位置分配,槽位等级位置在8倍视界下将 Block-Rel 提升 **+5.9% TempSSIM**,在16倍下提升 **+2.8%**。在24倍(N=48)时,WT-Field 相比滑动窗口将 TempSSIM 提高 **+15.5%**,同时降低局部场景漂移,而每个依赖 $N$ 的位置公式都会非单调地退化。 相同的条件,四种位置方案。滑动窗口和 Block-Rel 在 $t = 18$–$24$ 处发散(红色边框);WT-Field 在 $t = 48$(训练视界的24倍)时仍保持一致。 #### 一致性展开视频 ##### 滑动窗口 ##### Block-Rel ##### Centroid ##### WT-Field ## 要点 ### 诊断 - 长视界失败是**位置问题**,而非内容问题。 - 在RoPE旋转空间中进行朴素平均会导致**

相似文章

面向视频世界模型的可寻址记忆

Hugging Face Daily Papers

本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。

用于视频世界模型的潜在空间记忆

Hugging Face Daily Papers

本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。

ReWorld:一个具有长期记忆的交互式世界模型

Hugging Face Daily Papers

ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。

Memorizon:让世界模型在上下文窗口之外完成训练

Hugging Face Daily Papers

Memorizon 通过相机共视关系让每个被评分的片段检索一个共享的、有界的 top-K 隐变量库,从而在流式世界模型中将长跨度监督与注意力解耦,以极低的额外开销实现超出上下文窗口的一致性重访。与滑动窗口基线相比,检索将重访一致性提升最高达 30%,且结果表明模型确实利用了检索到的隐变量。