视频世界模型中的记忆(6分钟阅读)
摘要
NVIDIA及其合作者的一项最佳论文研究引入了WorldTrace,这是一个无需训练的框架,通过分配固定的槽位秩位置,使自回归视频世界模型中的压缩记忆保持可寻址,从而实现连贯的长程生成和超越训练视野的长距离回忆。
NVIDIA的WorldTrace是一个无需训练的框架,通过为压缩记忆分配稳定的分布内位置偏移,使其在长时间的自回归视频生成过程中保持可访问。
查看缓存全文
缓存时间:
2026/08/12 20:20
# 视频世界模型的可寻址内存
来源:https://research.nvidia.com/labs/sil/projects/WorldTrace/
ICML 2026 F2S Workshop(https://icml2026-f2s-workshop.github.io/),最佳论文
- Xindi Wu (https://xindiwu.github.io/)1, 2
- Sven Elflein (https://selflein.github.io/)1, 3, 4
- James Lucas (https://www.cs.toronto.edu/~jlucas/)1
- Olga Russakovsky (https://www.cs.princeton.edu/~olgarus/)2
- Laura Leal\-Taixé (https://dvl.in.tum.de/team/lealtaixe/)1
- Despoina Paschalidou (https://paschalidoud.github.io/)1
- Jonathan Lorraine (https://www.jonlorraine.com/)1
- Aljosa Osep (https://aljosaosep.github.io/)1
- 1NVIDIA (https://nv-tlabs.github.io/)
- 2Princeton University (https://www.princeton.edu/)
- 3University of Toronto (https://www.utoronto.ca/)
- 4Vector Institute (https://vectorinstitute.ai/)
**TL;DR.** WorldTrace 通过固定的分布内槽位位置保持压缩内存可寻址,然后使用规范键写入器实现两个目标:**WorldTrace-Field** 用于更平滑的长距离展开,**WorldTrace-Landmark** 用于回忆之前访问过的场景,且无需重新训练生成器。
## 摘要
我们研究了自回归视频世界模型中的视觉持久性,其中键值(KV)缓存存储不断增长的视觉记忆,但一旦超出训练视界,这些记忆就难以检索。我们识别出分布外的时间RoPE偏移是根本原因:过去的观测可能仍然被缓存,但变得无法被注意力寻址。WorldTrace 是一种免训练框架,通过为每个槽位分配一个相对于当前帧固定的、分布内的位置,保持压缩内存可寻址。基于这种可寻址缓存,**WorldTrace-Field** 通过旋转不变的历史聚合改进连贯的长距离展开,而 **WorldTrace-Landmark** 则保留逐字的场景轨迹用于长程召回。
自回归视频世界模型有望提供交互式世界,但一旦生成超过训练视界,**视觉持久性**就会崩溃。
自回归视频世界模型能否在任意生成长度下可靠地记住它去过哪里?
## 为什么超越训练视界后记忆会失效
一旦生成超过训练上下文窗口,就会出现两个耦合的瓶颈:
### 1. 可寻址性
时间RoPE偏移超出训练范围,因此即使缓存记忆物理上存在,也变得**不可读**。超过训练窗口后,注意力查询会看到模型从未学会寻址的相位。
### 2. 内容保真度
在RoPE旋转空间中进行朴素的键平均会混合不兼容的相位。由此产生的相位抵消会破坏压缩摘要本应携带的信号。
## 方法:WorldTrace
双层KV缓存:一个逐字的近期窗口加上 $N_s$ 个摘要槽位,位置**仅按槽位等级分配**(与视界无关),因此每个摘要在任何生成长度下都保持分布内。两个互补的写入器填充这些槽位:
WorldTrace 缓存流水线:近期窗口加上具有槽位等级位置的摘要槽位;两个写入器,WT-Field 和 WT-Landmark。
### 槽位等级位置分配
摘要槽位 $s$ 的虚拟位置:
$$v_s = q \- \bigl\(L_{\mathrm{train}} \- 1 \- s\bigr\)\cdot F$$
其中 $q$ 是当前查询位置,$L_{\mathrm{train}}$ 是训练上下文长度,$F$ 是每个自回归块的帧数。槽位位置取决于等级,而不是展开长度。
### 规范 WT-Field 写入器
$$K_{\mathrm{field}}^{(k)}(t_v) = R(\theta_k t_v)\,\frac{1}{M}\sum_{m=1}^{M} R(\-\theta_k t_m)\, K_{t_m}^{(k)}$$
键首先被对齐到共享的规范相位,求平均,然后重新旋转到摘要槽位位置。这避免了相位抵消,并保留平均注意力logits。WT-Field 针对压缩下的时间一致性,**而非**召回机制。
### 冻结的 WT-Landmark 写入器
$$K_{\mathrm{land}}^{(k)}(t_v) = R(\theta_k t_v)\, R(\-\theta_k t_{\ell^\*})\, K_{t_{\ell^\*}}^{(k)}$$
场景进入帧从规范键信号中检测,原样存储到摘要槽位,并在插入时冻结,以避免重复的取消旋转→重新旋转位移导致的bfloat16漂移。WT-Landmark 保持槽位等级位置不变,并针对长距离展开中的情节召回。
## 结果
### WorldTrace-Landmark:情节召回
LoopMem 通过要求模型返回之前访问过的场景,并使用位置对齐CLIP(PAC)对重新生成的视图进行评分来测试情节召回。在拓扑、路径长度、相机朝向和多次回访设置下,WT-Landmark 始终优于滑动窗口召回:在长ABA路径上为0.825对0.627,在标准ABA上为0.864对0.723,在ABABA上为0.941对0.892。最难的 $360^\circ$ 全景旋转增益最小(0.577对0.559),使局限可见,而非被汇总结果掩盖。
#### 拓扑
改变返回起始场景前中间路径点的数量。
#### 边长度
增加每条边的生成块数,以拉长上下文距离。
#### 朝向
在相机朝向变化(包括宽全景旋转)下测试召回。
#### 多次回访
多次回访同一地点,测试重复的情节召回。
LoopMem 基准场景:不同的拓扑、边长度、相机朝向和多次回访模式。
海报中的 LoopMem 基准场景:拓扑、边长度、相机朝向和多次回访召回。
LoopMem PAC 结果,比较滑动窗口和 WorldTrace-Landmark 在不同拓扑、边长度、朝向和多次回访场景下的表现。
完整 LoopMem 套件的 PAC 结果。WT-Landmark 在每个评估场景中都提升了召回率,在较长路径上增益最大,在 $360^\circ$ 相机全景旋转上增益最小。
#### 全景召回视频
##### 全景路径
#### ABA 召回视频
##### ABA 路径
### WorldTrace-Field:一致性展开
保持内容操作符固定(规范平均),仅改变位置分配,槽位等级位置在8倍视界下将 Block-Rel 提升 **+5.9% TempSSIM**,在16倍下提升 **+2.8%**。在24倍(N=48)时,WT-Field 相比滑动窗口将 TempSSIM 提高 **+15.5%**,同时降低局部场景漂移,而每个依赖 $N$ 的位置公式都会非单调地退化。
相同的条件,四种位置方案。滑动窗口和 Block-Rel 在 $t = 18$–$24$ 处发散(红色边框);WT-Field 在 $t = 48$(训练视界的24倍)时仍保持一致。
#### 一致性展开视频
##### 滑动窗口
##### Block-Rel
##### Centroid
##### WT-Field
## 要点
### 诊断
- 长视界失败是**位置问题**,而非内容问题。
- 在RoPE旋转空间中进行朴素平均会导致**
相似文章
Hugging Face Daily Papers
本文介绍了WorldTrace,一种无需训练的记忆框架,用于长时程视频世界模型,使压缩缓存保持可寻址;同时引入了LoopBench,一个用于在长时间绕行后进行情景回想的基准测试。它在LoopBench上将时间一致性提升了+15.5%,情景回想提升了+19.5%。
Hugging Face Daily Papers
本文介绍了用于视频世界模型的潜在空间记忆,将3D场景信息直接存储在扩散潜在空间中,以避免昂贵的像素空间重建。所提出的Mirage框架实现了高达10.57倍的生成加速和55倍的内存缩减,同时在WorldScore和RealEstate10K上取得了最先进的性能。
X AI KOLs Following
这篇博客文章介绍了长时域视频生成和世界模型中'Forgetting Wall'的概念,认为主要瓶颈是内存(KV缓存增长)而非计算,并探讨了压缩作为未来模型的关键方向。
Hugging Face Daily Papers
ReWorld 提出了一个交互式世界模型,该模型使用混合注意力窗口和分布匹配的LoRA蒸馏,将短期控制与长期记忆解耦,实现了具有高动作保真度和回忆能力的实时视频生成。
Hugging Face Daily Papers
Memorizon 通过相机共视关系让每个被评分的片段检索一个共享的、有界的 top-K 隐变量库,从而在流式世界模型中将长跨度监督与注意力解耦,以极低的额外开销实现超出上下文窗口的一致性重访。与滑动窗口基线相比,检索将重访一致性提升最高达 30%,且结果表明模型确实利用了检索到的隐变量。