World Machine:面向时间序列的生成式世界建模
摘要
World Machine 提出了一种基于 Transformer 的生成式世界建模架构,用于时间序列分析。该架构通过潜在状态自适应地处理不同长度的上下文,解决了传统 Transformer 的二次内存成本问题。在合成数据集上的实验验证了该方法的可行性,并显示出相比传统 Transformer 的改进。
arXiv:2605.23025v1 Announce Type: new
摘要:世界模型代表了生成式 AI 的范式转变,旨在以结构化和可泛化的方式追求对环境的预测性理解与可控模拟。我们提出 World Machine,一种用于时间序列的生成式世界建模架构。这是一种基于 Transformer 的架构,带有潜在状态,能够适应不同数量的观测数据和上下文。这展示了相对于传统 Transformer 的改进,传统 Transformer 的计算和内存成本随上下文呈二次方增长。在提出的合成数据集 Toy1D 上的实验验证了该方法的可行性,展示了传统 Transformer 不具备的能力,并突出了训练协议中每个组件的贡献。
查看缓存全文
缓存时间: 2026/05/25 08:58
# World Machine:面向时间序列的生成式世界建模
来源:https://arxiv.org/html/2605.23025
Elton Cardoso do Nascimento¹,Alexandre da Silva Simões²,Esther Luna Colombini³,Ricardo Ribeiro Gudwin¹,Paula Dornhofer Paro Costa¹
¹,³ 坎皮纳斯州立大学(UNICAMP),{FEEC, IC}
² 圣保罗州立大学(UNESP),科学与技术研究所,索罗卡巴
[email protected], [email protected], {estherlc, gudwin, paulad}@unicamp.br
###### 摘要
世界模型代表了生成式人工智能的一种范式转变,其目标是以结构化和可泛化的方式对环境进行预测性理解和可控仿真。我们提出 World Machine,一种用于时间序列的生成式世界建模架构。这是一种基于 Transformer 的架构,具有潜在状态,能够适应不同数量的观测数据和上下文。这相较于传统 Transformer(其计算和内存成本随上下文呈二次方增长)体现出了改进。在提出的合成数据集 Toy1D 上的实验验证了该方法的可行性,展示了传统 Transformer 所不具备的能力,并突出了训练协议中每个组件的贡献。
## 1 引言
基于深度学习的世界模型是一种新兴的模型类别。它们展现出可用于模拟环境的行为,智能体可以在其中学习和行动,使我们能够探索和与之互动,或创建更理解并在我们的世界中自主行动的智能体[11(https://arxiv.org/html/2605.23025#bib.bib9),1(https://arxiv.org/html/2605.23025#bib.bib10),13(https://arxiv.org/html/2605.23025#bib.bib11)]。
为了直观理解什么是世界模型,假设一名排球运动员。他观察到球在网边升起,他的大脑快速整合了多种感觉信息流——包括视觉、听觉和本体感觉。这些感知数据立即与先前的经验相结合:他对比赛规则的知识,通过无数小时的练习形成的“具身物理直觉”,以及伴随这些经验的情感记忆。通过这种复杂的综合,他构建了对环境中实体(其他球员、球网和球)的理解,并预测它们在接下来几毫秒内的轨迹。基于这些预测,他制定并选择行动方案。在执行这个计划时,他实时持续更新自己的感知,动态调整动作直到回合结束。整个过程在几秒钟内完成,如果没有大脑仅凭当前感觉输入就能预测世界未来状态的能力,就不可能及时对环境刺激做出反应。这种对世界的内部想象表征就是世界模型。
计算世界模型可能代表了一种有前景的解决方案,适用于需要更自适应系统的应用——能够在复杂环境中进行上下文整合的模型。它们还可以促进通用模型的发展,涵盖更广泛的配置且具有更高的逼真度。它们可以协助规划任务,预测智能体可以执行的动作序列,并响应变化。它们还能处理异质数据,包括不同格式、动态特性和频率的数据。
在这项工作中,我们提出并研究了 World Machine 的基本组件,这是一种新颖的计算世界模型架构和训练协议,旨在探索基于世界模型的深度学习方法。该架构的特点包括:创建世界模型的内部表征,处理不同感觉通道(可能跨多种模态)的能力,以及在预测质量和成本之间的可控权衡。我们在第 2 节(https://arxiv.org/html/2605.23025#S2)中详细介绍了我们的方法与其他当前方法之间的具体差异。
我们在一个简单的合成数据集上,通过旨在评估模型特定能力的任务来评估所提出的方法。我们展示了该方法如何实现上下文截断下的推理(尽管性能有所下降),从而降低当前 Transformer 的二次成本。
所提出架构、协议和实验的代码已发布[7(https://arxiv.org/html/2605.23025#bib.bib18)],以及本工作所使用的 Docker 镜像也一并提供[6(https://arxiv.org/html/2605.23025#bib.bib16)]。
## 2 相关工作
学习三维数字游戏世界的动态是近期多个模型的焦点,例如 GameNGen、Oasis 和 WHAM[17(https://arxiv.org/html/2605.23025#bib.bib12),9(https://arxiv.org/html/2605.23025#bib.bib8),12(https://arxiv.org/html/2605.23025#bib.bib7)]。这些模型在游戏数据(包括图像和玩家动作)上进行训练,以开发能够捕捉并再现游戏底层动态的生成系统。换句话说,仅通过观察游戏的连续场景以及玩家在每个时刻执行的动作,这些模型就被训练去推断游戏规则、场景中特定实体的功能,以及最终玩家在这个虚拟世界中交互的物理规律。通过这样做,它们展示了执行通常与手工仿真相关的能力的潜力,如基于编程规则的传统游戏引擎。
在更大规模上,RFTM(实时帧模型)和 Genie 3 是能够表示更大、更动态世界并为用户提供更强控制的模型[18(https://arxiv.org/html/2605.23025#bib.bib6),1(https://arxiv.org/html/2605.23025#bib.bib10)]。然而,由于这些系统的技术细节尚未完全公开,分析其底层机制或在其架构上构建都很困难。已发布的有限信息表明,这些模型也将可观测数据转换为内部世界表征,反之亦然。
在架构方面,Dreamer[11(https://arxiv.org/html/2605.23025#bib.bib9)]创建了一个潜在状态来对世界建模。它使用两个模型来完成这个过程:一个模型基于先前状态、动作和观测来学习当前状态的表征,另一个模型基于动作来学习从先前状态开始的转移。
在这项工作中,我们提出了一种新颖的架构,综合并改进了先前的方法。与近期生成系统如 GameNGen、Oasis 和 WHAM 类似,我们的架构将世界建模为自回归序列。然而,我们的主要贡献是显式地对生成这些数据的内部状态进行建模,而不仅仅是感觉流之间的相关性。与 Dreamer 相比,我们采用了一个单一的端到端架构,统一了表征和转移,将经验视为高阶马尔可夫过程,并且不在概念上区分动作和观测等通道。整个模型通过单一的感觉损失进行优化。最后,为了解决近期大规模模型的不透明性,我们发布了一个完全开源、可复现的基线。
## 3 方法
我们介绍 World Machine 架构和提出的训练协议(第 3.1 节(https://arxiv.org/html/2605.23025#S3.SS1))。为了评估所提出的方法和问题设定,我们定义了一组任务和指标(第 3.2 节(https://arxiv.org/html/2605.23025#S3.SS2)),以及一个合成数据集 Toy1D(第 3.3 节(https://arxiv.org/html/2605.23025#S3.SS3))。
### 3.1 World Machine 与训练协议
World Machine 是一个生成式、世界建模、多模态的时间序列模型(图 LABEL:fig:main_figure(b))。它是生成式的,因为它生成数据;是世界建模的,因为它尝试创建外部世界的内部表征;是多模态的,因为它能同时处理多种感觉类型;是时间序列的,因为它按顺序生成和观测数据。
它基于仅解码器的 Transformer 模型,这些模型在潜在世界状态上操作。潜在世界状态,记为 ws,是一个实值向量,编码了模拟世界的当前配置。它扮演着与传统 Transformer 架构中嵌入表示类似的角色。这些潜在状态随时间演化,并以固定的时间分辨率(称为世界模拟频率)按顺序组织。由此产生的世界状态序列形成了一个向量 ws→,其中每个元素对应一个特定的时间步,如式 (1) 所示。
ws→ = [ws₀, ws₁, ws₂, ..., wsₙ₋₁]. (1)
感觉数据是模型对外部世界的观测。它们被组织成感觉通道,这些通道可以是输入和/或输出通道。每个输入通道通过一个预编码器,在时间步上为每个维度生成一个向量。这伴随着感觉掩码,指示数据在特定时间步是否存在。ws 可以被解码以生成当前步每个通道的感觉数据。
模型实际执行仿真的主要部分称为核心。它能够使用先前状态(以及可选地多个先前状态和感觉数据)生成下一个状态。它由 Transformer 模块组成,这些模块可以是无感觉调节的标准模块,或者是受感觉数据条件化的感觉模块,每个模块接收来自特定通道的数据。所使用的感觉模块属于 adaLn-Zero[15(https://arxiv.org/html/2605.23025#bib.bib5)]类型,它通过调节数据(感觉数据)对主数据(嵌入/潜在世界状态)执行缩放和偏移。在感觉数据不存在的情况下,该模块在时间步上不执行这些操作。
在所有模块之后,核心使用 tanh 执行状态激活。正如我们在第 4.2 节(https://arxiv.org/html/2605.23025#S4.SS2)中讨论的,这个操作对于保持模型稳定性很重要。
我们使用 ALiBi 作为位置编码,原因有二,这使其与常用的正弦编码器[16(https://arxiv.org/html/2605.23025#bib.bib4)]不同。首先,因为它是一种无界方法,我们可以使用不同长度的序列。其次,因为它使用一种“修改注意力矩阵”的注入方法,位置信息直接注入注意力矩阵中,而不是注入到嵌入/ws 中,从而不会给 ws 引入无关的干扰[10(https://arxiv.org/html/2605.23025#bib.bib3)]。
模型的训练任务是正确预测下一个时间步的输出感觉数据,类似于下一个词元预测任务。为此,定义的优化损失是每个输出感觉维度损失的加权和。这就在 ws 和感觉数据之间创建了一种关系,因为 ws 必须能够包含生成该数据所需的信息。
训练一个 World Machine 需要不同的过程,因为核心在 ws 上操作,这些数据需要事先准备好。然而,模型本身会找出如何编码这些状态。这就好比试图训练一个模型却没有所有输入数据。状态发现过程就是为解决这个问题而开发的。状态在训练开始时使用均匀分布(∼Uniform(-1,1))进行初始化。在每个 epoch 中,核心输出中预测的 ws→ 被在时间上移位,使用“左移算子” S,并作为下一个 epoch 的输入数据保存回去。我们用上标表示潜在状态向量的 epoch:ws→ⱼ。在所有 epoch 中,序列中的第一个状态被修改为零向量:
ws→ⱼ = S(ws→ⱼ₋₁) ∀j, wsⁱ₀ = 0→. (2)
这样,当训练优化模型权重时,数据集中每个输入对应的 ws 也会被更新。在推理过程中,模型的操作类似于常规 Transformer,执行从零向量开始的自回归过程。
为了改进模型并增强其在 ws 中生成有用表示的能力,我们还提出了训练过程中的其他步骤。图 2(https://arxiv.org/html/2605.23025#S3.F2)详细说明了下面描述的协议在每个阶段执行的操作:
- • 感觉掩码:在训练过程中涉及掩盖感觉数据,在每个批次中隐藏随机数量的数据。进行掩码时,我们还可以在将存储的 ws 替换为新的 ws 之前验证感觉掩码,确保当数据被掩码时不进行替换。这在训练初期尤其重要,此时模型尚未在没有感觉数据的情况下生成良好的状态。
- • 序列断裂:通过此协议,我们在随机位置打断每个序列,创建 k 个片段。每个片段单独通过模型,输出被拼接起来计算损失。因此,模型需要能够处理没有前序数据的序列中间状态。我们还可以将一个片段的最后一个状态转移到下一个片段的第一个状态,这称为快速前向。假设是这增加了信息从一个状态到另一个状态的传播,帮助模型学习编码良好的状态,因为梯度从片段损失通过这个单一状态产生的“瓶颈”传播。随着 k 参数的增加,训练接近顺序自回归过程。
- • 噪声添加:在每个批次中向 ws 和/或感觉维度添加高斯噪声,均值与标准偏差可控。
- • 短时回忆:此协议创建新的合成感觉通道,对应于相对于当前时间步的过去和/或未来数据。对于每个新通道,还必须向模型添加一个新的解码器。最多可以创建 n 个通道,使用步长进行采样。每个采样数据由训练开始时固定的随机投影器进行投影。
- • 局部模式:对于每个片段,随机地,可以禁用模型的注意力过程。层输出直接是外部投影后的值矩阵。这限制了模型的视野,使其只能处理当前的 ws 和感觉数据。
序列断裂和局部模式都使得训练步骤类似于训练 RNN,通过并行处理隐藏状态。
请参见图注
图 2:World Machine 训练过程,使用所有协议时。它结构化在循环中,并添加了一个“片段循环”,用于遍历片段。每个循环都有代码回调点。操作由实现它们的协议组织。
### 3.2 任务与指标
为了评估所创建的架构和协议,我们提出了一些在训练后执行的不同任务,它们使用与训练相同类型的损失:
- • 正常:是一个正常的自回归推理。注意,这与训练期间计算的损失不同,因为我们不使用训练期间“并行”更新的状态,而是使用从零状态开始顺序估计的状态。
- • 使用状态:在先前编码的状态上进行推理,没有感觉数据。我们可以在一个推理步骤中计算,并行处理序列中的元素,因为相似文章
Looped World Models
Looped World Models 通过共享的Transformer块引入迭代潜在状态细化,实现了100倍的参数效率,同时根据预测复杂度自适应调整计算深度。
当前世界模型缺乏持久状态核心
本文认为当前世界模型缺乏持久状态核心,提出一种混合方法,通过η-伪酉算子动力学添加时间因果结构,将预训练的GPT-2转化为时间推理模型。
PanoWorld:真实世界全景生成
PanoWorld提出了一种利用旋转等变表示实现全景世界模型中长程记忆的方法,包含三阶段训练流程和全新大规模数据集World360。该模型以大幅优势超越了其他方法。
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
CG-World:面向世界模型的大规模世界状态数据集与协议
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。