DWM: 在潜在世界模型中分离世界效应与动作

arXiv cs.AI 论文

摘要

提出DWM框架,该框架将潜在世界模型的转移分解为动作驱动和动作不变(世界效应)组件,在具有持久世界效应的基准上提高了规划成功率。

arXiv:2607.18715v1 公告类型: 新 摘要:潜在世界模型是现代基于模型的控制的基础,但当前的动作条件化公式使用单一、无差别的目标来监督下一个潜在状态的转移,迫使一个单一的学习信号吸收所有状态变化的来源。然而,在现实世界中,转移来自两个异质来源:由智能体引发的动作驱动组件,以及动作不变的世界效应——即在空动作下仍然会发生的变化,由环境的内在动力学决定(例如,重力驱动的滑动、惯性、接触反弹和持续漂移)。将它们融合到一个单一目标中会使得潜在转移中的这两者纠缠在一起,阻止模型将观察到的变化归因于其根本原因,并损害所学动力学的可迁移性。我们提出了DWM(分解世界模型),这是一个在监督层面实现这种分解的框架。DWM通过一个辅助的世界头来增强潜在世界模型的预测器,该世界头通过归一化的世界对比目标进行正则化以实现动作不变性,而原始的预测头通过正交约束与其耦合;两者共同将预测的转移显式地分解为动作不变分量和互补的动作驱动分量,而不改变底层架构或推理流程。为了在持久世界效应下评估DWM,我们构建了三个标准控制基准的W变体——PushT-W、Reacher-W和TwoRoom-W——每个都实例化了一个独特的动作不变动力学。DWM在普通基准上与强基线持平,并且在W变体上实现了CEM规划成功率的平均绝对提升13.1%。
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:22

# DWM:在潜在世界模型中分离世界效应与动作效应
来源:https://arxiv.org/html/2607.18715
Yi-Ge Zhang Tianqi Du Qi Zhang Yisen Wang 北京大学

###### 摘要

潜在世界模型是现代基于模型的控制的核心,然而当前基于动作条件的公式化方法通过一个*单一的、无差异化的目标*来监督下一个潜在状态的转移,迫使一个单一的学习信号吸收状态变化的每一种来源。然而,在现实世界中,转移源于两个异质来源:一个由智能体引起的*动作驱动*组件,以及一个*动作不变的世界效应*——即在空动作下仍然会发生的、由环境内在动力学(例如,重力驱动的滑动、惯性、接触反弹和持续漂移)决定的变化。将两者融合到一个单一目标中,会在潜在转移内部纠缠它们,阻止模型将观察到的变化归因于其根本原因,并削弱所学动力学的可迁移性。我们提出了**DWM**(*分解世界模型*),这是一个监督级别的框架,实现了这种分解。DWM 用一个辅助的*世界头*(受归一化的世界对比目标的约束以保持动作不变性)来增强潜在世界模型的预测器,同时原始的*预测头*通过正交性约束与其耦合;这两个信号共同诱导出预测转移到一个动作不变组件和一个互补的动作驱动组件的显式加法分解,而无需改变底层架构或推理流程。为了在持久世界效应下评估 DWM,我们构建了三个标准控制基准的*W变体*——PushT-W、Reacher-W 和 TwoRoom-W——每个都实例化了一个不同的动作不变动力学。DWM 在平坦对应基准上匹配了强基线,并在所有 W 变体上的 CEM 规划成功率上实现了**13.1%**的平均绝对提升。

## 1 引言

潜在世界模型在具身人工智能中越来越受到关注:通过在学习的潜在空间中预测未来状态,它们能够直接从像素观测中实现基于模型的规划、基于想象力的策略学习和长时域推理(Hafner等人,2019 (https://arxiv.org/html/2607.18715#bib.bib4); 2020 (https://arxiv.org/html/2607.18715#bib.bib5); 2021 (https://arxiv.org/html/2607.18715#bib.bib6); 2023 (https://arxiv.org/html/2607.18715#bib.bib7); Hansen等人,2022 (https://arxiv.org/html/2607.18715#bib.bib8); 2024 (https://arxiv.org/html/2607.18715#bib.bib9))。最近由 LeWM 代表的动作条件潜在动力学公式化方法(Assran等人,2023 (https://arxiv.org/html/2607.18715#bib.bib10); Maes等人,2026 (https://arxiv.org/html/2607.18715#bib.bib11))通过端到端学习在操作、导航和控制任务中泛化的动作条件潜在动力学,进一步强化了这一方向,同时表明一个紧凑的潜在转移模型通常足以从原始图像中规划竞争性策略。

然而,一个物理转移很少仅由智能体的动作引起。考虑一个在倾斜表面上滑动的方块。其运动的一部分是由智能体的推动产生的,而另一部分即使智能体什么也不做也会发生,因为重力会继续移动方块。我们将这两种变化来源分别称为**动作效应**和**世界效应**。更精确地说,世界效应是如果当前动作被替换为空动作,在同一状态和历史下仍然会持续的转移部分;动作效应是由于所选动作而导致的剩余变化。当物体由于惯性移动、铰接体在重力下摆动或智能体在持续外力作用下漂移时,也会出现类似的分解。

现有的动作条件潜在世界模型通常不区分这两个来源。它们使用一个同时包含动作效应和世界效应的单一目标来预测下一个潜在状态。因此,模型只观察到它们的组合结果,没有收到明确的训练信号表明转移的哪一部分是由动作引起的,哪一部分反映了环境的自主动力学。这种限制在近乎静态的基准(如平坦桌面推放)中可能隐藏,因为物体主要响应智能体而移动。当环境独立于当前动作继续演变时,这种限制就变得更加重要。在这种情况下,一个无法可靠表示世界效应的模型可能产生不准确的多步展开,导致规划者基于对环境将如何演变的不正确预测来选择动作。

图1 (https://arxiv.org/html/2607.18715#S1.F1) 说明了 PushT-W(标准 PushT 任务的一个重力扰动变体)上的这一问题。即使推子保持静止,方块也继续沿重力方向滑动。传统的单头潜在世界模型无法准确再现这种被动运动,因此其预测轨迹偏离目标。相比之下,我们的模型明确鼓励潜在转移将重力引起的世界效应与推子引起的变化分离开,从而产生更准确的展开和成功的规划。这些观察结果激发了本工作的核心问题:

参见图标题

图 1:PushT-W 上的世界/动作纠缠。在每个面板中,**灰色 T** 是当前方块,**绿色 T** 是目标姿势,**蓝色圆圈**是推子(即由智能体控制的末端执行器)。每个面板左上角标记为 **g** 的箭头表示定义 PushT-W 世界效应的持续重力的方向:即使推子空闲,方块也沿着 **g** 持续滑动。**上**:零动作展开,推子保持不动,隔离动作不变的世界效应——灰色 T 沿着 **g** 向右下滑动而没有任何推动。**中**:在同一回合中,单头 LeWM 基线将动作驱动和动作不变的组件融合为一个单一的下一个潜在目标,未能重现滑动运动:其预测的方块轨迹偏离绿色目标。**下**:我们提出的 DWM 在同一回合中解开了两个组件,同时恢复了方块的重力诱导滑动和推子驱动的变化,使灰色 T 回到绿色 T 上。

> *潜在世界模型能否通过明确分离世界自身的运动与智能体动作引起的变化而得到改进?*

我们通过“分解世界模型”(DWM)来回答这个问题,这是一个用于动作条件潜在世界模型的世界/动作分解训练框架。DWM 保留了原始的预测头,它继续预测完整的下一个潜在状态,并且在推理时是唯一使用的头。在训练期间,我们引入一个辅助的世界头,它被鼓励捕获转移的动作不变组件。对于相同的观测历史,我们扰动当前动作并要求世界头的预测保持稳定,同时保留区分不同状态的能力。然后,我们将互补的动作驱动组件定义为完整预测与世界头预测之间的残差,并引入一个正交性正则化器,以鼓励两个组件编码互补的转移信息。由于额外的分支仅在训练期间使用,DWM 不改变底层世界模型的推理时架构或规划流程。

为了评估 DWM,我们构建了三个标准基准的控制变体,即 PushT-W、Reacher-W 和 TwoRoom-W,其中环境表现出一个持续的动作不变运动来源。这三个任务分别引入了重力驱动的滑动、垂直平面重力和恒定环境漂移。它们的原始对应物作为控制组,其中自主世界动力学较弱或不存在。我们还在 Ball-in-Cup 上进行了评估,这是一个更具挑战性的模拟控制任务,具有状态依赖的摆式动力学。在所有三个 W 变体基准上,DWM 将 CEM 规划成功率分别提高了 12.0%、10.7% 和 16.7%,相当于平均绝对提升 13.1%。同时,它在原始任务上与单头基线保持相当。表示诊断、多步展开评估、消融研究和分布外测试进一步表明,这些增益与世界头中增加的动作不变性和更准确的潜在动力学相关。

我们的主要贡献如下:

- •我们识别了动作条件潜在世界模型的一个监督级别限制:单个下一个潜在目标融合了由智能体引起的变化以及在没有当前动作时也会发生的变化,没有提供明确信号来分离这两个转移来源。
- •我们引入了一个受控基准套件,包括 PushT-W、Reacher-W 和 TwoRoom-W,这些基准向标准控制任务添加了持续的动作不变动力学,同时保留了其原始目标和平坦对应物作为控制组。
- •我们提出了 DWM,这是一个训练框架,通过一个辅助的动作不变世界头和一个互补的世界/动作分离目标来增强现有潜在世界模型,而不改变基础骨干网络或推理时流程。
- •DWM 在所有三个 W 变体任务上持续改善 CEM 规划,平均改善 13.1%,将 Ball-in-Cup 上的性能提高 6.0%,并在没有显著世界效应的任务上保持性能。

## 2 相关工作

#### 用于规划的潜在世界模型。

潜在世界模型学习用于想象、规划和策略学习的紧凑预测表示(Hafner等人,2021 (https://arxiv.org/html/2607.18715#bib.bib6); 2023 (https://arxiv.org/html/2607.18715#bib.bib7); Hansen等人,2022 (https://arxiv.org/html/2607.18715#bib.bib8); 2024 (https://arxiv.org/html/2607.18715#bib.bib9); Maes等人,2026 (https://arxiv.org/html/2607.18715#bib.bib11); Micheli等人,2023 (https://arxiv.org/html/2607.18715#bib.bib47); Robine等人,2023 (https://arxiv.org/html/2607.18715#bib.bib48))。尽管模型架构和下游使用存在差异,大多数现有方法都使用单一的下一个状态预测目标来训练潜在动力学,其中一个预测器输出与未来的潜在表示匹配。在这种公式化下,由智能体动作引起的状态变化和由环境自身动力学控制的状态变化被吸收到同一个监督信号中。我们的方法是对规划器(Rubinstein, 1997 (https://arxiv.org/html/2607.18715#bib.bib24); Chua等人,2018 (https://arxiv.org/html/2607.18715#bib.bib25); Hansen等人,2024 (https://arxiv.org/html/2607.18715#bib.bib9))、骨干网络(Bardes等人,2024 (https://arxiv.org/html/2607.18715#bib.bib52); Caron等人,2021 (https://arxiv.org/html/2607.18715#bib.bib72))和策略目标(Hafner等人,2020 (https://arxiv.org/html/2607.18715#bib.bib5); 2023 (https://arxiv.org/html/2607.18715#bib.bib7))方面先前进展的补充。相反,它通过引入两个具有互补目标的投影头来修改共享潜在预测器的监督,从而在训练期间明确分离动作驱动和动作不变的动力学。

#### 世界模型中潜在转移的分解。

大多数先前的工作集中在解耦潜在状态所代表的内容,而不是导致其转移的原因。以对象为中心的模型将状态分解为实体或空间组件(Kipf等人,2020 (https://arxiv.org/html/2607.18715#bib.bib19); Ferraro等人,2025 (https://arxiv.org/html/2607.18715#bib.bib20); Locatello等人,2020 (https://arxiv.org/html/2607.18715#bib.bib64)),而面向任务的方法分离任务相关和无关因素(Wang等人,2022 (https://arxiv.org/html/2607.18715#bib.bib15); Fu等人,2021 (https://arxiv.org/html/2607.18715#bib.bib81))。外生状态方法通常丢弃不可控因素(Efroni等人,2022 (https://arxiv.org/html/2607.18715#bib.bib82)),而在我们的设置中,这些动力学必须保留并进行预测以用于规划。最近关于软状态不变世界模型的工作(Saanum等人,2024 (https://arxiv.org/html/2607.18715#bib.bib99))通过正则化动作效应依赖于当前状态的程度来简化潜在动力学。这使得动作效应更加精简,但仍然使下一个潜在目标混合了动作不变的世界运动与动作驱动的变化。Iso-Dream (Pan等人,2022 (https://arxiv.org/html/2607.18715#bib.bib83)) 对可控和不可控动力学使用单独的潜在分支和前向模型。由于世界效应和动作效应共同确定下一个潜在状态,目标不是丢弃动作不变的组件,而是在世界和动作驱动的部分之间分配监督。相比之下,我们保留了一个共享的编码器和预测器,并仅通过两个浅层投影头(具有互补目标和正交性约束)来分离这些组件。因此,我们的方法将解耦视为一个监督问题而非架构分解,使其适用于现有动作条件潜在世界模型,无需修改其骨干网络。

## 3 潜在动力学中的世界效应和动作效应

### 3.1 预备知识

#### 动作条件潜在世界模型。

我们采用所有动作条件潜在世界模型共享的通用框架(Assran等人,2023 (https://arxiv.org/html/2607.18715#bib.bib10); Maes等人,2026 (https://arxiv.org/html/2607.18715#bib.bib11)):模型不是预测未来像素,而是预测未来*潜在变量*,所有监督都发生在该潜在空间中。具体来说,我们假设可以访问原始观测 \(o_t\)(例如像素)和执行动作 \(a_t\) 的轨迹,并在它们之上引入三个组件:

- •一个**编码器** \(\phi\),将每个原始观测 \(o_t\) 映射到一个紧凑的潜在状态 \(z_t = \phi(o_t)\),即所有下游预测和规划所基于的表示;
- •一个**动作条件预测器** \(g\),将过去潜在状态和动作的短上下文窗口 \((z_{t-h+1:t}, a_{t-h+1:t})\) 总结为一个中间展开状态 \(r_t = g(z_{t-h+1:t}, a_{t-h+1:t})\),其中 \(h\) 是上下文长度;\(r_t\) 可以理解为“模型在观察到截至时间 \(t\) 的历史并采取动作 \(a_t\) 后关于世界的信息”;
- •一个**投影头**,读取 \(r_t\) 并产生预测的下一个潜在状态 \(\hat{z}_{t+1}\)¹。

预测器通过均方损失 \(L_{\mathrm{pred}}\) 将 \(\hat{z}_{t+1}\) 回归到真实的下一个潜在状态 \(z_{t+1}\) 进行训练,同时结合一个潜在空间正则化器 \(L_{\mathrm{sigreg}}\),防止表示坍缩为平凡常数;我们将标准训练目标记为 \(L_{\mathrm{WM}} = L_{\mathrm{pred}} + \lambda_{\mathrm{sig}} L_{\mathrm{sigreg}}\)。

#### 潜在空间中的 CEM 规划。

对于控制,我们直接在由编码器诱导的潜在空间中,结合交叉熵方法(CEM)进行模型预测规划。

¹ 在没有歧义的情况下,我们将一般的单步预测 \(\hat{z}_{t+1}\) 简记为 \(\hat{z}\),同时在多步展开中保留完整的时间索引。# DWM:在潜在世界模型中分离世界效应与动作效应
来源:https://arxiv.org/html/2607.18715
Yi-Ge Zhang Tianqi Du Qi Zhang Yisen Wang 北京大学

###### 摘要

潜在世界模型是现代基于模型控制的核心。然而,当前基于动作条件的公式化方法通过一个*单一的、无差异化的目标*来监督下一个潜在状态的转移,迫使一个单一的学习信号吸收状态变化的每一种来源。但在现实世界中,转移源于两个异质来源:智能体引起的*动作驱动*组件,以及*动作不变的世界效应*——即在空动作下仍会发生的、由环境内在动力学(例如,重力驱动的滑动、惯性、接触反弹和持续漂移)决定的变化。将两者融合到一个单一目标中,会在潜在转移内部纠缠它们,阻止模型将观察到的变化归因于其根本原因,并削弱所学动力学的可迁移性。我们提出**DWM**(*分解世界模型*),这是一个监督级框架,实现了这种分解。DWM 用一个辅助的*世界头*(通过归一化的世界对比目标被正则化为动作不变)增强潜在世界模型的预测器,同时原始的*预测头*通过正交性约束与之耦合;这两个信号共同诱导出预测转移到一个动作不变组件和一个互补的动作驱动组件的显式加法分解,而无需改变底层架构或推理流程。为了在持久世界效应下评估 DWM,我们构建了三个标准控制基准的*W变体*——PushT-W、Reacher-W 和 TwoRoom-W——每个都实例化了一个不同的动作不变动力学。DWM 在平坦对应基准上匹配了强基线,并在所有 W 变体上的 CEM 规划成功率上实现了**13.1%**的平均绝对提升。

## 1 引言

潜在世界模型在具身人工智能中越来越受到关注:通过在学习的潜在空间中预测未来状态,它们能够直接从像素观测中实现基于模型的规划、基于想象力的策略学习和长时域推理(Hafner 等人,2019;2020;2021;2023;Hansen 等人,2022;2024)。最近由 LeWM 代表的动作条件潜在动力学公式化方法(Assran 等人,2023;Maes 等人,2026)通过端到端学习在操作、导航和控制任务中泛化的动作条件潜在动力学,进一步强化了这一方向,同时表明紧凑的潜在转移模型通常足以从原始图像中规划竞争性策略。

然而,物理转移很少仅由智能体的动作引起。考虑一个在倾斜表面上滑动的方块。其运动的一部分由智能体的推动产生,而另一部分即使智能体什么也不做也会发生,因为重力会继续移动方块。我们将这两种变化来源分别称为**动作效应**和**世界效应**。更精确地说,世界效应是如果当前动作被替换为空动作,在同一状态和历史下仍然会持续的转移部分;动作效应是由于所选动作而导致的剩余变化。当物体因惯性移动、铰接体在重力下摆动或智能体在持续外力作用下漂移时,也会出现类似的分解。

现有的动作条件潜在世界模型通常不区分这两个来源。它们使用一个同时包含动作效应和世界效应的单一目标来预测下一个潜在状态。因此,模型只观察到它们的组合结果,没有收到明确训练信号表明转移的哪一部分由动作引起,哪一部分反映环境的自主动力学。这种限制在近乎静态的基准(如平坦桌面推放)中可能隐藏,因为物体主要响应智能体而移动。当环境独立于当前动作继续演变时,这种限制就变得更加重要。在这种情况下,无法可靠表示世界效应的模型可能产生不准确的多步展开,导致规划者基于对环境将如何演变的不正确预测来选择动作。

图1说明了 PushT-W(标准 PushT 任务的重力扰动变体)上的这一问题。即使推子保持静止,方块也继续沿重力方向滑动。传统的单头潜在世界模型无法准确再现这种被动运动,因此其预测轨迹偏离目标。相比之下,我们的模型明确鼓励潜在转移将重力引起的世界效应与推子引起的变化分离开,从而产生更准确的展开和成功的规划。这些观察结果激发了本工作的核心问题:

> *潜在世界模型能否通过明确分离世界自身的运动与智能体动作引起的变化而得到改进?*

我们通过“分解世界模型”(DWM)来回答这个问题,这是一个用于动作条件潜在世界模型的世界/动作分解训练框架。DWM 保留了原始的预测头,它继续预测完整的下一个潜在状态,并且在推理时是唯一使用的头。在训练期间,我们引入一个辅助的世界头,它被鼓励捕获转移的动作不变组件。对于相同的观测历史,我们扰动当前动作并要求世界头的预测保持稳定,同时保留区分不同状态的能力。然后,我们将互补的动作驱动组件定义为完整预测与世界头预测之间的残差,并引入一个正交性正则化器,以鼓励两个组件编码互补的转移信息。由于额外的分支仅在训练期间使用,DWM 不改变底层世界模型的推理时架构或规划流程。

为了评估 DWM,我们构建了三个标准基准的控制变体,即 PushT-W、Reacher-W 和 TwoRoom-W,其中环境表现出持续的动作不变运动来源。这三个任务分别引入了重力驱动的滑动、垂直平面重力和恒定环境漂移。它们的原始对应物作为控制组,其中自主世界动力学较弱或不存在。我们还在 Ball-in-Cup 上进行了评估,这是一个更具挑战性的模拟控制任务,具有状态依赖的摆式动力学。在所有三个 W 变体基准上,DWM 将 CEM 规划成功率分别提高了 12.0%、10.7% 和 16.7%,相当于平均绝对提升 13.1%。同时,它在原始任务上与单头基线保持相当。表示诊断、多步展开评估、消融研究和分布外测试进一步表明,这些增益与世界头中增加的动作不变性和更准确的潜在动力学相关。

我们的主要贡献如下:

- •我们识别了动作条件潜在世界模型的一个监督级限制:单个下一个潜在目标融合了由智能体引起的变化以及在没有当前动作时也会发生的变化,没有提供明确信号来分离这两个转移来源。
- •我们引入了一个受控基准套件,包括 PushT-W、Reacher-W 和 TwoRoom-W,这些基准向标准控制任务添加了持续的动作不变动力学,同时保留了其原始目标和平坦对应物作为控制组。
- •我们提出了 DWM,这是一个训练框架,通过一个辅助的动作不变世界头和一个互补的世界/动作分离目标来增强现有潜在世界模型,而不改变基础骨干网络或推理时流程。
- •DWM 在所有三个 W 变体任务上持续改善 CEM 规划,平均改善 13.1%,将 Ball-in-Cup 上的性能提高 6.0%,并在没有显著世界效应的任务上保持性能。

## 2 相关工作

#### 用于规划的潜在世界模型。

潜在世界模型学习用于想象、规划和策略学习的紧凑预测表示(Hafner 等人,2021;2023;Hansen 等人,2022;2024;Maes 等人,2026;Micheli 等人,2023;Robine 等人,2023)。尽管模型架构和下游使用存在差异,大多数现有方法都使用单一的下一个状态预测目标来训练潜在动力学,其中一个预测器输出与未来的潜在表示匹配。在这种公式化下,由智能体动作引起的状态变化和由环境自身动力学控制的状态变化被吸收到同一个监督信号中。我们的方法是对规划器(Rubinstein, 1997; Chua 等人,2018; Hansen 等人,2024)、骨干网络(Bardes 等人,2024; Caron 等人,2021)和策略目标(Hafner 等人,2020;2023)方面先前进展的补充。相反,它通过引入两个具有互补目标的投影头来修改共享潜在预测器的监督,从而在训练期间明确分离动作驱动和动作不变的动力学。

#### 世界模型中潜在转移的分解。

大多数先前的工作集中在解耦潜在状态所代表的内容,而不是导致其转移的原因。以对象为中心的模型将状态分解为实体或空间组件(Kipf 等人,2020;Ferraro 等人,2025;Locatello 等人,2020),而面向任务的方法分离任务相关和无关因素(Wang 等人,2022;Fu 等人,2021)。外生状态方法通常丢弃不可控因素(Efroni 等人,2022),而在我们的设置中,这些动力学必须保留并进行预测以用于规划。最近关于软状态不变世界模型的工作(Saanum 等人,2024)通过正则化动作效应依赖于当前状态的程度来简化潜在动力学。这使得动作效应更加精简,但仍然使下一个潜在目标混合了动作不变的世界运动与动作驱动的变化。Iso-Dream(Pan 等人,2022)对可控和不可控动力学使用单独的潜在分支和前向模型。由于世界效应和动作效应共同确定下一个潜在状态,目标不是丢弃动作不变的组件,而是在世界和动作驱动的部分之间分配监督。相比之下,我们保留了一个共享的编码器和预测器,并仅通过两个浅层投影头(具有互补目标和正交性约束)来分离这些组件。因此,我们的方法将解耦视为一个监督问题而非架构分解,使其适用于现有动作条件潜在世界模型,无需修改其骨干网络。

## 3 潜在动力学中的世界效应和动作效应

### 3.1 预备知识

#### 动作条件潜在世界模型。

我们采用所有动作条件潜在世界模型共享的通用框架(Assran 等人,2023;Maes 等人,2026):模型不是预测未来像素,而是预测未来*潜在变量*,所有监督都发生在该潜在空间中。具体来说,我们假设可以访问原始观测 \(o_t\)(例如像素)和执行动作 \(a_t\) 的轨迹,并在它们之上引入三个组件:

- •一个**编码器** \(\phi\),将每个原始观测 \(o_t\) 映射到一个紧凑的潜在状态 \(z_t = \phi(o_t)\),即所有下游预测和规划所基于的表示;
- •一个**动作条件预测器** \(g\),将过去潜在状态和动作的短上下文窗口 \((z_{t-h+1:t}, a_{t-h+1:t})\) 总结为一个中间展开状态 \(r_t = g(z_{t-h+1:t}, a_{t-h+1:t})\),其中 \(h\) 是上下文长度;\(r_t\) 可以理解为“模型在观察到截至时间 \(t\) 的历史并采取动作 \(a_t\) 后关于世界的信息”;
- •一个**投影头**,读取 \(r_t\) 并产生预测的下一个潜在状态 \(\hat{z}_{t+1}\)¹。

预测器通过均方损失 \(L_{\mathrm{pred}}\) 将 \(\hat{z}_{t+1}\) 回归到真实的下一个潜在状态 \(z_{t+1}\) 进行训练,同时结合一个潜在空间正则化器 \(L_{\mathrm{sigreg}}\),防止表示坍缩为平凡常数;我们将标准训练目标记为 \(L_{\mathrm{WM}} = L_{\mathrm{pred}} + \lambda_{\mathrm{sig}} L_{\mathrm{sigreg}}\)。

#### 潜在空间中的 CEM 规划。

对于控制,我们直接在由编码器诱导的潜在空间中,结合交叉熵方法(CEM)进行模型预测规划。

¹ 在没有歧义的情况下,我们将一般的单步预测 \(\hat{z}_{t+1}\) 简记为 \(\hat{z}\),同时在多步展开中保留完整的时间索引。

相似文章

世界-动作交互模型的DAWN

Hugging Face Daily Papers

本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。

AGWM:面向具有组合先决条件环境的具身世界模型

arXiv cs.AI

本文提出了 AGWM,一种基于可供性的世界模型,该模型使用动态先决条件图来跟踪具有组合先决条件环境中的动作可执行性。实验表明,与标准世界模型相比,AGWM 能够降低预测误差并提高泛化能力。