使用潜空间世界模型预测后果并强化导航策略

arXiv cs.AI 论文

摘要

本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。

arXiv:2608.26190v1 公告类型:新 摘要:世界模型使智能体能够推理未来结果并从其状态转移知识中学习策略,但现有方法主要关注重建未来观测或特征,这引入了不必要的复杂性,并限制了其在决策中的有效性。在这项工作中,我们提出了一种用于机器人导航的兼容性预测潜空间世界模型(LWM),它预测基于动作条件的潜特征兼容性,而非重建观测。我们的关键洞察是空间邻近性与潜特征相似性相关,使得可以直接在潜空间中评估动作后果。为了支持反事实训练,我们的模型利用跨轨迹采样的动作序列,并学习预测哪些序列更接近目标。此外,我们展示了如何利用学习到的世界模型从无标签视频数据中监督策略学习,并通过在世界模型内完全进行的强化学习进一步改进策略。这种想象驱动的框架消除了对动作标注和额外环境交互的需求。在多个真实世界机器人导航数据集上的大量实验表明,我们的方法在预测准确性、策略学习和真实世界导航性能方面显著优于先前的世界模型和模仿学习方法。代码、预训练模型和额外材料可在 https://wzm206.github.io/latent-world-model-nav 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:31

# 基于潜在世界模型的预测后果与强化导航策略  
来源:https://arxiv.org/html/2608.26190  
曾茂 (https://orcid.org/0009-0000-7029-6546)  
机构:中国科学院大学前沿交叉科学学院  
机构:中国科学院自动化研究所  
高巍 (https://orcid.org/0000-0003-2257-5684)  
致谢:通讯作者。  
机构:中国科学院自动化研究所  
机构:中国科学院大学人工智能学院  
沈书翰 (https://orcid.org/0000-0002-8704-7914)  
机构:中国科学院自动化研究所  
机构:中国科学院大学人工智能学院  

#### 摘要  
世界模型使智能体能够推理未来结果,并基于其对状态转换的知识学习策略,但现有方法主要聚焦于重建未来观测或特征,这引入了不必要的复杂性并限制了其决策效能。本文提出了一种用于机器人导航的兼容性预测潜在世界模型,它预测动作条件下的潜在特征兼容性而非重建观测。我们的关键洞察是空间邻近性与潜在特征相似性相关,从而能够直接在潜在空间评估动作后果。为支持反事实训练,我们的模型利用跨轨迹采样的动作序列,学习预测哪些序列能使目标更近。此外,我们展示了如何利用所学世界模型从未标注视频数据中监督策略学习,并通过在世界模型内完全进行强化学习进一步优化策略。这种想象驱动框架无需动作标注和额外环境交互。在多个真实世界机器人导航数据集上的大量实验表明,我们的方法在预测准确性、策略学习和真实世界导航性能方面显著优于先前的世界模型和模仿学习方法。代码、预训练模型及额外材料可在 https://wzm206.github.io/latent-world-model-nav/ 获取。  
*关键词* 世界模型 · 机器人学习 · 视觉导航  

## 1 引言  
自主导航要求机器人在执行动作前推理其在真实世界中的后果。世界模型已成为实现此类预测推理的有前景范式,它通过从离线数据中学习环境动态实现此功能(参考文献 13)。通过内部模拟未来结果,世界模型使智能体能够规划、评估并改进策略,而无需代价高昂的真实世界交互。这种范式对机器人领域尤其具有吸引力,因为该领域的数据收集成本高昂且安全限制约束了在线探索。然而,现有世界模型存在一个根本局限:它们通常被训练为严格基于数据集中已执行的真实动作来重建未来观测。当我们将世界模型用于规划或决策时,模型需要推断未实际发生的情况,也称为反事实推理。这导致了一个关键错配:规划需要反事实推理来评估备选动作,而训练却仅依赖于真实轨迹。此外,优化像素或潜在重建会引入不必要的复杂性,累积误差,并生成与决策不匹配的表征。我们认为世界模型应专注于预测动作后果,而非生成精确观测。本文提出了一种根本不同的视角:我们不再预测未来观测,而是训练一个世界模型来预测动作后果与未来潜在状态之间的兼容性,从而将反事实推理引入训练阶段。我们的方法基于一个简单而强大的观察:在导航任务中,空间邻近性与视觉特征相似性高度相关。因此,无需重建精确的未来观测,只需预测兼容性即可。为实现这种反事实训练,我们引入了一个基于想象的世界模型,该模型利用不同轨迹中的动作序列在潜在空间中模拟反事实未来。给定当前观测,我们的模型预测由多个候选动作序列产生的潜在状态特征,并学习区分哪些序列能导致状态更接近真实未来。至关重要的是,在训练期间模拟这些反事实场景可显著最大化数据利用效率,因为在机器人领域收集真实世界交互数据代价高昂且充满挑战。这种表述使模型能够学习以决策为中心的鲁棒表征,无需像素级预测。因此,我们实现了在反事实想象中训练世界模型。除世界模型学习外,我们还展示了如何利用所学模型从未标注视频数据中训练和改进导航策略。我们首先使用世界模型根据预测的与目标状态的相似性为候选动作序列打标签,从而在没有真实动作的情况下实现监督策略学习。然后,我们通过在学习的世界模型内完全进行强化学习进一步改进策略。训练良好的世界模型可自然地作为奖励模型。这种想象驱动的强化学习使策略改进无需额外环境交互。我们在真实环境和三个机器人导航数据集上评估了我们的方法。我们的方法相比先前的世界模型和导航方法显示出显著改进。结果表明,兼容性预测为生成式世界建模提供了一种强大而高效的替代方案,能够实现从离线数据进行有效规划和策略学习。我们总结贡献如下:  
- • 基于潜在兼容性预测的新世界模型表述。我们提出预测动作条件下的潜在特征兼容性而非重建未来观测,从而实现高效且以决策为导向的世界建模。  
- • 使用跨轨迹动作序列的反事实想象框架。我们的方法利用不同轨迹中的动作序列来模拟替代未来,从而实现纯从离线数据进行反事实推理。  
- • 完全在世界模型内进行策略学习和强化的统一框架。我们展示了如何利用未标注视频数据监督策略学习,并通过基于想象的强化学习进一步改进策略。  
- • 在真实世界环境和机器人导航基准测试中实现最先进性能。  

## 2 相关工作  
在大语言模型、视频生成和具身智能发展的推动下,世界模型已获得广泛关注。尽管概念仍在演变,但它主要服务于两个功能:学习内部表征以理解环境,以及利用预测建模指导外部动作的决策。  
### 2.1 构建世界模型  
众多研究聚焦于构建世界模型。基于视频生成的方法直观且展示了显著的物理一致性——例如理解重力和碰撞——突显了其作为隐式世界模型的潜力。这些方法通常将未来帧预测建立在当前观测和动作的条件下。例如,LingBot-World 采用虚拟渲染管线进行交互式数据生成,NWM 利用大规模真实世界数据集生成多样化的动作条件视频,而 3D-VLA 将此范式扩展到3D点云。然而,像素级视频生成存在推理速度慢和物理不一致的问题。Dino-WM 通过转向使用 Dino-v2 编码器进行特征生成来解决这个问题,尽管其主要目标仍是重建。相比之下,我们的方法完全避免了像素空间生成,防止模型专注于无关细节。通过优化在潜在空间中预测动作后果而非重建特征,我们的方法消除了迭代扩散的需求,从而实现快速预测和决策。  
### 2.2 在世界模型中学习  
最终,世界模型旨在促进智能体的决策和学习。这些模型中的学习范式通常分为两类。  
#### 2.2.1 世界模型与策略模型的联合训练  
类似于基于模型的强化学习,这些方法联合优化两个模型。PlaNet 引入了 RSSM 架构以在紧凑潜在空间中实现动态学习。Dreamer 和 DreamerV2 从图像中学习潜在动态,并通过想象轨迹优化策略,在长期任务中表现出色。PWM 促进了在正则化世界模型内的一阶策略优化。然而,这些方法通常需要持续的智能体-环境交互,将其限制在模拟环境中并限制了现实世界的实用性。虽然我们的方法也利用了潜在状态表征,但它可以直接部署在真实世界中,无需在线交互。  
#### 2.2.2 使用冻结的世界模型作为模拟器  
或者,冻结的世界模型可以作为逼真的模拟器。DreamZero 通过联合视频-动作预测学习物理动态以实现实时控制。World-env 用虚拟模拟器替代物理交互以进行强化学习训练。RWM 使用双自回归模型实现稳健的 sim-to-real 迁移,WorldVLA 统一了 VLA 和世界模型。这些方法通常在合成的像素级图像上训练策略,这比预测特征空间相似性要复杂得多。此外,视频生成的泛化仍然存在问题。例如,自动驾驶模型由于缺乏训练数据,难以想象分布外场景(如在人行道上驾驶)。相反,我们的跨轨迹想象方法可以有效评估此类偏差,使智能体安全地与目标保持对齐。参考图注 图1:LWM概述。(a) 训练世界模型时,我们需要预测不同动作序列的后果并获取与目标的兼容性。(b) LWM 可以为策略模型提供伪标签。(c) 策略模型可以在 LWM 中得到强化。  
## 3 方法  
我们提出了一种兼容性预测潜在世界模型,它通过预测特征兼容性而非重建未来观测来学习动作条件下的潜在动态。如图1所示,我们的框架支持从离线轨迹进行反事实推理,以缓解数据标注和收集的挑战。我们的框架支持完全在 LWM 内进行策略学习和强化。下文将详细阐述我们的方法。  
### 3.1 一般问题表述  
我们考虑一个离线轨迹数据集:D={τ_i}_{i=1}^N, τ_i={(o_1, a_1), (o_2, a_2), ..., (o_T, a_T)},其中 o_t ∈ R^{H×W×3} 是时刻 t 的视觉观测,a_t ∈ R^{d_a} 是机器人在时刻 t 的动作。在视觉导航任务中,d_a=3 表示运动坐标 (x, y, θ)。我们的目标是学习一个世界模型 WM,使其能够评估从给定观测开始的任意动作序列的后果。在世界模型内,可分为两个模块:预测模块和判别模块。在预测模块中,世界模型预测执行动作后的状态特征。在判别模块中,世界模型确定预测特征与目标之间的兼容性。  
ẑ_{t+1:t+K} = WM_predict(o_t, A_{t:t+K-1}), C_{t+1:t+K} = WM_discriminative(ẑ_{t+1:t+K}, o_g)  
其中 o_t 是时刻 t 的观测,A_{t:t+K-1} = {a_t, a_{t+1}, ..., a_{t+K-1}} 是未来的动作序列,ẑ_{t+1:t+K} 是预测特征,C 是兼容性。在视频生成世界模型中,公式(2)中的 ẑ_{t+1:t+K} 可以被视为基于观测和动作序列生成的图像。公式(2)中的 C 通过预训练特征损失获得,例如比较生成图像与目标图像之间的 LPIPS 损失。与这些工作不同,我们不试图重建未来观测。相反,我们将整个过程引入潜在空间,以实现更好的决策和规划。  
### 3.2 潜在世界模型  
#### 3.2.1 潜在观测与动作编码  
我们首先使用视觉编码器将观测映射到潜在特征空间:  
z_t^o = E_o(o_t), z_t ∈ R^{N_p×D}  
其中 E_o 是一个视觉 Transformer 编码器。N_p 表示图像中的块数。类似地,我们将每个动作编码为潜在 token:  
z_{t:t+K-1}^a = E_a(A_{t:t+K-1}), z_{t:t+K-1}^a ∈ R^{(K-1)×D}

相似文章

基于潜世界模型的强化规划

arXiv cs.LG

本文介绍了强化规划,一种利用潜世界模型学习改进多步骤规划的方法,在视觉导航和机器人操作等任务中取得了近乎完美的成功率,并且效率显著高于手工设计的算法。

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。