VisualPatchWorld:作为规划潜在结构化表示的代码世界模型

arXiv cs.CL 论文

摘要

VisualPatchWorld 提出了一种将世界动力学学习为代码的方法,能够从数据中构建可检查和可编辑的模拟器。在导航和操作任务中,它实现了强大的规划成功率。

arXiv:2607.25236v1 Announce Type: new \n摘要:不同的研究路线以不同方式使用“世界模型”这一术语,但它们有一个共同目标:以支持感知、模拟和规划的形式,捕捉世界在行动下的演化过程。两种典型的实现方式是在连续向量空间中学习动力学的神经预测器,以及暴露显式状态和物理定律的手工构建物理引擎。神经预测器可从数据中扩展,但隐含了动力学形式;物理引擎可检查和编辑,但难以大规模构建。我们提出了 VisualPatchWorld (VPW),它将世界动力学表示为代码。VPW 首先通过短主动探测选择定性的动力学形式,然后通过最小化多步预测误差,从记录的状态-动作轨迹中拟合该形式的自由参数。生成的程序可以像模拟器一样向前滚动,以源代码形式检查,并用于模型预测控制;图像派生的场景图可以在重新规划时提供实时状态。在与先前基于代码的世界模型的比较中,VPW 实现了 69.0% 的平均规划成功率,并超过了最强的代码基线 23.5 个百分点。最大的收益出现在选择正确的定性动力学至关重要时。在相同规划器下,诱导模型在导航和抓取丰富的控制任务上接近真实物理引擎的成功率;在接触丰富的推动任务中仍存在剩余差距,而在引擎中检查一小部分有希望的规划方案可以缩小大部分差距。这些结果建立了自动构建对规划有用的代码世界模型的实用途径。代码可在 https://github.com/HKBU-KnowComp/VisualPatchWorld/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# VisualPatchWorld:作为规划潜在结构化表示的代码世界模型

来源: https://arxiv.org/html/2607.25236
andJiaxuan Xiong香港浸会大学香港中国

###### 摘要

不同的研究路线以不同方式使用术语“世界模型”,但它们都有一个共同目标:以支持感知、仿真和规划的形式捕捉世界在行动下的演化方式。两个突出的实现方式是在连续向量空间中学习动力学的神经预测器,以及暴露显式状态和物理定律的手工构建物理引擎。神经预测器从数据中扩展,但动力学形式是隐式的;物理引擎可检查、可编辑,但难以大规模构建。我们引入了VisualPatchWorld (VPW),它将世界动态表示为代码。VPW首先通过短时主动探测选择定性的动力学形式,然后通过最小化多步预测误差,从记录的状态-动作轨迹中拟合该形式的自由参数。由此得到的程序可以像仿真器一样前向滚动,以源代码形式进行检查,并用于模型预测控制;从图像派生的场景图可以在重新规划时提供实时状态。与之前基于代码的世界模型相比,VPW在所有领域平均规划成功率达到69.0%,超过最强的代码基线23.5个百分点。当正确选择定性动力学至关重要时,提升最为显著。在同一个规划器下,诱导模型在导航和抓取丰富的控制任务上接近真实物理引擎的成功率;在接触丰富的推动任务上仍有残留差距,而对引擎中一小部分有前途的候选计划进行重新评分可以弥补大部分差距。这些结果为自动构建可用于规划的代码世界模型提供了一条实用途径。代码可在https://github.com/HKBU-KnowComp/VisualPatchWorld/获取。

††copyright:none

## 1. 引言

参考图注 图 1. 世界模型共享一个智能体-环境循环,但采用不同的形式。VisualPatchWorld将动态表示为代码,桥接了神经潜在模型和手工构建的模拟器(Li,2026 (https://arxiv.org/html/2607.25236#bib.bib1))。

不同的研究路线对“世界模型”一词赋予不同含义,但它们共享一个共同目标,如图1 (https://arxiv.org/html/2607.25236#S1.F1)所示。遵循Li的功能分类(Li,2026 (https://arxiv.org/html/2607.25236#bib.bib1)),一个有用的世界模型应该帮助智能体生成观测、保持对世界当前状态的显式描述,并决定下一步采取什么行动。Li将这些角色称为渲染、仿真和规划。它们是对世界如何运作的相同底层知识的不同投影。仿真是核心:对状态和动力学的显式描述使得视觉外观和行动后果都可计算。手工构建的物理引擎最接近这一理想,但它们仍然难以扩展,因为每个新环境仍然需要人工编写世界如何变化的模型。

另一条互补的研究路线使用神经网络学习世界模型。像Dreamer和LeWM这样的方法(Maes et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib2); Hafner et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib17))从交互数据中训练,并在连续向量空间中表示未来演化。这些模型是数据驱动的、可扩展的,并且对于从学习到的表示中选择行动是有效的,但它们将动力学形式保持为隐式。当预测的未来出错时,没有可编辑的方程或程序供人类或算法检查和修复。另一条路线将动力学编写成代码。像PatchWorld、WorldCoder和PoE-World这样的方法(Bai et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib8); Tang et al.,2024b (https://arxiv.org/html/2607.25236#bib.bib9); Piriyakulkij et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib11))恢复可执行程序,并更接近物理引擎风格的世界模型。然而,它们通常针对准确的下一步预测进行训练,因此程序可能拟合局部转换,但在更长的时间范围内仍然选择较差的行动。

现有方法要么学习可扩展但晦涩的神经动力学,要么编写可执行程序但没有确保恢复的动力学具有正确的定性形式并且对行动选择有用。这提出了三个问题:如何从交互轨迹中自动恢复模拟器风格的动力学?方法如何选择正确的动力学定性形式,而不是拟合错误形式的参数?恢复的模型如何对候选行动序列进行排序,以使短视界规划器能够优化它们,并且相对于真实物理引擎还缺少什么?

VisualPatchWorld (VPW)通过将世界动态表示为代码来解决这些问题。代码作为一种结构化的潜在表示:VPW不是将动态存储在神经激活中,而是编写一个可执行的转移程序,可以像模拟器一样前向滚动,以源代码形式检查,并用于评估候选行动。每个环境都遵循图3 (https://arxiv.org/html/2607.25236#S4.F3)中相同的两级归纳过程。第一级通过短时的主动探测在小候选族(接触力、线性导航、夹爪门控物体运动或关节空间手臂运动学)中选择定性草图,第二级在离线状态-动作轨迹上以多步展开损失拟合该草图。对于规划,拟合后的程序在模型预测控制内对候选行动序列进行评分,而图像派生的场景图可以在重新规划时提供实时状态。

这些设计选择带来了强大的闭环增益。在共享规划器下,该规划器使用真实物理引擎已经至少90%的时间成功,VPW在四个控制领域平均成功率达到69.0%,超过最强的代码基线23.5个百分点。最大的改进出现在定性结构至关重要的情况下:手臂伸展从8%上升到72%,立方体操作达到86%,推动从先前代码方法的接近零提高到22%。相对于真实引擎,在导航和抓取丰富的控制上,诱导评分接近上限;在接触丰富的推动上存在较大差距,而对引擎中一小部分有前途的候选计划进行重新评分可以弥补大部分差距。

#### 贡献

- • **代码世界模型的两级程序归纳**。我们将模拟器风格的世界模型恢复视为一个分阶段问题,并提出VisualPatchWorld,它通过首先通过主动探测选择动力学草图,然后在多步展开损失下拟合其参数以用于规划,从而在每个领域上诱导出可执行的转移程序。
- • **使用诱导程序进行面向规划器的评分**。VPW使用诱导的代码世界模型在滚动时域控制下评估候选行动序列,并在重新规划时将从图像派生的状态估计与搜索时的评分分离开来。
- • **针对代码基线和物理引擎的实验证据**。在四个控制领域上,VPW在共享规划器下改进了程序化代码世界模型基线。相对于真实物理引擎,在导航和抓取丰富的控制上,诱导评分接近上限,而接触丰富的推动则受益于对短候选列表的选择性引擎重新评分。

## 2. 问题定义

我们研究从交互数据中恢复模拟器风格的世界模型的问题。给定观测和行动的轨迹,目标是生成一个可执行的转移程序,人类和算法可以检查、编辑并随时间向前滚动。长期视觉设置将图像观测和动作的数据集 D=\{ (o_t^{(i)}, a_t^{(i)}, o_{t+1}^{(i)}) \}_{i,t} 作为输入,并输出一个关于结构化场景描述的程序 f_θ。在这里,我们将该流程分解:动力学从结构化的状态-动作轨迹中诱导出来,而图像派生的场景图则为闭环重新规划提供实时状态。

#### 挖掘任务

令 g_t = φ(o_t) 表示从观测中提取的以物体为中心的场景描述。挖掘任务是学习一个可执行程序,使得 g_{t+1} = f_θ(g_t, a_t) 在多步时间范围内成立。因为 f_θ 使用结构化状态而非原始像素,问题自然分为视觉抽象 φ 和基于三元组 (g_t, a_t, g_{t+1}) 的动力学归纳。这种分离支持受控评估:真实状态从动力学问题中消除感知误差,而图像派生的状态衡量感知噪声对规划的影响程度。

#### 可执行世界模型

我们要求 f_θ 满足模拟器风格的契约。程序必须接受结构化状态,在候选行动下更新该状态,对行动序列进行前向滚动,并以可检查和可编辑的形式暴露其转移规律。这一要求区分了挖掘出的代码世界模型和神经潜在预测器:当展开失败时,可以检查并修正转移规律本身,而不是作为不透明嵌入重新训练。

#### 评估标准

我们通过挖掘的世界模型是否能支持在保留的起始和目标对上进行闭环控制来评估它。滚动时域模型预测控制作为下游应用测试,而非训练损失本身。起始和目标不同于训练情节,但除非明确声明了分布外测试,否则它们仍处于相同领域内。在 D 上的准确单步预测对于规划器可用的动力学是必要但不充分的。

#### 评估问题

单一的规划分数难以解释,因为失败可能发生在多个阶段。我们将评估组织围绕引言中提出的问题:恢复的程序在多步展开下是否表现得像模拟器风格的世界模型;它是否使用了正确的动力学定性形式;以及其对候选行动序列的评分是否相对于真实物理引擎支持规划。在实践中,我们通过受控分割(感知源、假设类别、展开保真度和规划协议)来定位错误,如第5节 (https://arxiv.org/html/2607.25236#S5)所述。我们在四个LeWM领域(Maes et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib2))研究这个问题,涵盖导航、接触操作和低维连续控制。

## 3. 相关工作

#### 潜在视觉世界模型

潜在世界模型直接从像素学习动力学以用于规划和控製。联合嵌入和基于模型的方法如JEPA和Dreamer将环境演化编码在连续嵌入中(Maes et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib2); Hafner et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib17))。LeWM(Maes et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib2))、DINO-WM(Zhou et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib3))和PLDM(Sobal et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib4))是表1 (https://arxiv.org/html/2607.25236#S5.T1)中的主要潜在参考方法,而GCBC、GCIQL和GCIVL(Ghosh et al.,2021 (https://arxiv.org/html/2607.25236#bib.bib5); Kostrikov et al.,2022 (https://arxiv.org/html/2607.25236#bib.bib6); Park et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib7))提供了离线目标条件策略基线。最近的工作在潜在空间内添加了更多结构:Dyn-O和FIOC-WM学习以物体为中心的动力学和交互(Wang et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib19); Feng et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib20)),因果世界模型将学习的因果变量与语言智能体耦合以进行规划(Gkountouras et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib22))。RLVR-World表明,为可验证的预测指标优化世界模型可以提高下游实用性(Wu et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib21))。这些方法强大且可扩展,但失败的展开不会暴露可编辑的转移规律。

#### 可执行代码世界模型与视觉抽象

一条互补的路线诱导可执行的转移程序。PatchWorld(Bai et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib8))通过反例引导搜索从符号轨迹恢复Python动力学;WorldCoder(Tang et al.,2024b (https://arxiv.org/html/2607.25236#bib.bib9))从交互中学习整体式Python模型;GIF-MCTS(Dainese et al.,2024 (https://arxiv.org/html/2607.25236#bib.bib13))在代码世界模型基准上搜索代码编辑;Curtis等人(Curtis et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib12))为POMDP组件诱导低复杂度的概率程序;PoE-World(Piriyakulkij et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib11))从简短演示中组合加权的程序化专家;OneLife(Khan et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib23))在紧凑探索预算下综合条件激活的程序化规律;Lehrach等人(Lehrach et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib14))为(IS)MCTS综合了游戏代码世界模型。这些方法通常假设结构化状态已经可用,并优化下一步或轨迹拟合。以物体为中心的场景描述通过以转移程序可以消耗的单位暴露位置、方向和关系来桥接图像与这些程序。VPW将此桥接用作规划接口:真实状态隔离动力学问题,图像派生状态在重新规划时衡量感知代价,而VLM基线测试语义识别本身是否足够度量规划。

#### 结构选择与接触感知规划

选择正确的动力学形式也是科学定律发现的核心。LLM-SR和LaSR将方程发现表述为由语言模型引导的程序搜索(Shojaee et al.,2025 (https://arxiv.org/html/2607.25236#bib.bib24); Grayeli et al.,2024 (https://arxiv.org/html/2607.25236#bib.bib25)),而NewtonBench(Zheng et al.,2026 (https://arxiv.org/html/2607.25236#bib.bib15))表明静态回归在复杂系统上失败,判别性探针有助于识别正确的定律类别。VPW在机器人控制中应用了这一思想的受限形式:主动探针在特定于环境的小型动力学形式族中进行选择,然后拟合所选形式。可微分模拟器提供了另一种可执行模板,但更硬的接触模型可能损害CEM规划,即使单步指标有所改进(Zhong et al.,2022 (https://arxiv.org/html/2607.25236#bib.bib18))。这一观察促使VPW使用更平滑的诱导接触规律,以及在搜索过程中可选的基于引擎的验证。

## 4. 方法

VisualPatchWorld通过四个阶段将交互轨迹转化为可执行的代码世界模型,总结在图2 (https://arxiv.org/html/2607.25236#S4.F2)和算法6 (https://arxiv.org/html/2607.25236#alg6)中。首先,每个观测被转换为记录物体姿态和关系的结构化场景描述。其次,成对的前/后描述被导出为用于学习的转移记录。第三,通过图3 (https://arxiv.org/html/2607.25236#S4.F3)中共享的两级过程归纳出一个可执行的Python程序。第

相似文章

PatchWorld: 可执行世界模型的免梯度优化

arXiv cs.CL

PatchWorld 引入了一种免梯度框架,通过反例引导的代码修复,将离线轨迹转换为可执行的 Python 世界模型,从而为部分可观测环境中的规划提供可解释和可检查的信念状态程序。