PatchWorld: 可执行世界模型的免梯度优化

arXiv cs.CL 论文

摘要

PatchWorld 引入了一种免梯度框架,通过反例引导的代码修复,将离线轨迹转换为可执行的 Python 世界模型,从而为部分可观测环境中的规划提供可解释和可检查的信念状态程序。

arXiv:2605.30880v1 公告类型: 新 摘要:文本智能体环境通常被建模为部分可观测马尔可夫决策过程(POMDP),假设模拟器的潜在状态和转移动态对智能体隐藏。然而,很少有研究探讨是否可以通过可执行代码诱导出世界模型,用于部分可观测性下的预测和规划。我们引入了 PatchWorld,一种免梯度框架,通过反例引导的代码修复,将离线轨迹转换为可执行的 Python 世界模型。与使用黑盒模型预测下一个观测不同,PatchWorld 诱导出符号化信念状态程序,其动作更新可以被检查、重放和局部修补。在七个 AgentGym 环境中,PatchWorld-Simple 在评估的方法中达到了最高的基于代码的规划分数,在实时单步前瞻中实现了 76.4% 的宏观成功率,且世界模型预测模块内部未调用任何 LLM。我们进一步发现,人类指定的残差记忆偏差提高了表面观测保真度,但削弱了决策效用。这暴露了可执行世界模型中的权衡,因为提高观测保真度可能以牺牲动作区分动态为代价,反之亦然。代码可在 https://github.com/HKBU-KnowComp/PatchWorld 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:30

# PatchWorld:可执行世界模型的无梯度优化
来源:https://arxiv.org/html/2605.30880
Jiaxin Bai¹,Yue Guo²,Yifei Dong³,Jiaxuan Xiong⁴,Tianshi Zheng³,Yixia Li⁵ Tianqing Fang³,Yufei Li³,Yisen Gao³,Haoyu Huang³,Zhongwei Xie³ Hong Ting Tsang³,Zihao Wang²,Lihui Liu⁶,Jeff Pan⁷,Yangqiu Song³
¹香港浸会大学²独立研究者³香港科技大学⁴北京理工大学
⁵南方科技大学⁶韦恩州立大学⁷爱丁堡大学
baijiaxin@hkbu\.edu\.hk\{ireneyueguo\}@gmail\.comxiongjiaxuan@bit\.edu\.cn \{ydongbl, tzhengad, ylivm, ygaodi, hhuangcp, zxiebk\}@connect\.ust\.hk \{httsangaj, zwanggc\}@connect\.ust\.hk\{tfangaa, yqsong\}@cse\.ust\.hk liyixia@me\.comhw6926@wayne\.eduj\.z\.pan@ed\.ac\.uk

###### 摘要

文本智能体环境通常被建模为部分可观测马尔可夫决策过程(POMDP),假设模拟器的潜在状态和转移动态对智能体是隐藏的。然而,很少有工作研究是否可以在部分可观测性下诱导出可执行代码作为世界模型用于预测和规划。我们提出了PatchWorld,一个无梯度框架,通过反例引导的代码修复,将离线轨迹转化为可执行的Python世界模型。PatchWorld不是使用黑箱模型预测下一个观测,而是诱导出符号信念状态程序,其动作更新可以被检查、重放和局部修补。在七个AgentGym环境中,PatchWorld-Simple在评估的方法中取得了最高的基于代码的规划分数,在实时一步前瞻中达到76.4%的宏观成功率,同时在世界模型预测模块内部不调用任何LLM。我们进一步发现,人为指定的残差记忆偏差提高了表面观测保真度,但削弱了决策效用。这揭示了可执行世界模型中的一种权衡:提高观测保真度可能以牺牲动作判别动态为代价,反之亦然。代码见https://github.com/HKBU-KnowComp/PatchWorld。

PatchWorld:可执行世界模型的无梯度优化
Jiaxin Bai¹,Yue Guo²,Yifei Dong³,Jiaxuan Xiong⁴,Tianshi Zheng³,Yixia Li⁵ Tianqing Fang³,Yufei Li³,Yisen Gao³,Haoyu Huang³,Zhongwei Xie³ Hong Ting Tsang³,Zihao Wang²,Lihui Liu⁶,Jeff Pan⁷,Yangqiu Song³
¹香港浸会大学²独立研究者³香港科技大学⁴北京理工大学
⁵南方科技大学⁶韦恩州立大学⁷爱丁堡大学
baijiaxin@hkbu\.edu\.hk\{ireneyueguo\}@gmail\.comxiongjiaxuan@bit\.edu\.cn\{ydongbl, tzhengad, ylivm, ygaodi, hhuangcp, zxiebk\}@connect\.ust\.hk\{httsangaj, zwanggc\}@connect\.ust\.hk\{tfangaa, yqsong\}@cse\.ust\.hkliyixia@me\.comhw6926@wayne\.eduj\.z\.pan@ed\.ac\.uk

## 1 引言

人类通过学习紧凑的符号规则来构建科学模型,这些规则解释观测、预测干预的效果并泛化到未见数据(Langley, 1987 (https://arxiv.org/html/2605.30880#bib.bib7); Schmidt and Lipson, 2009 (https://arxiv.org/html/2605.30880#bib.bib8); Zheng et al., 2026 (https://arxiv.org/html/2605.30880#bib.bib15))。在人工智能体中,世界模型扮演类似角色,通过学习潜在动态用于预测、模拟、规划和控制(Ha and Schmidhuber, 2018 (https://arxiv.org/html/2605.30880#bib.bib14); Hafner et al., 2019 (https://arxiv.org/html/2605.30880#bib.bib13); Ke et al., 2019 (https://arxiv.org/html/2605.30880#bib.bib3); LeCun and Courant, 2022 (https://arxiv.org/html/2605.30880#bib.bib12)),最近的系统将这些想法扩展到具身和生成环境(Brohan et al., 2023 (https://arxiv.org/html/2605.30880#bib.bib10); Black et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib9); Bruce et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib11); team et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib28))。对于交互式文本智能体,这样的模型可以捕捉动作如何改变环境,从而支持模拟、诊断,以及在有用时在试错之前进行规划。基于代码的世界模型在这种设置中尤其有吸引力,因为它们可解释、可精确执行且可局部修复(McDermott et al., 1998 (https://arxiv.org/html/2605.30880#bib.bib46); Tang et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib29))。本文询问是否可以在文本智能体环境中实现它们,包括模拟器、接口、游戏和交互式虚拟世界,其中智能体永远无法观察到模拟器的内部状态。

核心障碍是部分可观测性。文本智能体环境本质上是POMDP,其中模拟器维护潜在状态,而智能体在每个动作后仅接收渲染的文本观测(Kaelbling et al., 1998 (https://arxiv.org/html/2605.30880#bib.bib20); Bellemare et al., 2015 (https://arxiv.org/html/2605.30880#bib.bib18); Côté et al., 2018 (https://arxiv.org/html/2605.30880#bib.bib34); Shridhar et al., 2021 (https://arxiv.org/html/2605.30880#bib.bib33); Wang et al., 2022 (https://arxiv.org/html/2605.30880#bib.bib17); Yao et al., 2022 (https://arxiv.org/html/2605.30880#bib.bib43); Xi et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib44); Xu et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib55))。在AlfWorld中,厨房描述省略了关闭抽屉内的物体;在Wordle中,目标词从未被揭示;在WebShop中,后端相关性分数是不可见的。先前的文本环境世界模型通常通过从近期历史预测下一个观测(Li et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib39); Fang et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib16))或将轨迹知识蒸馏成参数化规划辅助工具(Qiao et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib48))来规避这种隐藏状态。这些方法可能有用,但它们不一定维护多步模拟或规划所需的持久信念状态。

这种隐藏状态也使代码归纳欠定。这意味着轨迹日志可以被许多可执行程序复现,范围从记忆每个观测转换的查找表到推断潜在变量并泛化到未见输入的紧凑有状态程序。由于轨迹本身无法区分记忆与结构,学习器需要一种归纳偏好,倾向于通过紧凑潜在状态解释数据的程序。

我们提出PatchWorld来解决这些问题。PatchWorld是一个无梯度框架,为每个环境生成一个世界模型,并将世界模型归纳视为*生成式优化*。给定记录的轨迹,LLM首先合成一个可执行的Python程序,该程序具有显式符号信念状态、转移规则、纠正逻辑和渲染逻辑。然后我们针对相同轨迹重放该程序,将预测失败转化为具体反例,并让LLM提出候选补丁。由于PatchWorld不进行梯度更新,改进来自对程序和补丁的离散搜索,只有当补丁改进正式重放保真度时才被接受。这使得该循环类似于反例引导的归纳综合(CEGIS)(Solar-Lezama et al., 2006 (https://arxiv.org/html/2605.30880#bib.bib4))。因此,输出不仅是一个下一个令牌预测器,也是一个可重用、可检查的关于环境动态的可执行假设,其信念更新和转移规则可以被运行、测试和局部修复。

#### 帕累托前沿,而非单一最佳模型。
在概念层面上,世界建模在两个相关但不同的目标之间拉扯。一些工作强调对未来观测的忠实重建(Li et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib39); Fang et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib16)),而另一些强调通过动作对比预测的下游决策(Ha and Schmidhuber, 2018 (https://arxiv.org/html/2605.30880#bib.bib14); Hafner et al., 2019 (https://arxiv.org/html/2605.30880#bib.bib13); LeCun and Courant, 2022 (https://arxiv.org/html/2605.30880#bib.bib12); Qiao et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib48))。文本环境使这种张力尤为明显。在部分可观测性下,模型可以恢复表面文本但提供弱的动作引导,或者丢失精确渲染但保留有用的转移结构(图3 (https://arxiv.org/html/2605.30880#S5.F3))。因此,PatchWorld将文本世界建模视为一个前沿而非单一最优。PatchWorld-Simple停留在该前沿的纯符号侧,而PatchWorld-Residual添加了人为指定的残差记忆偏差以获得精确、无歧义的文本状态签名。这在不牺牲用于规划的可执行动态的情况下提高了重建保真度。更广泛地说,这些结果表明LLM可以作为*符号优化器*,搜索、修补和改进可执行的符号系统,这些系统在观测预测和规划效用上均能与基于LLM的世界模型竞争。

#### 贡献。
(1)我们识别了基于代码的文本世界建模的一个关键挑战。在部分可观测性下,有限日志可以支持精确重放,但无法揭示泛化所需的紧凑潜在状态规则(第3节 (https://arxiv.org/html/2605.30880#S3.SS0.SSS0.Px2))。(2)我们介绍了PatchWorld,一个无梯度框架,使用LLM作为符号优化器来合成和修复可执行的信念状态程序;其残差记忆变体将重复出现的文本状态证据视为人为指定的归纳偏置,而非无约束缓存(第4节 (https://arxiv.org/html/2605.30880#S4))。(3)在七个AgentGym环境中,我们发现观测重建与规划效用之间存在前沿。PatchWorld-Residual实现了最高的基于代码的保真度,PatchWorld-Simple实现了最高的基于代码的实时前瞻规划分数,我们的诊断解释了这两个目标在何处产生分歧(第5节 (https://arxiv.org/html/2605.30880#S5))。

## 2 相关工作

#### 基于代码和符号的世界模型。
近期工作将环境动态表示为可执行代码或符号规则。WorldCoder诱导转移模型,GIF-MCTS搜索代码编辑,PoE-World组合程序化专家,OneLife学习概率前提和效果规则(Tang et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib29); Dainese et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib35); Piriyakulkij et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib21); Khan et al., 2026 (https://arxiv.org/html/2605.30880#bib.bib45))。PDDL和LLM作为规划形式化器的方法提供了形式化结构,但对于模板繁重的文本渲染不太自然(McDermott et al., 1998 (https://arxiv.org/html/2605.30880#bib.bib46); Tantakoun et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib53); Hu et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib47));神经符号验证同样促使对LLM生成的形式化工件进行可执行检查(Quan et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib25); Su et al., 2026 (https://arxiv.org/html/2605.30880#bib.bib27))。PatchWorld针对部分可观测性,采用显式符号信念状态、基于执行的修复以及在符号动态与基于检索的渲染之间的可调分割。

#### 用于文本智能体的神经和隐式世界模型。
另一种方法是训练或提示LLM预测下一个观测。Word2World(Li et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib39))微调LM作为下一个观测预测器;WebEvolver(Fang et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib16))协同进化智能体和世界模型LLM;WKM(Qiao et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib48))训练参数化知识模型用于智能体规划;WALL-E(Zhou et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib36), 2025 (https://arxiv.org/html/2605.30880#bib.bib37))和CoEx(Kim and Hwang, 2025 (https://arxiv.org/html/2605.30880#bib.bib38))通过在线交互维护规则集。这些方法改善了表面预测或规划,但依赖在线交互或监督微调,而不产生离线可执行的信念程序。PatchWorld离线且无梯度运行,并生成一个可检查的程序,其信念可以被检查和局部修复。

#### 视频和具身世界模型。
在文本之外,一系列并行工作在像素或传感器空间学习动作条件世界模型。Genie(Bruce et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib11))从无标签视频诱导交互环境,CWM(team et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib28))和π₀(Black et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib9))将世界模型抽象扩展到代码执行和机器人控制。这些系统与PatchWorld共享动作条件框架,但依赖像素或传感器空间预训练;文本智能体观测短小且模板化,这既奖励精确令牌,也激励可执行、可局部修复的基板而非隐式网络。

#### 程序综合与反例引导修复。
PatchWorld的归纳循环建立在基于示例的程序综合(Gulwani et al., 2017 (https://arxiv.org/html/2605.30880#bib.bib5); Ellis et al., 2021 (https://arxiv.org/html/2605.30880#bib.bib2); Wang et al., 2024b (https://arxiv.org/html/2605.30880#bib.bib1); Wei et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib52))之上,并实例化了针对序列POMDP动态的反例引导归纳综合(Solar-Lezama et al., 2006 (https://arxiv.org/html/2605.30880#bib.bib4)):其规范是一组可重放的轨迹,验证器是一个报告类型化失败的可执行验证器,综合器是一个用结构化诊断提示的LLM。相关的逻辑假设工作研究了知识图谱中的基于约束的推理(Bai et al., 2023 (https://arxiv.org/html/2605.30880#bib.bib30), 2024 (https://arxiv.org/html/2605.30880#bib.bib19)),而我们的假设是可执行的转移程序。与智能体反思和规划适应方法(Shinn et al., 2023 (https://arxiv.org/html/2605.30880#bib.bib31); Wang et al., 2024a (https://arxiv.org/html/2605.30880#bib.bib32); Prasad et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib41); Yuan et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib49); Kim et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib51))以及从执行反馈进行LLM代码自修复(Quoc et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib24); Kamoi et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib23); Jiang et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib50); Islam et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib54))相比,PatchWorld解决了幻觉或弱检查代码的失败模式(Agarwal et al., 2024 (https://arxiv.org/html/2605.30880#bib.bib22); Councilman et al., 2025 (https://arxiv.org/html/2605.30880#bib.bib26)):它仅在补丁改善完整验证集上的正式重放分数时才接受该补丁,从而防止了困扰无约束自我纠正的回归问题。

## 3 任务形式化

我们将每个环境建模为POMDP(𝒮, 𝒜, 𝒯, Ω, 𝒪),包括潜在状态s_t,文本动作a_t,观测o_t,转移核𝒯(s_{t+1} | s_t, a_t)和发射概率Ω(o_t | s_t)。

相似文章

PROWL: 面向世界模型学习的优先遗憾驱动优化

arXiv cs.LG

介绍了一种优先遗憾驱动优化框架PROWL,该框架利用对抗性课程通过聚焦高误差轨迹来提升基于扩散的世界模型的鲁棒性,在MineRL中的分布外场景上取得了更好的性能。

通过世界模型从人类偏好和理由中学习安全智能体行为

arXiv cs.AI

本文介绍了DROPJ,一种以人为中心的方法,通过从真实世界轨迹中学习世界模型,然后引出带有理由的人类偏好来训练奖励模型,用于模型预测控制,从而安全地训练和部署智能体策略。实验表明,使用人工生成的模拟轨迹和理由可以提高安全性并降低计算成本。

通过扩散策略优化扩展世界模型强化学习

arXiv cs.LG

提出模型基扩散策略优化(MBDPO)框架,该框架通过扩散策略表示统一了世界模型中的搜索与策略优化,在离线与在线强化学习任务中实现一致的扩展行为和卓越性能。