OPINE-World: 使用本体错误优先的交互式探索进行程序化世界建模
摘要
OPINE-World 引入了一个 LLM 智能体,通过交互在线学习以对象为中心的程序化世界模型,采用本体错误优先的探索和协作的假设-测试智能体,在 ARC-AGI-3 上取得了强劲的结果。
arXiv:2607.01531v1 公告类型:新
摘要:通过交互学习环境的行为是构建适应不熟悉任务的智能体的核心。使用深度网络学习的世界模型虽然灵活,但数据需求量大且难以迁移到训练分布之外。由LLM以源代码形式编写并通过反例引导的归纳综合(CEGIS)精炼的程序合成世界模型则数据高效且可重用,但它们主要被展示在具有给定对象词汇的结构化状态世界中,并且单一的程序搜索无法扩展到像素渲染环境,后者的对象结构必须灵活假设。我们提出了OPINE-World,一个通过交互在线学习以对象为中心的程序化世界模型的 LLM 智能体。OPINE-World 将两个协作智能体耦合在假设与测试的循环中,一个在环境中行动,另一个通过回放验证和基于模型的规划以代码合成模型,并使用我们称为本体错误的贝叶斯对象类型充分性度量来引导探索。我们在 ARC-AGI-3 上评估了 OPINE-World,这是一个技能获取效率的基准测试,其中对象词汇、目标和动作语义均被隐藏。OPINE-World 无需逐游戏训练即可解决25个游戏中的20个,并以78.4的动作效率得分达到了人类基线。
查看缓存全文
缓存时间: 2026/07/03 05:44
# 基于本体错误优先交互探索的程序化世界建模
来源:https://arxiv.org/html/2607.01531
David Courtis, Wenhao Li, Scott Sanner
多伦多大学计算机科学系
david\.courtis@mail\.utoronto\.ca, chriswenhao\.li@mail\.utoronto\.ca, ssanner@mie\.utoronto\.ca
###### 摘要
通过交互学习环境的行为是构建能够适应陌生任务的主体(agent)的核心。使用深度网络学习的世界模型(world model)灵活但数据需求大,且泛化能力差,难以迁移到训练分布之外。由大语言模型(LLM)编写的程序化合成世界模型(program-synthesized world model)以源代码形式呈现,并通过反例引导的归纳合成(CEGIS)进行优化,既数据高效又可复用,但这类模型主要在被赋予对象词汇的结构化状态世界中展示,单次程序搜索无法扩展到像素渲染环境,因为后者需要灵活地假设对象结构。我们提出 OPINE-World,一个通过交互在线学习以对象为中心的程序化世界模型的 LLM 主体。OPINE-World 将两个协作主体耦合在假设与测试的循环中,其中一个在环境中行动,另一个通过重放验证和基于模型的规划将模型以代码形式合成,并使用一种我们称之为本体错误(ontology error)的对象类型充分性的贝叶斯度量来引导探索。我们在 ARC-AGI-3(一个衡量技能获取效率的基准测试,其中对象词汇、目标和动作语义均未提供)上评估 OPINE-World。OPINE-World 在无需逐游戏训练的情况下解决了 25 个游戏中的 20 个,行动效率得分为 78.4(相比人类基线 100)。
## 1 引言
世界模型预测环境在每个动作下如何变化,拥有世界模型的主体可以规划并迁移到共享机制的任意任务(Sutton, 1991 (https://arxiv.org/html/2607.01531#bib.bib36); Ha and Schmidhuber, 2018 (https://arxiv.org/html/2607.01531#bib.bib37))。在基于模型的强化学习中,使用深度网络学习的世界模型虽然通用,但数据需求大,且难以迁移到训练分布之外(Hafner and others, 2020 (https://arxiv.org/html/2607.01531#bib.bib16); Schrittwieser and others, 2020 (https://arxiv.org/html/2607.01531#bib.bib17); Hafner et al., 2025 (https://arxiv.org/html/2607.01531#bib.bib38); Kaiser et al., 2020 (https://arxiv.org/html/2607.01531#bib.bib41))。用程序编写的世界模型是数据高效的替代方案,从记录的交互中合成,并通过反例引导的归纳合成(CEGIS)进行优化,且具有可检查性和可重用性(Tang et al., 2024 (https://arxiv.org/html/2607.01531#bib.bib2); Ellis and others, 2025 (https://arxiv.org/html/2607.01531#bib.bib3); Solar-Lezama et al., 2006 (https://arxiv.org/html/2607.01531#bib.bib39))。这种程序在按对象类型进行分解时最为经济,每个对象类型共享一个转移规则,从而使少量参数支持大量预测,并且从一个对象学到的规则可迁移到其他对象(Diuk et al., 2008 (https://arxiv.org/html/2607.01531#bib.bib6); Guestrin et al., 2003 (https://arxiv.org/html/2607.01531#bib.bib47); Džeroski et al., 2001 (https://arxiv.org/html/2607.01531#bib.bib48))。分解仅在对象划分近似正确时才有帮助,而在开放环境中,这一划分并非给定,必须从用于学习规则的同一交互中推断(Kemp et al., 2006 (https://arxiv.org/html/2607.01531#bib.bib24); Teh et al., 2006 (https://arxiv.org/html/2607.01531#bib.bib25))。两条研究路线代表了何时确定此划分的两个极端。程序合成与规划系统一次性固定划分,并通过合成的模型进行规划,当无规划能达到奖励时进行修复(Tang et al., 2024 (https://arxiv.org/html/2607.01531#bib.bib2); Ellis and others, 2025 (https://arxiv.org/html/2607.01531#bib.bib3); Ahmed and others, 2025 (https://arxiv.org/html/2607.01531#bib.bib4)),因此在数据确定划分之前就固定的划分会将其错误带入基于它构建的每条规则。无模型(model-free)主体系统则不固定任何结构,仅从自然语言交互日志中行动,不合成任何模型(Fox et al., 2026 (https://arxiv.org/html/2607.01531#bib.bib5); Yao et al., 2023 (https://arxiv.org/html/2607.01531#bib.bib73); Wang et al., 2023 (https://arxiv.org/html/2607.01531#bib.bib74)),因此既无可重用模型,也无已识别内容的记录。程序合成路线已在具有给定对象词汇的结构化状态输入上展示,但单次程序搜索无法扩展到必须从像素观测中恢复对象结构的像素渲染环境(Tang et al., 2024 (https://arxiv.org/html/2607.01531#bib.bib2); Ellis and others, 2025 (https://arxiv.org/html/2607.01531#bib.bib3); Chollet, 2019 (https://arxiv.org/html/2607.01531#bib.bib40))。
我们提出 OPINE-World,一个通过交互在线学习以对象为中心的程序化世界模型的 LLM 主体。OPINE-World 结合了四种机制。模型按对象类型分解,因此规则一次只修复一种类型。两个协作的 LLM 主体在一个共享重放缓冲区上运行假设与测试循环。行动主体提出关于动力学和目标的假设,并在环境中对其进行探测,由它维护的自然语言世界模型引导;而合成主体则将每个假设转化为代码,并由一个批评者挑战拟合模型的弱泛化。候选程序只有在精确复现所有记录到的转移时才被接受。随后,一个规划器搜索已验证的模型,并逐步骤针对环境验证每个动作。一种基于贝叶斯的对象类型充分性度量——本体错误——引导探索转向当前类型尚未解释其行为的对象。在 ARC-AGI-3 (ARC Prize Foundation, 2026 (https://arxiv.org/html/2607.01531#bib.bib1)) 上——一个对象词汇、目标和动作语义均未提供的技能获取效率基准测试——OPINE-World 在无需逐游戏训练的情况下解决了 25 个游戏中的 20 个,超越了一个强大的单主体编码基线,并在大多数已解决的游戏上保持低于人类的行动次数,而程序合成和神经潜在世界模型未能解决任何一个。
#### 贡献。
1. 1. OPINE-World,一个通过交互在线学习以对象为中心的程序化世界模型的 LLM 主体,运行着两个协作 LLM 主体的假设与测试循环,结合反例引导合成与基于模型的规划(第3节 (https://arxiv.org/html/2607.01531#S3))。
2. 2. 一种从交互中发现对象本体的方法,而先前的程序化合成世界模型接收带有给定对象词汇的结构化状态,这使得它们能够扩展到对象结构未知的像素渲染环境(第3节 (https://arxiv.org/html/2607.01531#S3))。
3. 3. 在 ARC-AGI-3 上的评估显示,OPINE-World 在无需逐游戏训练的情况下解决了 25 个游戏中的 20 个、183 个关卡中的 160 个,超过了一个强大的单主体编码主体,而程序合成和神经潜在世界模型未解决任何问题(第4节 (https://arxiv.org/html/2607.01531#S4))。
## 2 问题设定
#### 面向对象的马尔可夫决策过程(Object-oriented MDP)。
我们将交互环境建模为面向对象的马尔可夫决策过程(Diuk et al., 2008 (https://arxiv.org/html/2607.01531#bib.bib6)),并在 ARC-AGI-3 上进行实例化。一个游戏是一个元组 $(C, A, T, R, s_0)$,包含对象类别集合 $C$,有限动作集合 $A$,确定性转移函数 $T: S \times A \to S$,奖励函数 $R$,以及关卡初始状态 $s_0$。结构化状态 $s \in S$ 是一个有限集合,包含类型化对象 $o = (\text{name}, \tau, v)$,其中 $\tau$ 是类型,$v$ 包含位置、可见性、旋转方向以及一个小像素图案等原子属性。动作集合包含方向性移动、选择动作和指针点击。每个动作的含义未给出,主体通过行动来恢复。
#### 感知与隐藏信息。
引擎将每一帧暴露为一个原始的 $64 \times 64$ 颜色索引网格,不提供精灵列表、对象身份或类型。OPINE-World 合成自己的感知模块——一个提取器 $\alpha$,它将帧分割为对象记录,每个对象记录包含一个位置、一个可见性标志以及一个小像素图案,并在时间上对它们进行配对。其余信息均被隐藏:对象按力学类型(mechanical type)的划分未知,目标未说明,动作匿名,且未提供任何演示。主体从观测中推断类型划分,从观察到的奖励中解读目标相关性,并通过在上下文中尝试动作来发现动作效果。
#### 奖励与评分。
奖励稀疏。环境在关卡推进时报告成功,否则保持静默。一个游戏由一系列关卡组成,通过最后一个关卡即赢得游戏。主体的评分依据其花费的动作次数,因此如果主体重新推导出已见过的机制,则需为重复付出代价。我们报告通关一个游戏所需的动作次数,以及是否所有关卡均被通过。
#### 世界模型与验证。
世界模型是一个由语言模型编写并通过反例引导合成(CEGIS)对照重放缓冲区 $D_t = \{(s_i, a_i, s_i')\}_{i \leq t}$ 进行修复的 Python 转移函数 $\widehat{T}$。接受测试是精确重放(exact replay):
$$\phi(D_t, \widehat{T}): \quad \widehat{T}(s_i, a_i) = s_i' \text{ for all } (s_i, a_i, s_i') \in D_t.$$
我们不按早期工作(Tang et al., 2024 (https://arxiv.org/html/2607.01531#bib.bib2); Brafman and Tennenholtz, 2002 (https://arxiv.org/html/2607.01531#bib.bib9))的乐观主义意义合成奖励函数。目标识别在关卡通关前使用观察到的奖励,在通关后使用合成的布尔目标谓词,并通过相同的精确重放测试进行检验(Ahmed and others, 2025 (https://arxiv.org/html/2607.01531#bib.bib4); Tang et al., 2024 (https://arxiv.org/html/2607.01531#bib.bib2))。
###### 假设 1(可观测-马尔可夫确定性,Observable-Markov Determinism)。
存在一种结构化状态的表示,使得 $T$ 是状态和动作的确定性函数。在正确的类型划分和充分的局部上下文的条件下,每个对象上动作的效果是单一结果。
假设1 (https://arxiv.org/html/2607.01531#Thmassumption1) 使得精确重放测试是良定义的。当该假设不成立时(例如存在隐藏状态),测试仍能拒绝错误模型,且第3节 (https://arxiv.org/html/2607.01531#S3) 的本体错误将存在一个无法降到零的下界。我们将在第6节 (https://arxiv.org/html/2607.01531#S6) 中回到这种情况。
## 3 方法
OPINE-World 在持续增长的交互记录上运行一个循环(图1 (https://arxiv.org/html/2607.01531#S3.F1))。目标导向主体在实时游戏中执行一个动作,并将产生的转移附加到共享缓冲区。世界模型主体读取缓冲区,并在当前模型被反驳时重写以对象为中心的程序,使其再次精确复现每一条记录的转移。一旦模型被接受且至少有一个关卡通过,规划器便在该模型中搜索一条通往目标的路径,并逐步骤在实时游戏中执行该路径。一个基于贝叶斯度量的当前对象类型解释记录效果的程度(本体错误)与循环并行运行,并引导主体下一步观察的方向。本节的其余部分将描述这四种机制。
请参见标题
图 1:OPINE-World 循环。目标导向主体在实时游戏中行动,并将每条转移记录到共享缓冲区。世界模型主体从缓冲区重写一个以对象为中心的程序,该程序只有在精确复现每条记录的转移时才被接受。在一个关卡通过后,规划器在已接受的模型中进行搜索,其计划被逐步骤执行,任何不匹配都将作为反例返回缓冲区。本体错误 $\eta_t$ 引导主体下一步的观察方向,并且一个定期运行的批评者会挑战拟合后的模型。
### 3.1 以对象为中心的世界模型
#### 一个分解的程序。
结构化状态是类型化对象的有限集合:
$$ s_t = \{o_t^i\}_{i \in I_t}, \quad o_t^i = (\kappa_t^i, \tau_t^i, v_t^i), $$
其中 $\kappa$ 是匹配键,$\tau$ 是力学类型,$v$ 是包含位置、可见性、旋转方向以及一个小像素图案的属性映射。世界模型是一个按类型组织的程序:对于每种类型 $\tau$,它持有一个响应规则 $f_\tau: \mathcal{O}_\tau \times A \times X \to \mathcal{O}_\tau$,该函数输入类型 $\tau$ 的一个对象、一个动作以及作用前状态上的只读局部上下文 $X$,输出更新后的对象。通过将每个作用前对象 $i$ 与一个作用后对象 $\mu_t(i)$ 配对,规则预测:
$$ o_{t+1}^{\mu_t(i)} \approx f_{\tau_t^i}\!\left(o_t^i, a_t, u_t^i\right), \quad u_t^i = \psi(o_t^i, s_t), $$
其中 $u_t^i$ 是局部上下文特征,转移函数 $\widehat{T}$ 对每个对象应用匹配的 $f_\tau$ 并收集结果。将所有行为放在一个类型中的程序退化为单一的整体转移。这种分解形式包含 STRIPS 算子,其中添加列表和删除列表是作用前与作用后对象之间的差异,条件效果按类型组织而非枚举(Fikes and Nilsson, 1971 (https://arxiv.org/html/2607.01531#bib.bib7); Pednault, 1989 (https://arxiv.org/html/2607.01531#bib.bib80); McDermott et al., 1998 (https://arxiv.org/html/2607.01531#bib.bib81))。
#### 为什么结构保持局部。
按类型组织程序将大量预测绑定到少数规则上,并使从一个对象学到的规则能应用于该类型的每个对象(Diuk et al., 2008 (https://arxiv.org/html/2607.01531#bib.bib6); Džeroski et al., 2001 (https://arxiv.org/html/2607.01531#bib.bib48); Battaglia et al., 2018 (https://arxiv.org/html/2607.01531#bib.bib49))。只有当分组接近正确时,这种好处才成立。将具有不同动力学的对象归并到同一组,会将一条规则强行应用于不匹配的数据,从而在对象差异处产生偏差。OPINE-World 不强制每个类型只有一个对象,也不提前确定一个划分。在 ARC-AGI-3 中,对象通常是一个行为单元的片段,例如由多个精灵 ID 绘制的桥梁或由独立字形构建的计数器,若强行将这些片段归入不同类型,则会将一条规则分割到类型边界上。由于每条规则都附着于一个类型,并一次只修复一个类型,错误的分组可以在局部得到纠正,而不会扩散到模型的其余部分。
### 3.2 两个协作主体
#### 行动与建模是分离的任务。
将收集经验的主体与拟合模型的主体解耦,是强化学习中一个长期存在的设计(Sutton, 1991 (https://arxiv.org/html/2607.01531#bib.bib36); Konda and Tsitsiklis, 1999 (https://arxiv.org/html/2607.01531#bib.bib42); Horgan et al., 2018 (https://arxiv.org/html/2607.01531#bib.bib43)),而协作的、具有专门角色的语言模型主体相似文章
面向智能体任务的以对象为中心的环境建模
介绍了以对象为中心的环境建模(OCM),该方法将LLM代理的经验组织成两个可执行代码库(对象知识和过程知识),以提高复用性、验证能力,并减少交互环境中的无效动作。
代码即世界:物理推理中可执行世界表示的代理式发现
代码即世界引入了一种范式,通过将物理环境表示为可执行代码,为视觉语言模型提供定量推理能力。它使用代理式发现循环实现可扩展监督,并达到了最先进的性能。
COOPA:一种面向运筹学问题的模块化LLM智能体架构
本文介绍了COOPA,一种面向运筹学问题的模块化LLM智能体架构,它结合了基于迭代置信度的建模、元素级溯源和多求解器路由。在八个LLM主干网络和四个基线的评估中,COOPA在六个主干网络上取得了最佳的宏平均准确率,并在最强基线的基础上提升了最多6.7个百分点。
PlayWorld:基于智能体玩家与长时程目标的世界模型基准测试
PlayWorld是一个用于评估交互式视频世界模型的基准测试,使用多模态智能体玩家来追求长时程目标。它评估几何一致性、交互保真度和状态演化,揭示了当前模型在空间一致性和持续状态演化方面存在困难。
WorldAct: 将单体3D世界激活为可交互的以对象为中心的场景
WorldAct是一个框架,利用多模态智能体和几何重建技术,将静态的3D生成环境转换为可编辑、可交互的以对象为中心的场景,支持对象级编辑和具身任务执行。