游玩ZendoWorld:挑战AI智能体进行主动视觉概念归纳
摘要
介绍了ZendoWorld,这是一个受控的交互环境,用于评估AI智能体在主动视觉概念归纳方面的能力,智能体需要感知场景、推断隐藏的逻辑规则并设计信息丰富的实验。使用不同类别智能体的实验表明,高预测精度并不能保证规则恢复,基于VLM的智能体在信息性实验方面表现不佳,突出了与人类归纳推理之间的差距。
查看缓存全文
缓存时间: 2026/07/10 06:07
# 玩转ZendoWorld:挑战AI代理的主动视觉概念归纳
来源:https://arxiv.org/html/2607.08233
Antonia Wüst¹,Inga Ibs³,⁴,Wasu Top Piriyakulkij⁵,Wolfgang Stammer⁶,Constantin Rothkopf²,³,⁴,Kevin Ellis⁵,Kristian Kersting¹,²,⁴,⁷
¹AIML Lab, 达姆施塔特工业大学;²黑森人工智能中心(hessian.AI);³信息处理心理学, 达姆施塔特工业大学;⁴认知科学中心, 达姆施塔特工业大学;⁵康奈尔大学;⁶马克斯·普朗克信息学研究所, SIC;⁷德国人工智能研究中心(DFKI);
###### 摘要
构建智能系统的一个核心挑战是让智能体能够:共同感知复杂输入,形成关于隐藏模式的假设,并设计信息丰富的实验来验证这些假设。为了研究这个问题,我们提出了ZendoWorld,这是一个受控的交互式环境,智能体必须推断关于视觉游戏观察的逻辑规则,通过提出新场景来获取信息,并根据游戏环境的反馈来细化假设。我们评估了多种智能体,涵盖纯VLM推理、贝叶斯粒子滤波、动态概念发现和神经符号方法。我们的主要发现是:(1) 对观察示例标签预测的高准确率并不等同于对底层规则的成功恢复;(2) 感知和归纳是不同类别智能体的不同瓶颈;(3) 基于VLM的智能体提出的实验几乎不提供信息,未能主动降低假设的不确定性。为了比较这些结果,我们收集了人类在该任务上的数据,这揭示了归纳推理方面的差距,尤其是在处理更复杂规则时。总体而言,ZendoWorld朝着评估智能体迈出了重要一步,并指出了具体的改进方向,特别是在科学发现等领域。
代码:https://github.com/ml-research/ZendoWorld
数据:https://huggingface.co/datasets/ss567uhg/zendo-synthetic-data
## 1 引言
参见图注
图1:ZendoWorld在一个受控的视觉环境中结合了感知、归纳和实验。
根据新证据形成、检验和修正假设的能力是人类智能的一个标志,它反映了感知和归纳推理之间的相互作用。认知科学长期以来强调这一过程是学习的核心,展示了人类如何通过信息丰富的实验主动探索假设空间[10 (https://arxiv.org/html/2607.08233#bib.bib93),7 (https://arxiv.org/html/2607.08233#bib.bib2),24 (https://arxiv.org/html/2607.08233#bib.bib3)]。从因果关系的角度来看,这一过程可以理解为不仅从观察中学习,而且从探究底层机制的干预中学习[26 (https://arxiv.org/html/2607.08233#bib.bib118),27 (https://arxiv.org/html/2607.08233#bib.bib119)]。随着人们对AI智能体和AI科学家的兴趣日益增长[16 (https://arxiv.org/html/2607.08233#bib.bib101),20 (https://arxiv.org/html/2607.08233#bib.bib102),38 (https://arxiv.org/html/2607.08233#bib.bib100)],我们需要结构化的基准测试和受控分析来系统地评估这些能力。最近AI的进展集中在从少量示例中进行归纳推理[31 (https://arxiv.org/html/2607.08233#bib.bib89),19 (https://arxiv.org/html/2607.08233#bib.bib99),12 (https://arxiv.org/html/2607.08233#bib.bib97),36 (https://arxiv.org/html/2607.08233#bib.bib84)],通常基于网格谜题(如ARC-AGI [6 (https://arxiv.org/html/2607.08233#bib.bib103)])或合成及真实图像上的视觉推理任务[3 (https://arxiv.org/html/2607.08233#bib.bib107),39 (https://arxiv.org/html/2607.08233#bib.bib108),14 (https://arxiv.org/html/2607.08233#bib.bib105),34 (https://arxiv.org/html/2607.08233#bib.bib104),30 (https://arxiv.org/html/2607.08233#bib.bib109)](参见图1 (https://arxiv.org/html/2607.08233#S1.F1)蓝色∩黄色区域)。虽然这些基准突出了逻辑推理方面的进步,特别是在视觉领域,但它们将归纳主要描绘成一个被动的、一次性的任务,从而忽视了发现过程的迭代性质。最近的研究开始通过研究主动实验来弥补这一差距。例如,[28 (https://arxiv.org/html/2607.08233#bib.bib43)]评估了LLMs如何通过提出实验来发现用自然语言表达的规则。然而,在这样的环境中,系统操作的数据是干净的符号抽象,忽略了视觉输入的复杂性。同样,最近ARC-AGI-3 [1 (https://arxiv.org/html/2607.08233#bib.bib111)]和AutumnBench [32 (https://arxiv.org/html/2607.08233#bib.bib110)]向实验方向的推进仍然依赖于符号性质的输入空间(参见图1 (https://arxiv.org/html/2607.08233#S1.F1)蓝色∩红色)。更现实的设定位于主动实验和视觉基础的交汇处。为了研究这一点,我们引入了ZendoWorld,这是一个受归纳逻辑游戏*Zendo*¹¹¹https://www.looneylabs.com/games/zendo启发的交互式基准。在这个多轮设定中,智能体观察带标签的场景,推断隐藏的规则,并生成新场景来测试其假设。通过将原始视觉输入与形式化的领域特定语言(DSL)和精确反馈相结合,ZendoWorld能够在单个循环内对感知、归纳和实验进行受控评估(参见图1 (https://arxiv.org/html/2607.08233#S1.F1))。我们在我们新颖的ZendoWorld环境中评估了多种智能体,这些智能体具有不同程度的视觉-语言模型(VLM)集成和符号结构。我们的结果显示,当前方法高度专业化:虽然一些方法在标签预测或结构化搜索方面表现出色,但没有一种方法能够在没有先验规则空间知识的情况下可靠地解决完整的交互循环。关键的是,我们发现标签预测准确率通常与真正的规则恢复脱钩;智能体可能正确分类示例,但无法生成信息丰富的实验来测试其内部信念。总之,我们做出以下贡献:我们(i)引入了ZendoWorld,一个用于扎根的主动视觉规则发现的受控测试平台,其实例化包含22个游戏,共同锻炼感知、归纳和实验。为此,我们(ii)实现了一个用于在视觉扎根领域进行假设形成、测试和修正的评估协议。在我们的实验中,我们(iii)广泛评估了多种智能体,发现它们未能生成信息丰富的实验,并且标签预测准确率和规则恢复是脱钩的。我们最终(iv)进行了一项人类研究,定位了当前智能体相对于人类的不足之处:人类和基于VLM的智能体在较简单规则上的表面错误模式相似,但人类产生更稳定的规则轨迹,并且能够恢复复杂和分布外规则,而视觉智能体在这些规则上均未成功,这指出了缩小差距的具体架构方向。
## 2 相关工作
表1:感知、推理和实验交叉领域的基准分类。我们的环境(ZendoWorld)是第一个要求通过主动实验进行扎根视觉归纳的环境。
| 基准/环境 | 主要模态 | 感知 | 归纳 | 实验 |
| :--- | :--- | :--- | :--- | :--- |
| ARC-AGI-1/2 [6 (https://arxiv.org/html/2607.08233#bib.bib103)] | 符号(网格) | × | ✓ | × |
| Bongard, RAVEN [3 (https://arxiv.org/html/2607.08233#bib.bib107),39 (https://arxiv.org/html/2607.08233#bib.bib108),23 (https://arxiv.org/html/2607.08233#bib.bib116)] | 图形 | ✓ | ✓ | × |
| Bongard风格 [14 (https://arxiv.org/html/2607.08233#bib.bib105),34 (https://arxiv.org/html/2607.08233#bib.bib104),21 (https://arxiv.org/html/2607.08233#bib.bib114),25 (https://arxiv.org/html/2607.08233#bib.bib115)] | 视觉(3D) | ✓ | ✓ | × |
| Atari, NetHack [17 (https://arxiv.org/html/2607.08233#bib.bib113),33 (https://arxiv.org/html/2607.08233#bib.bib112)] | 视觉(2D) | ✓ | ×\* | ✓ |
| MineDojo [9 (https://arxiv.org/html/2607.08233#bib.bib117)] | 视觉(3D) | ✓ | ×\* | ✓ |
| CLEVR-AVR [40 (https://arxiv.org/html/2607.08233#bib.bib94)] | 视觉(3D) | ✓ | ×\*\* | ✓ |
| Zendo, ActiveACRE [4 (https://arxiv.org/html/2607.08233#bib.bib44)] [28 (https://arxiv.org/html/2607.08233#bib.bib43)] | 符号(文本) | × | ✓ | ✓ |
| ARC-AGI-3, AutumnBench [1 (https://arxiv.org/html/2607.08233#bib.bib111),32 (https://arxiv.org/html/2607.08233#bib.bib110)] | 符号(网格) | × | ✓ | ✓ |
| Science-Gym [5 (https://arxiv.org/html/2607.08233#bib.bib98)] | 符号与视觉(2D) | ✓ | ✓ | ✓ |
| **ZendoWorld (Ours)** | **视觉(3D)** | **✓** | **✓** | **✓** |
\* RL智能体通常执行隐式策略优化,而非显式假设形成/规则恢复。
\*\* 对图像进行推理,而非显式假设形成/规则恢复。
**视觉归纳**。一系列长期工作研究从固定的视觉示例中进行归纳推理。经典的基准测试,如Bongard问题[3 (https://arxiv.org/html/2607.08233#bib.bib107),23 (https://arxiv.org/html/2607.08233#bib.bib116)]、Raven渐进矩阵[39 (https://arxiv.org/html/2607.08233#bib.bib108)]和ARC-AGI [6 (https://arxiv.org/html/2607.08233#bib.bib103)],强调对合成或符号输入的抽象,而最近的Bongard变体扩展到自然图像和更开放的概念[14 (https://arxiv.org/html/2607.08233#bib.bib105),34 (https://arxiv.org/html/2607.08233#bib.bib104),25 (https://arxiv.org/html/2607.08233#bib.bib115),21 (https://arxiv.org/html/2607.08233#bib.bib114)]。如表1 (https://arxiv.org/html/2607.08233#S2.T1)所总结,这些设定主要是被动的,不允许智能体查询新示例。这个领域的方法分为三大类。首先,端到端VLM直接对图像进行少样本推理[15 (https://arxiv.org/html/2607.08233#bib.bib79),37 (https://arxiv.org/html/2607.08233#bib.bib106)]。其次,神经符号方法将感知与符号推理相结合:Pix2Code [35 (https://arxiv.org/html/2607.08233#bib.bib39)]提取对象并通过类似于DreamCoder的搜索合成结构化概念[8 (https://arxiv.org/html/2607.08233#bib.bib42)],而αILP [29 (https://arxiv.org/html/2607.08233#bib.bib37)]将场景建模为可微逻辑程序。第三,视觉语言程序(VLP)[36 (https://arxiv.org/html/2607.08233#bib.bib84)]将视觉输入提升到DSL中,并在推导出的表示上合成规则。
**视觉实验**。一个互补的研究方向是研究在视觉环境中行动的智能体,但通常是在奖励驱动的目标下。Atari [33 (https://arxiv.org/html/2607.08233#bib.bib112)]、NetHack [17 (https://arxiv.org/html/2607.08233#bib.bib113)]和MineDojo [9 (https://arxiv.org/html/2607.08233#bib.bib117)]等基准测试评估了基于VLM的策略,这些策略通过提示或混合RL管道将观察映射到行动。Visual Agentic AI [22 (https://arxiv.org/html/2607.08233#bib.bib38)]通过API将其扩展到程序化空间推理。这些方法展示了强大的感知控制,但侧重于隐式策略优化,而非显式规则恢复。CLEVR-AVR [40 (https://arxiv.org/html/2607.08233#bib.bib94)]更接近于在视觉领域中的主动推理,但智能体对场景进行干预,没有显式的假设空间或规则表示。
**通过实验进行归纳**。第三条线将归纳和实验结合起来,主要在符号领域。基于Zendo的设定[4 (https://arxiv.org/html/2607.08233#bib.bib44)]要求智能体提出示例来区分规则,这一范式通过LLM-SMC-S [28 (https://arxiv.org/html/2607.08233#bib.bib43)]得到扩展,后者将基于LLM的提议与顺序蒙特卡洛推理相结合。相关基准测试如AutumnBench [32 (https://arxiv.org/html/2607.08233#bib.bib110)]和ARC-AGI-3 [1 (https://arxiv.org/html/2607.08233#bib.bib111)]研究在符号网格上的主动发现,而Science-Gym [5 (https://arxiv.org/html/2607.08233#bib.bib98)]则在具有简单2D场景的预定义参数空间中探索科学发现。现有的基准测试通常只涵盖表1 (https://arxiv.org/html/2607.08233#S2.T1)中所描绘的三个期望组件中的两个,使得3D视觉基础、规则归纳和主动实验的交集尚未被研究。
## 3 ZendoWorld
我们提出了ZendoWorld,一个受归纳逻辑游戏*Zendo*启发的交互式推理基准测试,它在单个评估循环内集成了所有三个组件。该环境提供精确的ground-truth反馈和由形式化DSL定义的规则空间,从而能够将感知、归纳和实验作为成功或失败的独立贡献因素进行清晰分离(参见图2 (https://arxiv.org/html/2607.08233#S3.F2))。这种设计支持跨方法类别的直接比较,包括端到端VLM、符号推理方法和程序合成管道。图2 (https://arxiv.org/html/2607.08233#S3.F2)提供了游戏的概述。简而言之,智能体观察带有标签的视觉场景,基于它们推断规则,并提议新场景来测试和修正其假设。
参见图注
图2:ZendoWorld设置的概述。(A) 智能体被初始化为一组带有标签的种子场景,这些场景与隐藏规则一致。(B) 在实验阶段,智能体提议新场景,预测其标签,并为每个正确预测获得额外的猜测尝试。(C) 当智能体决定承诺时,它提交一个规则假设。如果不正确,则显示一个反例,智能体重新进入实验阶段。当智能体正确猜出规则或用尽其示例预算时,回合结束。智能体动作以蓝色显示;环境响应以红色显示。
### 3.1 游戏设置
一个ZendoWorld游戏回合由一个潜在的地面真相规则 \(r^*\) 定义,该规则从规则空间 \(\mathcal{R}\) 中抽取,规则空间以基于Prolog的DSL表示。回合在若干轮次 \(t \in \{1,\dots\}, T \in \mathbb{N}\) 中展开。在整个回合中,智能体累积一个带标签的观察集合 \(\mathcal{D}=\{(x_i, y_i)\}\),每个观察由一个视觉场景 \(x_i \in \mathbb{R}^{H \times W \times 3}\) 和一个二元标签 \(y_i \in \{0,1\}\) 组成,其中如果场景满足 \(r^*\) 则 \(y_i = 1\),否则 \(y_i = 0\)。回合受限于游戏过程中累积的总示例数量 \(|\mathcal{D}| \leq 30\)。图3 (https://arxiv.org/html/2607.08233#S3.F3) 举例说明了规则“奇数个部件”的观察示例。
参见图注
图3:规则“奇数个部件”的场景示例。每个场景既有视觉表示(图像),也有符号表示。
**场景表示**。每个图像 \(x_i\) 对应于一个底层的符号状态 \(s_i \in \mathcal{S}\),该状态显式编码对象属性(例如,颜色、形状、方向)及其空间排列(例如,“接触”、“堆叠”或“指向”)。潜在规则形式化地定义为符号空间上的布尔分类器,\(r^*: \mathcal{S} \rightarrow \{0,1\}\),因此标签满足 \(y_i = r^*(\Phi(x_i))\),其中 \(\Phi: \mathbb{R}^{H \times W \times 3} \rightarrow \mathcal{S}\) 将图像映射到其符号状态 \(s_i = \Phi(x_i)\)。智能体因此必须弥合高维视觉输入与 \(\mathcal{S}\) 的逻辑结构之间的鸿沟以进行归纳。
**智能体接口**。在每一轮,智能体将 \(\mathcal{D}\) 观察为(图像,标签)对。提议的场景 \(e_t\) 作为结构化规范发出并由环境渲染(第3.1节 (https://arxiv.org/html/2607.08233#S3.SS1.SSS0.Px1));假设 \(h_t\) 可以是DSL程序或自然语言。这将感知与动作相似文章
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。
Visual Para-Thinker++: 视觉推理的单策略多智能体框架
Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
OPINE-World: 使用本体错误优先的交互式探索进行程序化世界建模
OPINE-World 引入了一个 LLM 智能体,通过交互在线学习以对象为中心的程序化世界模型,采用本体错误优先的探索和协作的假设-测试智能体,在 ARC-AGI-3 上取得了强劲的结果。
智能体可视化项目
涵盖与AI智能体可视化相关的项目,可能是用于表示智能体行为的工具或库。