面向ARC-AGI-1的抽象推理与泛化的经济型智能体框架

arXiv cs.AI 论文

摘要

本文提出了面向ARC-AGI-1的经济型智能体框架,通过探索者-定义者流水线和反思型协调器,使用DeepSeek V3.2无需微调即可实现强大性能,以低成本达到67.25%的pass@2。

arXiv:2607.06764v1 公告类型:新 摘要:近期公开架构在ARC-AGI-1上的进展主要来自两种范式:对前沿模型进行大量测试时计算(进化搜索、穷举采样、扩展思维链),或基于基准的特定训练(小模型在ARC数据上微调,通常采用任务专用架构)。我们研究了第三种范式:在严格预算下使用非思考模式的开源模型(DeepSeek V3.2),且不进行任何ARC专用微调。我们探索仅通过架构可恢复的能力,构建了将模式发现与程序生成阶段明确分解的智能体框架。首先,我们引入了探索者-定义者流水线(Explorer-Definer Pipeline),将模式发现与可执行转换生成分离,实现为两阶段智能体流水线。接着,我们提出了反思型协调器(Reflective Orchestrator),当先前假设在训练对中失败时,该协调器增强流水线以自主探索新转换。在ARC-AGI-1公开的400项任务评估集上,流水线以每任务0.25美元达到57.50%的pass@2,协调器以每任务0.62美元达到67.25%的pass@2。这些架构共同将15.50%的一次性基线提升了约52个百分点,无需基准专用训练或大量测试时计算。此外,协调器驱动的提升验证了流水线产生的可证伪诊断;无偏pass@k分析表明流水线受限于生成而非选择(通过训练对准确率的选择捕获了约95%的候选上限),并预测重大改进需要更广泛的生成而非更好的排序。协调器通过自适应重新探索实现了这一预测并予以确认(无偏pass@1提升9.81个百分点,与选择介导的pass@2提升相匹配)。额外的流水线消融实验将其思考工具识别为重要组件,移除后pass@2降低5.75个百分点。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:55

# ARC-AGI-1 上用于抽象推理和泛化的经济型智能体框架
来源:https://arxiv.org/html/2607.06764
Kabir Moghe
达特茅斯学院计算机科学系
kabir\.moghe\.26@dartmouth\.edu
&
Peter Chin
达特茅斯学院计算机科学系
peter\.chin@dartmouth\.edu
###### 摘要
近期在 ARC-AGI-1 上公开架构的进展大致来自两种范式:对前沿模型进行大量测试时计算(进化搜索、穷举采样、扩展思维链),或进行基准专用训练——小模型在 ARC 数据上微调,通常使用任务专用架构。我们研究第三种范式:在严格预算下,非思考模式下的开源权重模型(DeepSeek V3.2),未进行 ARC 专用微调。我们研究仅通过架构能恢复多少性能,构建显式分解模式发现和程序合成阶段的智能体框架。首先,我们引入**探索者-定义者流水线**,将模式发现与可执行变换合成分离,实现为两阶段智能体流水线。接着,我们提出**反思型编排器**,通过当前假设在训练对上失败时自主探索新变换,增强流水线。在 ARC-AGI-1 公共 400 任务评估集上,流水线达到 57.50% 的 pass@2,每任务成本 0.25 美元;编排器达到 67.25% 的 pass@2,每任务成本 0.62 美元。这些架构共同将 15.50% 的一次性基准提升了约 52 个百分点,且无需基准专用训练或大量测试时计算。此外,编排器驱动的提升验证了流水线产生的可证伪诊断;无偏 pass@k 分析表明流水线受限于生成而非选择(训练对准确率选择捕获了约 95% 的候选上限),并预测显著改进需要更广泛的生成而非更好的排序。编排器通过自适应重新探索实现了这一预测并证实了它(无偏 pass@1 提升 +9.8 个百分点,与选择介导的 pass@2 提升匹配)。额外流水线消融实验将其 `think` 工具识别为重要组件,移除后 pass@2 降低 5.75 个百分点。

## 1 引言

自诞生以来,ARC 已变得可及,但代价高昂。公开工作中报告的高性能通常来自两种范式之一。第一种依赖于对前沿大语言模型(LLM)进行大量测试时计算:对候选解进行进化搜索、穷举程序枚举或扩展思维链推理,报告的成本从每任务几美元到几百美元不等[Berman (2024), 2025](https://arxiv.org/html/2607.06764#bib.bib3);[Pang (2025)](https://arxiv.org/html/2607.06764#bib.bib6);[Greenblatt (2024)](https://arxiv.org/html/2607.06764#bib.bib5)。第二种依赖于基准专用训练:从头训练或在 ARC 分布数据上直接微调小模型,通常结合目标任务微调和激进的数据增强的测试时架构[Jolicoeur-Martineau (2025)](https://arxiv.org/html/2607.06764#bib.bib8);[Franzen et al. (2025)](https://arxiv.org/html/2607.06764#bib.bib10);[Chollet et al. (2024)](https://arxiv.org/html/2607.06764#bib.bib27)。两种范式都成功推进了排行榜数字,但每种都以高性能换取大量计算——要么是每任务的大量推理,要么是基准专用训练。

##### 关于“无 RL”或微调条件的背景说明。本文相关的范围区分在于基准专用训练(无论是监督式、测试时微调还是基于 RL)与通用后训练之间。上述第二种范式的系统都在 ARC 训练任务上微调或从头训练。我们使用的模型——非思考模式下的 DeepSeek V3.2——经历了广泛任务混合的通用后训练,包括重要的强化学习组件(例如 RLHF、智能体能力 RL、推理风格 RL),但并未专门针对 ARC,除了任何公开数据泄露。我们在本文的每个条件下保持通用后训练不变,因此我们报告的架构差异不会被其混淆。我们认为,廉价一次性 LLM 调用(约 16% 在 ARC-AGI-1 上)与“高性能”排行榜系统(≥50%)之间的差距,并非仅仅是模型能力或计算规模的函数。相反,该差距中有意义的部分可通过三种不同的架构杠杆恢复:*调用内深思*(结构化思维链通道)、*跨调用分解*(将模式探索与变换合成分离)以及*自适应重新探索*(允许合成阶段在当前假设失败时启动新的探索,而不是基于固定的先前探索产物进行细化)。我们通过在相同模型上运行四种结构复杂度递增的架构,在 ARC-AGI-1 公共评估集上测试这一假设。我们的核心发现包含两部分。首先,**探索者-定义者流水线**达到 57.50% 的 pass@2,每任务成本 0.25 美元——比一次性基线(15.50%)提升 42.00 个百分点,比结构化思维链基线(30.00%)提升 27.50 个百分点。其次,该流水线产生一个可证伪诊断:它*受限于生成而非选择*,意味着观察到的准确率约束是候选变换的实际多样性,而非选择机制的质量。该诊断表明,突破流水线的上限需要更广泛的候选生成,而非更好的选择。**反思型编排器**正是这一洞察的架构测试:它扩展了流水线的定义者,配备工具以(a)当当前变换失败或显得特别不正确时,启动聚焦的循环中探索,以及(b)优雅地确定自身循环退出标准。编排器架构达到 67.25% 的 pass@2,每任务成本 0.62 美元,比流水线提升 +9.75 个百分点(配对 Bootstrap 95% 置信区间 [+6.50, +13.25]),并在无偏 pass@1 估计器上具有几乎相同的提升,证实增益来自生成侧而非选择介导。从一次性基线到编排器的总架构提升为相同模型上的 52 个百分点,无需基准专用训练或昂贵的、无界的前沿模型推理。

##### 公共评估集注意事项。我们不报告官方 ARC Prize 排行榜分数。官方验证结果在半私有 ARC-AGI-1 留出集上评估,而本研究使用公共 400 任务评估集,这是可用于任意本地架构实验的最大评估分片[ARC Prize Foundation (2025)](https://arxiv.org/html/2607.06764#bib.bib26);[Chollet et al. (2024)](https://arxiv.org/html/2607.06764#bib.bib27)。这阻止了直接排行榜比较,并引入了公共集结果可能高估半私有泛化的可能性。为缓解这一点,每个架构都通过相同模型和提供者上的受控消融实验进行评估,针对相同 400 个任务,使用相同的评分和成本核算代码。外部系统数字仅作为成本-准确率范式的上下文参考点,而非匹配的基线。

##### 贡献。
1. 1. 两个新的智能体架构,位于 ARC-AGI-1 成本-准确率前沿中每任务低于 1 美元的区域。**探索者-定义者流水线**(57.50% pass@2,每任务 0.25 美元)将 ARC 分解为独立的模式发现和程序合成阶段,由压缩的自然语言产物介导,并通过训练对执行验证。**反思型编排器**(67.25% pass@2,每任务 0.62 美元;配对提升 +9.75 个百分点)扩展了流水线的定义者,配备一个工具以在其变换假设失败时启动聚焦的循环中探索。两个架构都位于成本-准确率平面中公开架构稀疏占据的区域。
2. 2. 一种诊断-然后-测试的方法论,将编排器的设计与可证伪预测联系起来。我们在所有条件下保持相同的 400 任务公共评估集、模型、网格渲染、评分和成本核算。保持这些元素不变,我们的分析隔离了流水线的一个可能架构限制,即使使用更详尽的配置也似乎限制了准确率:应用于流水线 M=5 候选集的无偏 pass@k 估计器[Chen et al. (2021)](https://arxiv.org/html/2607.06764#bib.bib24)显示,训练分数选择捕获了约 95% 的可实现候选上限。这一诊断激发了流水线准确率受限于候选生成而非候选选择的观点。我们将编排器实现为流水线上的针对性架构增强,以测试该预测。确实,其 naive pass@2(+9.75 个百分点)和无偏 pass@1(+9.81 个百分点)几乎相等的提升证实增益来自生成侧而非选择介导。
3. 3. 跨架构提升的鲁棒性实证表征。对流水线在探索者数量、温度和定义者最佳采样上的穷举 Pareto 扫描表明,探索者数量是主导成本-准确率杠杆,最佳采样似乎饱和,而中间温度常占优。消融实验显示,禁用定义者的 `think` 暂存板导致 pass@2 降低 -5.75 个百分点,而禁用训练反馈细化仅导致 -0.75 个百分点。在 Qwen3-235B 上的初始跨模型验证(针对匹配的 99 任务子集)在四种架构上遵循相同的提升轨迹,提供了证据表明是框架而非特定模型驱动了提升。对编排器的追踪级分析显示,约 75% 的独特求解利用了自适应重新探索,佐证了设计的核心假设。
4. 4. 一种计算效率声明的方法论规范。Token 归一化的每任务成本报告、明确的 pass@k 定义、Bootstrap 置信区间和配对 Bootstrap 差值有助于使架构提升可审计。

##### 代码与可重复性。本文其余部分组织如下。第 2 节回顾先前工作,围绕我们的架构所使用的机制组织(ARC 上的搜索与训练范式、基于采样的自洽性、言语反馈智能体以及工具介导推理)。第 3 节详细描述四种架构、评估协议和成本核算惯例。第 4 节呈现受控架构差异、N×t×M Pareto 表面、流水线消融实验、生成与选择分析、流水线到编排器的 M 扫描比较、对 Qwen3-235B 的跨模型验证以及成本上下文比较。第 5、6 和 7 节讨论启示、局限性和提出的扩展。附录 A 展示了一个典型任务,其中编排器自适应重新探索组件的益处显而易见。

## 2 相关研究

### 2.1 ARC-AGI 与成本范式

抽象与推理语料库[Chollet (2019)](https://arxiv.org/html/2607.06764#bib.bib1)被引入,有意识地作为那些可通过规模和模式匹配实现高性能的基准的反例。每个 ARC 任务结构上是一个少样本学习问题:少量输入-输出网格对(训练和评估集平均约 3 对)展示了一种变换,系统必须将其应用于留出的测试输入。该基准通过三个设计选择抵抗捷径解:变换因任务而异(训练与评估间无迁移),正确性要求精确的单元格级匹配,搜索空间是开放式的(最多 30×30 网格,最多十种颜色,产生比任何合理记忆策略能覆盖的更多的候选输出)。ARC-AGI-2[Chollet et al. (2025)](https://arxiv.org/html/2607.06764#bib.bib2)在保持相同评估协议的同时,用更难的任务扩展了原始基准。高性能的已发表系统通常花费大量计算,要么在训练期间,要么在每任务搜索期间,要么通过大量测试时候选生成;我们将其组织为两种范式。

##### 前沿模型测试时搜索。Berman [2024, 2025](https://arxiv.org/html/2607.06764#bib.bib3) 证明前沿 LLM 可以通过对候选解进行进化搜索来解决 ARC 任务。2024 年系统进化 Python 变换函数代,每代根据训练集适应度评分并对顶尖执行者进行修订;使用 Sonnet 3.5 在 ARC-AGI-1 上达到 53.6%,每任务约 29 美元。2025 年系统保留了进化架构,但进化自然语言指令而非 Python,使用 Grok-4 在 ARC-AGI-1 上达到 79.6%,每任务 8.42 美元。Greenblatt 的早期系统[Greenblatt (2024)](https://arxiv.org/html/2607.06764#bib.bib5)同样依赖程序合成与大量采样,估计每任务成本约 400 美元。Pang [2025](https://arxiv.org/html/2607.06764#bib.bib6)明确针对此范式内的成本-准确率前沿,使用受 DreamCoder 启发的可重用概念库,在 ARC-AGI-1 上达到 77.1%,估计每任务 2.56 美元——在精神上是最接近本文的已发表先前工作,两者都将 ARC 进展视为帕累托问题而非纯准确率驱动。然而,两者位于范式边界的两侧:Pang 在*前沿模型进化搜索*内部优化效率,而本文研究通过*跳出*该范式能走多远。

##### ARC 上的训练时特化。第二种范式通过专门为 ARC 风格任务训练小模型达到竞争性准确率,结合了 ARC 分布数据上的监督训练、针对手头任务的测试时微调以及激进的测试时增强。MindsAI [Chollet et al. (2024)](https://arxiv.org/html/2607.06764#bib.bib27) 和 ARChitects [Franzen et al. (2025)](https://arxiv.org/html/2607.06764#bib.bib10) 竞赛参赛作品遵循此模式。小递归模型 (TRM) [Jolicoeur-Martineau (2025)](https://arxiv.org/html/2607.06764#bib.bib8) 报告在 ARC-AGI-1 上仅用 7M 参数达到 45%,作为小递归网络能在抽象推理上与前沿 LLM 匹敌的证据。Roye-Azar 等人 [2025](https://arxiv.org/html/2607.06764#bib.bib9) 的后续分析使这一说法复杂化:TRM 报告的准确率在很大程度上依赖于 1000 样本测试时增强流水线(贡献约 10 个绝对百分点),依赖于任务专用标识符嵌入(没有则准确率降至零),以及依赖于训练时正则化而非深度迭代推理(单步预测捕获约 94% 的最终准确率)。他们的分析强调计算效率不能简化为参数数量:总推理成本(包括测试时增强)仍然有意义。

相似文章

Prime Agent: 一个自我改进的RLM框架

Hugging Face Daily Papers

Prime Agent 是一个开源框架,它使用递归子代理和持久化计算来扩展语言模型在编码和推理任务中的长期能力,显著提高了在ARC-AGI-3等基准测试上的性能。

@sethkarten: https://x.com/sethkarten/status/2072034978112889328

X AI KOLs Following

Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。

OneDayAgent:迈向自主智能体的长时程执行框架

Hugging Face Daily Papers

OneDayAgent 是一个面向自主智能体的长时程执行框架,它将开放式任务分解为有界子任务,在上下文压力下管理执行记忆,并验证/修复最终输出。它在 AgentIF-OneDay 上使用 GLM-5.2 达到了当前最优水平,并能泛化到五个后端 LLM。