ARCANA:面向ARC-AGI-2推理的反射式多智能体程序合成框架

arXiv cs.AI 论文

摘要

ARCANA是一个反射式多智能体框架,将ARC-AGI-2抽象推理任务分解为迭代感知、假设生成、符号执行和反射精炼,在严格约束下提升推理效率。

arXiv:2607.09059v1 公告类型:新 摘要:我们提出了ARCANA,一个协作式多智能体框架,用于在严格的测试时间和硬件约束下解决ARC AGI 2任务。ARCANA将每个任务分解为迭代感知、假设生成、符号执行和反射精炼。一个感知基础智能体从原始网格构建以对象为中心的场景图,一个潜在程序策略提出多样化的DSL程序,一个符号执行器在演示上验证候选方案,一个反射智能体综合失败驱动的反馈以进行下一轮。这些智能体通过一个共享可微分黑板进行通信,并由一个学习型元控制器调度。该设计将结构化程序搜索与自适应多轮校正相结合,在具有挑战性的抽象变换任务上提升了推理效率和解决方案质量。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:52

# ARCANA:面向ARC-AGI-2推理的反思式多智能体程序合成框架

来源:https://arxiv.org/html/2607.09059

###### 摘要

我们提出 ARCANA,一个协同多智能体框架,用于在严格的测试时间和硬件约束下解决 ARC AGI 2 任务。ARCANA 将每个任务分解为迭代感知、假设生成、符号执行和反思性优化。感知基础智能体从原始网格构建以对象为中心的景象图,潜在程序策略提出多样化的 DSL 程序,符号执行智能体在演示上验证候选程序,反思智能体合成故障驱动的反馈,供下一轮使用。这些智能体通过共享的可微分黑板进行通信,并由一个学习到的元控制器调度。该设计将结构化程序搜索与自适应多轮校正相结合,提升了在挑战性抽象变换任务上的推理效率和解决方案质量。

## I 引言

ARC AGI 2 上的抽象推理仍然困难,因为成功的解决方案必须从少量演示中推断出紧凑的变换规则,同时处理可变的网格大小、对象交互以及潜在规则空间中的严重歧义。大型预训练模型提升了广泛的模式识别能力,但在组合性网格变换上的少样本泛化仍然需要精确搜索、显式验证以及用于结构发现的强归纳偏置[2 (https://arxiv.org/html/2607.09059#bib.bib1)]。近期推理方面的进展表明,中间推敲可以改善复杂推理,但这些增益并不能直接解决 ARC 风格的任务。基于链的提示有助于暴露推理步骤,但并不能保证演示之间的一致可执行性[11 (https://arxiv.org/html/2607.09059#bib.bib2)]。迭代自我反馈进一步改善了校正行为,但纯粹基于文本的优化在假设空间是符号性、空间性的且受到精确网格输出的严格约束时仍然薄弱[7 (https://arxiv.org/html/2607.09059#bib.bib3)]。为了应对这一挑战,我们引入了 ARCANA,一个自适应协作架构,将每个任务转化为多轮推理情节。ARCANA 将面向对象的感知、潜在程序提议、符号执行和反思性优化分离为专门智能体,通过共享黑板连接。该设计允许系统生成多样化的候选程序,在演示上测试它们,诊断失败模式,并将搜索重定向到程序空间中更有前景的区域。结果是一个在现实计算限制下进行抽象视觉推理的实用框架。

## II 相关工作

近年来关于结构化推理的工作越来越多地重新审视以对象为中心的表征和模块化规则操作,作为组合泛化的基础。基于槽位的感知分解提供了一条可微分的途径,从原始输入中发现实体及其属性,这在推理依赖于对象级变换而非密集像素时尤其有用[6 (https://arxiv.org/html/2607.09059#bib.bib4)]。与此同时,模拟生产式规则应用的神经系统展示了显式模块化结构如何比单一的端到端预测器支持更系统的计算[1 (https://arxiv.org/html/2607.09059#bib.bib5)]。第二条研究线强调通过推敲与行动之间的显式交互,或者通过将推理步骤转化为可执行形式,来增强神经模型中的推理行为。将多粒度语义编码器与图注意力相结合混合架构也在结构复杂领域表现出色[12 (https://arxiv.org/html/2607.09059#bib.bib12)]。ReAct 将中间推理与环境决策相耦合,提高了顺序问题求解中的可控性[16 (https://arxiv.org/html/2607.09059#bib.bib6)]。Program of Thoughts 通过将符号计算与语言生成分离,扩展了这一方向,展示了当精确正确性至关重要时可执行的中间程序的价值[3 (https://arxiv.org/html/2607.09059#bib.bib7)]。我们的方法还受到几种提高结构化推理效率和鲁棒性的具体技术的影响。在边缘级 CPU 上的硬件感知部署也推动了大型语言模型的混合精度和内核级优化策略[18 (https://arxiv.org/html/2607.09059#bib.bib16)]。我们的方法还受到几种提高结构化推理效率和鲁棒性的具体技术的影响[14 (https://arxiv.org/html/2607.09059#bib.bib11)]。旋转位置编码增强了空间关系上的注意力,非常适合基于网格的输入[8 (https://arxiv.org/html/2607.09059#bib.bib8)]。通过低秩更新进行参数高效适配,使得在无需重新训练整个模型的情况下进行轻量级测试时特化[4 (https://arxiv.org/html/2607.09059#bib.bib9)]。自一致性等多样化解码策略进一步表明,探索多条推理路径可以优于单轨迹预测,这一想法与我们的多样化程序提议和验证循环相一致[10 (https://arxiv.org/html/2607.09059#bib.bib10)]。类似地,MERIT-Net 表明,采用任务特定校准的两阶段检索-排序流水线可以从显式模块化设计和仔细报告的训练设置中受益[9 (https://arxiv.org/html/2607.09059#bib.bib17)]。检索增强推理的相关工作也探索了动态工具使用和选择性回退机制,如 DynaRAG 所示,当检索证据不足时通过路由到外部 API 来提高鲁棒性[5 (https://arxiv.org/html/2607.09059#bib.bib13)]。

## III 方法论

我们提出 ARCANA(自适应推理与协作智能体网络架构),一个多智能体框架,将每个 ARC-AGI-2 任务形式化为跨越四个专门智能体的多轮智能体推理情节(图1 (https://arxiv.org/html/2607.09059#S3.F1))。感知基础智能体使用带有槽位注意力的二维感知 Transformer,从原始网格构建以对象为中心的景象图。假设生成智能体是一个基于条件变分自编码器的潜在程序策略,自回归地提出多样化的候选变换程序。符号执行智能体在演示对上评估候选程序,并记录结构化的执行轨迹。反思性优化智能体通过对这些轨迹进行反事实分析,执行故障驱动的信用分配,产生类似梯度的反馈,将后续假设生成从先前失败的程序区域引导开。四个智能体通过共享的可微分黑板通信,由一个学习到的元控制器协调,该控制器通过策略梯度训练激活策略,自适应地在各轮次之间分配有限的计算预算。该框架通过一种新颖的推理轨迹优化目标进行端到端训练,该目标同时奖励最终答案的正确性和中间推理的效率。在 ARC Prize 2026 官方硬件约束下,ARCANA 的智能体多轮优化显著优于神经直推基线和独立的程序合成方法,在 ARC-AGI-2 上开创了开源解决方案的新状态,并缩小了与人类级抽象推理的差距。这种在严格延迟和可靠性约束下的自适应资源分配,让人联想到近期用于无服务器 AI 推理的自适应 GPU 实例缩放工作[17 (https://arxiv.org/html/2607.09059#bib.bib18)]。在 ARC Prize 2026 官方硬件约束下,ARCANA 的智能体多轮优化显著优于神经直推基线和独立的程序合成方法,在 ARC-AGI-2 上开创了开源解决方案的新状态,并缩小了与人类级抽象推理的差距[13 (https://arxiv.org/html/2607.09059#bib.bib14)]。

参见说明

图1:ARCANA 整体框架。四个专门智能体——感知基础(PGA)、假设生成(HGA)、符号执行(SEA)和反思性优化(RRA)——通过共享的可微分黑板 \(\mathcal{B}_t\) 在一个学习到的元控制器下通信。从 RRA 到 HGA 的珊瑚色反馈箭头实现了推动 ARCANA 改进的多轮优化循环。

## IV ARCANA 框架

### IV-A 问题形式化

我们将 ARC-AGI-2 视为一个由协作多智能体系统解决的序列决策问题。给定一个任务 \(\tau\),包含 \(N\) 个演示对 \(\mathcal{D}_\tau = \{(\mathbf{G}_n^{\mathrm{in}}, \mathbf{G}_n^{\mathrm{out}})\}_{n=1}^N\) 和一个或多个测试输入 \(\{\mathbf{G}_t^{\mathrm{in}}\}\),目标是为每个测试输入产生正确的输出 \(\mathbf{G}_t^{\mathrm{out}}\)。每个网格 \(\mathbf{G} \in \{0,1,\ldots,9\}^{H \times W}\) 是一个二维离散颜色符号数组,尺寸从 \(1 \times 1\) 到 \(30 \times 30\)。ARCANA 将每个任务分解为一个多轮情节 \(\mathcal{E} = (s_0, a_1, s_1, a_2, \ldots, s_T)\):在每一轮 \(t\),激活一部分智能体,消息通过黑板 \(\mathcal{B}\) 传递,状态 \(s_t\) 被更新。这一设计反映了 ARC-AGI 进展中的主导主题——优化循环——自然地映射到一个多智能体架构,其中感知、假设生成、符号执行和反思是迭代协作的专门模块[15 (https://arxiv.org/html/2607.09059#bib.bib15)]。当找到经过验证的解决方案或计算预算耗尽时,情节结束。

### IV-B 感知基础智能体(PGA)

感知基础智能体(图2 (https://arxiv.org/html/2607.09059#S4.F2))将原始网格表示转换为结构化的、以对象为中心的景象图,作为所有下游推理智能体的共享感知基础。其内部架构包括三个阶段:单元格级编码、对象发现和关系景象图构建。

参见说明

图2:感知基础智能体流水线。原始网格通过 RoPE-2D 位置编码进行颜色嵌入,由 6 层二维感知 Transformer 进行上下文编码,通过可微分槽位注意力解析为 \(K=16\) 个对象槽,并组装成景象图,其成对变换由跨演示 Transformer 聚合成任务表示 \(\mathbf{R}_{\mathrm{task}}\)。

#### IV-B1 二维感知 Transformer 编码器

每个网格单元格值 \(v \in \{0,\ldots,9\}\) 通过一个可学习的颜色嵌入矩阵 \(\mathbf{E}_{\mathrm{color}} \in \mathbb{R}^{10 \times d}\) 映射到一个稠密向量。为了注入适用于二维网格推理的几何归纳偏置,我们采用分解的二维旋转位置编码(RoPE-2D),将每个单元格的行索引 \(i\) 和列索引 \(j\) 编码为旋转矩阵,直接应用于自注意力点积中。嵌入后的单元格表示为:

\[
\mathbf{x}_{ij} = \mathbf{E}_{\mathrm{color}}[v_{ij}] + \mathbf{p}_i^{\mathrm{row}} + \mathbf{p}_j^{\mathrm{col}}
\tag{1}
\]

行和列位置编码通过交替的正弦旋转对定义:

\[
\mathbf{p}_i^{\mathrm{row}} = \bigoplus_{k=1}^{d/4} \begin{pmatrix} \cos(i \cdot \omega_k) \\ \sin(i \cdot \omega_k) \end{pmatrix}, \quad \omega_k = \frac{1}{10000^{4k/d}}
\tag{2}
\]

\[
\mathbf{p}_j^{\mathrm{col}} = \bigoplus_{k=1}^{d/4} \begin{pmatrix} \cos(j \cdot \omega_k) \\ \sin(j \cdot \omega_k) \end{pmatrix}, \quad \omega_k = \frac{1}{10000^{4k/d}}
\tag{3}
\]

其中 \(\bigoplus\) 表示沿嵌入维度的拼接。在自注意力层内,旋转编码调制查询-键点积,使得注意力分数成为相对位置的函数:

\[
\mathrm{Attn}(\mathbf{q}_{ij}, \mathbf{k}_{i'j'}) = \bigl( \mathbf{R}_{i-i'}^{\mathrm{row}} \mathbf{R}_{j-j'}^{\mathrm{col}} \mathbf{q}_{ij} \bigr)^\top \mathbf{k}_{i'j'}
\tag{4}
\]

其中 \(\mathbf{R}_{\Delta}^{\mathrm{row}}, \mathbf{R}_{\Delta}^{\mathrm{col}}\) 是由相对位移参数化的块对角旋转矩阵。例如:

\[
\mathbf{R}_{\Delta}^{\mathrm{row}} = \mathrm{diag}\!\left( \begin{pmatrix} \cos\theta & -\sin\theta \\ \sin\theta & \cos\theta \end{pmatrix}, \ldots \right)
\tag{5}
\]

其中每个旋转块的 \(\theta = \Delta_i \cdot \omega_k\)。展平的单元格嵌入 \(\mathbf{X} \in \mathbb{R}^{(H \cdot W) \times d}\) 由包含 \(L_{\mathrm{pga}}=6\) 层、\(h=8\) 个注意力头、嵌入维度 \(d=256\) 和 GELU 激活函数的 Transformer 编码器处理。每一层遵循预归一化残差结构:

\[
\tilde{\mathbf{X}}^{(\ell)} = \mathbf{X}^{(\ell)} + \mathrm{MHSA}\!\left( \mathrm{LN}\!\left( \mathbf{X}^{(\ell)} \right) \right)
\tag{6}
\]

\[
\mathbf{X}^{(\ell+1)} = \tilde{\mathbf{X}}^{(\ell)} + \mathrm{FFN}\!\left( \mathrm{LN}\!\left( \tilde{\mathbf{X}}^{(\ell)} \right) \right)
\tag{7}
\]

其中 \(\mathrm{LN}(\cdot)\) 表示 RMSNorm:

\[
\mathrm{RMSNorm}(\mathbf{x}) = \frac{\mathbf{x}}{\sqrt{\frac{1}{d} \sum_{i=1}^d x_i^2 + \epsilon}} \odot \boldsymbol{\gamma}
\tag{8}
\]

具有可学习的缩放 \(\boldsymbol{\gamma} \in \mathbb{R}^d\)。前馈网络采用 SwiGLU 门控机制:

\[
\mathrm{FFN}(\mathbf{x}) = \bigl( \mathrm{SiLU}(\mathbf{x}\mathbf{W}_{\mathrm{gate}}) \odot (\mathbf{x}\mathbf{W}_{\mathrm{up}}) \bigr) \mathbf{W}_{\mathrm{down}}
\tag{9}
\]

其中 \(\mathbf{W}_{\mathrm{gate}}, \mathbf{W}_{\mathrm{up}} \in \mathbb{R}^{d \times d_{\mathrm{ff}}}\) 且 \(\mathbf{W}_{\mathrm{down}} \in \mathbb{R}^{d_{\mathrm{ff}} \times d}\),\(d_{\mathrm{ff}} = \lfloor \frac{8}{3} d \rfloor\) 四舍五入到最接近的 64 倍数。编码器输出是上下文化的单元格特征图 \(\mathbf{Z} \in \mathbb{R}^{(H \cdot W) \times d}\)。

#### IV-B2 通过可微分槽位注意力进行对象发现

我们并非依赖硬编码的连通组件分析,而是采用可微分槽位注意力模块,以无监督、梯度友好的方式发现对象。我们初始化 \(K\) 个可学习的槽向量 \(\{\boldsymbol{\mu}_k^{(0)}\}_{k=1}^K\)。

相似文章

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv cs.AI

Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.

GraphARC:基于图结构的抽象推理综合基准

arXiv cs.AI

GraphARC是一个针对图结构数据抽象推理的新基准,将ARC范式扩展到图领域。对最新语言模型的评估揭示了理解与执行之间的差距,且在大规模实例上性能下降,凸显了扩展挑战。

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。