Schema Harness 在 ARC-AGI-3 Public 上达到约99%
摘要
Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。
暂无内容
查看缓存全文
缓存时间: 2026/07/16 19:53
# 搭配我们的外挂系统,前沿模型在 ARC-AGI-3 公开集上达到约 99% — Schema
来源:https://schema-harness.github.io/
## ARC\-AGI\-3:不告知规则的游戏
ARC‐AGI‐3 为智能体提供了一个游戏环境,但未解释其所见为何。每一步,智能体都会收到一个 64×64 的网格(包含 16 种颜色索引)和一组合法动作。环境不提供任何对象列表、规则说明、明确目标或塑形奖励。取得进展的唯一途径是物理学家式的方法:智能体必须在世界模型尚不完善时行动,对网格代表什么、动作如何改变它、以及何种状态算作成功形成假设,然后随着新观察的到来不断修正模型和计划。
ARC‐AGI‐3 被证明对前沿模型极其困难。其官方指标 **相对人类行动效率 (RHAE)** (https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf) 将智能体在每个关卡中的行动数与首次接触的人类基线进行比较,并在所有环境中聚合结果;100% 意味着在每个环境的每个关卡上都达到了或优于人类基线的行动效率。在半私有集上,已验证的前沿模型性能从 3 月发布时的 0.51% (https://arcprize.org/blog/arc-agi-3-launch) 上升到 7 月 GPT‐5.6 Sol 使用最大推理时的 7.78% (https://arcprize.org/results/openai-gpt-5-6) 。Sol 在公开集上也获得了 13.33% 的成绩,但仍远低于人类参考值。
020406080100Human 100%25 Mar15 Apr01 May15 May01 Jun15 Jun01 Jul15 JulRELEASE DATERHAE (%)AgenticaTELLDreamTeamOpenClawbaseline1Continual HarnessSol MaxTerra MaxLunaOpus 4.6 MaxOpus 4.7 HighGPT-5.5 HighOpus 4.8 HighSol Max[schema]Opus 4.8 & Fable 598.98[schema]GPT‐5.695.35
VERIFICATION
Verified
Self‐reported
EVALUATION SET
Public
Semi‐private
图 1. ARC‐AGI‐3 RHAE 结果(截至 2026 年 7 月)。实心标记表示 ARC Prize 验证的结果;空心标记表示公开集上自行报告的结果。品红色标识 Schema。两个 Schema 结果均为自行报告,尚未经 ARC Prize 验证。**Schema**,我们今天介绍的这款外挂系统,使用 Claude Opus 4.8 和 Fable 5 在 ARC‐AGI‐3 公开集上达到了 99%,使用 GPT‐5.6 Sol (https://huggingface.co/datasets/schema-harness/arc-agi-3-schema-traces) 达到了 95.35%。它不改变底层模型权重,而是改变模型周围的过程:如何将观察转化为有效的游戏工作模型,如何根据交互历史检验预测,以及如何执行和修订计划。
这两个分数均来自固定的回退规则:先运行 Opus 4.8 和 Sol xhigh;得分低于 80 的游戏分别用 Fable 5 和 Sol max 重新运行,并保留每个游戏中较高的分数。
**关键结论:如何使用模型至关重要。** 本文其余部分将展示具体安排。
## 像物理学家一样思考
Schema 像物理学家一样思考。物理学家在写下定律之前,必须确定定律的对象是什么。观察中的哪些部分是对象?哪些属性定义了状态?只有在这之后,他们才能询问状态如何变化。Schema 将这些形式化为两个问题。**状态归因**将原始观察转化为可追踪的对象、变量和关系。**机制发现**寻找状态在动作下如何变化,并将规则编写为可执行程序。我们之前的系统 VIGA (https://fugtemypt123.github.io/VIGA-website/) 专注于第一个问题。通过基于图形引擎的分析-综合,它从远比 ARC 网格更丰富的连续视觉输入中恢复了场景程序。其他系统如 WorldCoder (https://arxiv.org/abs/2402.12275) 则专注于第二个问题:它们从轨迹中学习转移程序,但起始于已经结构化的状态表示。我们认为这两个问题必须联合解决,即让智能体同时构建状态表示和转移规则。
**层级 2 · 机制发现**WorldCoder
\(state, action, state′\) →**转移程序 step\(\)**
世界在时刻之间的运转方式——以程序形式编写的规则。每个游戏隐藏着如下机制:
弹簧墙机制
弹簧墙
加油环机制
加油环
颜色旋转器机制
颜色旋转器
**层级 1 · 状态归因**VIGA
observation →**状态程序**
世界是什么——对象、数量、名称,从原始像素中发明而来。没有任何东西表明哪些像素算作玩家、墙壁或计数器。
一个 ARC‑AGI‑3 场景,分割为推测出的对象玩家?计数器?
**\[schema\]**联合解决两个层级——全部在一个可编辑的程序中。
图 2. 两个抽象层级。层级 1 发明状态——哪些像素构成玩家、墙壁和计数器。层级 2 恢复该状态上的机制,如上面的弹簧墙、加油环和颜色旋转器。Schema 将两者保存在同一个可编辑程序中:当规则无法与实验保持一致时,反例可以指责表示本身。状态归因和机制发现不能独立解决。最初看似合理的状态表示,当无法找到一致的转移规则来解释后续实验的结果时,可能会证明是不充分的。在 Schema 中,状态表示和转移规则共同编码在同一个可编辑程序中。当观察与预测矛盾时,智能体可以修订表示或规则,然后更新另一个以恢复一致的模型。这反映了物理学家的实际工作方式:当预测持续失败时,他们不仅仅调整定律,还会改变状态本身。最典型的例子是狭义相对论的诞生。当 Michelson 和 Morley 无法探测到光应该在其中波动的介质时,Lorentz 选择了第一条路线:保留以太,用收缩假设来修补规则以吸收零结果。Einstein 选择了第二条:在狭义相对论中,他将以太作为状态的一部分丢弃,并使同时性相对于参考系,从而得到了一个简单的运动电动力学。
ARC‐AGI‐3 要求智能体从原始观察中构建这两个层级。网格既不标识对象也不标识目标,因此智能体必须决定哪些模式对应实体(如玩家、墙壁和计数器),推断动作如何变换它们,并确定哪些配置算作进度或完成。甚至目标谓词——在 Schema 中实现为 `is_goal`——也必须从交互中推断。
**核心思想。** 潜在的世界表示是一个程序,而不是一个向量——因此它是**可解释的**(一个可以阅读和比较差异的文本文件)、**可验证的**(可以针对记录的现实逐信念回放)和**可搜索的**(程序即模拟器;在其内部进行规划是免费的)。
observe原始的网格——像素。其中的每个对象都由智能体发明。
deliberate一个开放式的推理过程,仅以提交的动作队列结束。
execute运行队列,每一步根据世界模型的预测进行自我检查。
record将所有真实转移追加到时间线。append‑only
deliberate
运行示例 — LS20 · 真实跟踪Opus 4.8 · 642 个行动对比人类 780 · RHAE 100
LS20 游戏
\[observe\] 64×64 网格,16 种颜色,动作 0–4 — 一个十字形精灵、一个青+栗色方块、一个加框的栗色字形、一个颜色 11 的条。
\[deliberate\] notes.md:化身是 5×5 的青+栗色方块 — 十字精灵是静止的;条是移动预算,仅在成功移动时消耗。
\[deliberate\] 编写 step() · run_backtest → world_model_v5.py 精确重放了 36/36 条记录转移。
\[execute\] 提交 \[2,2,2,3,2,2\] →**意外:**77 个单元格预测错误 — 方块将指示器重新涂成了栗色。计划无效。
\[record\] 重绘规则编码 · 回测通过 · run_bfs 找到最短计划 → 过关。如此完成 7 个关卡:642 个行动对比人类基线的 780 个行动。
图 3. Schema 控制循环,可一步步操作:四阶段外循环及其仅可追加的时间线,一次推理过程的放大(理论化 → 验证 → 规划 → 提交),然后是一个真实的 LS20 跟踪在各个阶段的展开。## 数据说明
**指标详解。** 官方 ARC‐AGI‐3 使用**相对人类行动效率 (RHAE)** (https://arcprize.org/media/ARC_AGI_3_Technical_Report.pdf) 来评估性能,该指标将智能体使用的行动数与每个已完成关卡的上中位数首次接触人类基线进行比较。每关得分是 `(human actions ÷ agent actions)^2`,上限为 `1.15`。在每个游戏内,关卡权重从 1 递增到 *n*,因此后面的关卡对游戏得分的贡献更大。基于相同权重的完成上限确保除非所有关卡都被清除,否则游戏的得分不可能达到 100%。基准分数是所有游戏得分的平均值。所有环境行动,包括探索性行动,都计入智能体的总数;由于效率比是平方的,额外行动会急剧降低分数。因此,98.98% 是完成度和行动效率的综合度量——而不是已解决问题所占的百分比。
012345670×0.5×1×1.5×2×累积行动数 (×人类基线)已通过关卡数人类基线 · 776 次行动代理 A · 785 次行动 · RHAE 97.7%代理 B · 1591 次行动 · 卡在 6/7关卡完成 ≠ 效率A 以接近人类预算完成 7/7;B 花费 2.7 倍且卡住,所以 97.7% vs <14%图 4. **RHAE 同时奖励完成度和行动效率。** 代理 A 以 785 次行动完成所有七个关卡,接近人类基线的 776 次。代理 B 在前六个关卡中使用了 1591 次行动——是相应人类基线的 2.7 倍——并且未能完成第七关。由于 RHAE 对行动效率比取平方并根据完成度进行上限,代理 B 的得分低于 14%。Claude 行(图 5)提供了一个受控比较,使用相同的 Opus 4.8 和 Fable 5 配对。将最终的 Claude Code 快照视为基线输出,得分为 **42.83%**;使用 Schema,同一配对达到 **98.98%**,提高了 56.15%。
使用 Sol xhigh 和 Sol max 回退配对,Schema 达到 **95.35%**。最接近的官方参考并非匹配的外挂系统比较:ARC Prize 报告最佳单个变体 Sol max 在公开集上为 13.33%,在半私有集上为 7.78% (https://arcprize.org/results/openai-gpt-5-6)。因此图表中显示的 82.02% 的公开集差异是背景性的,并非 Schema 所带来增益的受控估计。
受控的 Claude 比较分离了过程差异,而不是模型能力差异。Claude Code 为文件操作和长上下文管理提供了一个强大的通用外挂系统。原则上它可以模仿 Schema 的工作流,但并不强制模型这样做。在通用外挂系统下,模型直接对游戏进行操作,可能将其信念隐含在上下文中。Schema 则强制三个约束:
1. 将当前世界模型编码为可运行的 `step()` 程序。
2. 在用于规划之前,根据所有记录转移验证该程序。
3. 仅通过 `commit_actions` 发送行动,并在任何预测错误后立即丢弃剩余计划。
在此受控配置下,Schema 的外挂系统比 Claude Code 基线提升了 56.15%。
020406080100Claude Code 42.83%Schema 98.98% · +56.15 ppOpus & Fable官方基线 13.33%Schema 95.35% · +82.02 ppSol xhigh & maxRHAE (%)图 5. Claude 行保持了 Opus & Fable 配对不变,仅改变了外挂系统。Sol 行将 Schema 的 xhigh & max 配对与最佳官方单一变体公开分数进行比较,因此作为参考显示而非受控消融实验。**验证状态。** 98.98% 和 95.35% 的分数是公开集上自行报告的结果,根据随本文发布的运行工件计算得出。这两个分数均未经 ARC Prize 独立验证。
**公开集的指示性如何?** 此处的每个 Schema 数字都是在 25 个公开游戏上测量的。Sol max 提供了一个跨评估集的官方校准点——公开集 13.33% 对比半私有集 7.78%——但这并不能证明将接近上限的公开分数数值外推是合理的。公开集 98.98% 映射到半私有集上是什么,只有经过测量才能知道。可用工件仅记录了公开集的运行,因此本草案不做关于固定外挂系统或保留性能的声明。
Schema 对比首次接触人类基线
所有 25 个公开游戏
Schema (我们的)首次接触人类
RHAE 98.98%
水平轴:累积真实行动数 · 垂直轴:已通过关卡数
图 6. 全部 25 个公开游戏,每游戏保留最佳运行。在两个 Schema 配对之间切换;人类基线和每个游戏的坐标轴保持不变,以便直接比较曲线。Claude 曲线和首次接触人类基线是来自评估导出的精确累积行动数;每游戏保留的运行是 Opus 4.8 或 Fable 5 中得分较高的那个(徽章,左上角)。Sol 曲线来自源数据,待完整 Sol 评估工件发布,仅供参考。**配对账目。** 在保留的 Claude 结果中,14 个游戏使用 Opus 运行,11 个使用 Fable 运行。14 个 Opus 运行中的 13 个和 11 个 Fable 运行中的 6 个得分为 100,因此共有 19 个游戏整体得分为 100。在保留的 Sol 结果中,15 个游戏使用 xhigh 运行,10 个使用 max 运行。所有 15 个 xhigh 运行均得 100;10 个 max 运行中,5 个得 100,5 个低于 100。
**残留误差集中。** Claude 配对整体距 100 差 1.02%。十九个游戏得分为 100,其余六个从 89.87 到 99.10 不等;游戏得分中位数为 100。Sol 配对也有中位数游戏得分 100:20 个游戏得分为 100,其余五个从 60.93 到 87.80 不等。
## 案例研究
### 观察 1:推断出的世界程序使行动高效
在 25 个游戏中,当智能体推断出一个能精确重现记录历史的程序世界模型时,其使用的行动数比人类参考值少 1.6–5.0 倍。原因在于行动花费模式的转变:智能体仅支付一次真实行动来发现机制,之后在模型内部免费规划,而不是通过反复试错重新发现机制。这依赖于两种能力:
**A. 对照完整历史进行验证。** 每个真实转移都被记录,`run_backtest` 将每个候选规则与整个记录进行核对,而不是依赖回忆。由于记录既超越了有限的工作记忆,也超越了自动压缩的上下文窗口,经过验证的模型可以信任,无需进一步的现实环境测试。
**B. 在可复用的模拟器中进行规划。** 一旦 `step()` 和 `is_goal()` 经过验证,广度优先搜索就可以探索 10^3-10^4 个建模状态,而无需消耗任何环境行动。而且由于模型以代码形式持久存在,这种免费规划可以在后续每个关卡中重复使用。
在人类最困难的关卡中收益最为明显:在 M0R0 关卡 4 中,智能体需要 42 个行动,而人类需要 500 个,这与一次发现成本后在其内部重新计算规划的模式一致。以下每个可展开的项目都是一个支持该模式的游戏关卡案例。
证据 1A · RE86精确验证支持一次性规划393/393 精确 · 61 步计划RE86 展示了一个游戏中的完整序列:`run_backtest` 在每条记录转移上回放模型,然后经过验证的模型提供一个计划,无需额外试错就能清除整个关卡。
RE86—**Schema 搭配 Opus 4.8**
根据所有记录历史验证模型39
相似文章
@HavenFeng: 今天,我们推出[schema]:一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架…
推出[schema],一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架,旨在让LLM像物理学家一样思考。
Schema(2分钟阅读)
Schema是一个框架,使前沿AI模型能够通过编写可执行程序来建模游戏环境、测试预测和规划,从而在ARC-AGI-3基准测试中达到99%的准确率。
@sethkarten: https://x.com/sethkarten/status/2072034978112889328
Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。
面向ARC-AGI-1的抽象推理与泛化的经济型智能体框架
本文提出了面向ARC-AGI-1的经济型智能体框架,通过探索者-定义者流水线和反思型协调器,使用DeepSeek V3.2无需微调即可实现强大性能,以低成本达到67.25%的pass@2。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。