@HavenFeng: 今天,我们推出[schema]:一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架…
摘要
推出[schema],一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架,旨在让LLM像物理学家一样思考。
查看缓存全文
缓存时间: 2026/07/16 22:24
今天,我们推出 [schema]: 一个在 ARC-AGI-3 公共集上以 Opus 4.8 + Fable 5 达到 99% RHAE、以 GPT-5.6 Sol 达到 95.35% 的框架。
[schema] 让 LLM 像物理学家一样思考。
ARC-AGI-3 给智能体一个 64×64 的网格,加上合法动作,没有规则、既定目标或奖励。智能体必须像物理学家一样同时发现世界是什么以及如何运作:
- 状态锚定 -> 识别对象、关系和目标。
- 机制发现 -> 推断这些状态如何变化。
[schema] 在一个可编辑的程序(即符号世界模型)中处理状态和机制。它设计实验来验证假设,对历史数据进行程序回测,并在其世界中以零行动成本进行规划。
[schema] 在 ARC-AGI-3 公共集上达到饱和表现(99%)仅仅是一个起点。还有更多值得探索!
完整博客:http://schema-harness.github.io
智能体轨迹:http://huggingface.co/datasets/schema-harness/arc-agi-3-schema-traces…
与 @guanningzeng、@Jiani_Wang_、@wenjie_ma、@shaofeng_y27736、@ChenyangWa70207、@lustralisk95、@akanazawa、@wodenimoni、@xiuyu_l 和 @Zanette_ai 组成的出色团队共同努力
@arcprize
@HavenFeng 在 http://monday.com 生产环境中运行 Opus 4.8 已达 129 天。schema 证明了框架比模型更重要——我每天的 20 个 cron 任务也在证实这一点。如果换成 K3,那 99% 会变成多少?
相似文章
Schema Harness 在 ARC-AGI-3 Public 上达到约99%
Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。
@sethkarten: https://x.com/sethkarten/status/2072034978112889328
Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。
@Saboo_Shubham_: 疯狂的时代。Anthropic: Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6。Tibo: 我改了两个设置,GPT-5.6 Sol 就成为 SoTA 了
Anthropic 的 Opus 5 在 ARC-AGI-3 上击败了 GPT-5.6,但 Tibo 声称通过涉及多上下文推理和规范压缩的两个设置更改,GPT-5.6 Sol 成为了 SoTA。
Schema(2分钟阅读)
Schema是一个框架,使前沿AI模型能够通过编写可执行程序来建模游戏环境、测试预测和规划,从而在ARC-AGI-3基准测试中达到99%的准确率。
Opus 4.8 刚刚打破了 ARC-AGI-3(1分钟阅读)
一个名为 LisanBench 的新基准测试评估了 LLM 在需要规划、记忆和约束遵循的单词链任务上的表现,结果显示 o3 和 Anthropic 模型表现强劲。