@HavenFeng: 今天,我们推出[schema]:一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架…

X AI KOLs Timeline 工具

摘要

推出[schema],一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架,旨在让LLM像物理学家一样思考。

今天,我们推出[schema]:一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架。 [schema]让LLM像物理学家一样思考。🧵 https://t.co/U0C0JFj62e
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:24

今天,我们推出 [schema]: 一个在 ARC-AGI-3 公共集上以 Opus 4.8 + Fable 5 达到 99% RHAE、以 GPT-5.6 Sol 达到 95.35% 的框架。

[schema] 让 LLM 像物理学家一样思考。

ARC-AGI-3 给智能体一个 64×64 的网格,加上合法动作,没有规则、既定目标或奖励。智能体必须像物理学家一样同时发现世界是什么以及如何运作:

  1. 状态锚定 -> 识别对象、关系和目标。
  2. 机制发现 -> 推断这些状态如何变化。

[schema] 在一个可编辑的程序(即符号世界模型)中处理状态和机制。它设计实验来验证假设,对历史数据进行程序回测,并在其世界中以零行动成本进行规划。

[schema] 在 ARC-AGI-3 公共集上达到饱和表现(99%)仅仅是一个起点。还有更多值得探索!

完整博客:http://schema-harness.github.io
智能体轨迹:http://huggingface.co/datasets/schema-harness/arc-agi-3-schema-traces…

与 @guanningzeng、@Jiani_Wang_、@wenjie_ma、@shaofeng_y27736、@ChenyangWa70207、@lustralisk95、@akanazawa、@wodenimoni、@xiuyu_l 和 @Zanette_ai 组成的出色团队共同努力

@arcprize

@HavenFeng 在 http://monday.com 生产环境中运行 Opus 4.8 已达 129 天。schema 证明了框架比模型更重要——我每天的 20 个 cron 任务也在证实这一点。如果换成 K3,那 99% 会变成多少?

相似文章

Schema Harness 在 ARC-AGI-3 Public 上达到约99%

Hacker News Top

Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。

@sethkarten: https://x.com/sethkarten/status/2072034978112889328

X AI KOLs Following

Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。

Schema(2分钟阅读)

TLDR AI

Schema是一个框架,使前沿AI模型能够通过编写可执行程序来建模游戏环境、测试预测和规划,从而在ARC-AGI-3基准测试中达到99%的准确率。