Schema(2分钟阅读)
摘要
Schema是一个框架,使前沿AI模型能够通过编写可执行程序来建模游戏环境、测试预测和规划,从而在ARC-AGI-3基准测试中达到99%的准确率。
Schema是一个让前沿模型像物理学家一样运作的框架。它可以帮助前沿模型在ARC-AGI-3公共测试中达到99%的准确率。ARC‑AGI‑3为智能体提供了一个游戏环境,但没有解释它看到的是什么。Schema让智能体将每个游戏的机制编写为一个可执行程序,与现实进行测试,并在其中进行规划。它控制如何将观察结果转化为游戏的工作模型,如何根据交互历史测试预测,以及如何执行和修订计划。
相似文章
Schema Harness 在 ARC-AGI-3 Public 上达到约99%
Schema 推出了一种新的 Harness,它使用 Claude Opus 4.8 和 Fable 5 等前沿模型,在 ARC-AGI-3 Public 集上实现了约99%的准确率,通过改进模型周围的流程,而非修改权重。
Schematize:一个用于生成和优化法律研究信息提取模式的智能体系统
Schematize 是一个开源的多代理系统,交互式地生成和优化法律研究的信息提取模式,在人类评估中取得顶尖性能。
ASMR:面向船舶维修报告编写的智能模式生成
本文提出了ASMR,一种智能框架,包含字段生成智能体和结构优化智能体,利用强化学习从历史船舶维修报告中自动生成紧凑且信息丰富的模式,旨在提高报告的完整性和一致性。
SAFAARI:面向加速广告主响应智能的架构感知框架
本文提出了SAFAARI,一个多智能体框架,用于改善客户支持领域自然语言到SQL系统中的模式链接能力,取得了81.66%的SEAL分数,并将开发时间降低了8倍。
@HavenFeng: 今天,我们推出[schema]:一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架…
推出[schema],一个在ARC-AGI-3公共集上使用Opus 4.8 + Fable 5达到99% RHAE、使用GPT-5.6 Sol达到95.35%的框架,旨在让LLM像物理学家一样思考。