启用两项设置使我们的ARC-AGI-3基准测试得分提高了三倍
摘要
OpenAI发现,在API工具中启用保留推理和压缩设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提高了三倍,同时将输出令牌减少了6倍,表明基准测试性能在很大程度上受工具设计影响。
两个API设置如何通过保留推理和启用压缩来提升GPT-5.6在ARC-AGI-3上的性能,提高得分和效率。
查看缓存全文
缓存时间: 2026/07/30 01:46
# 两个设置如何让我们的 ARC-AGI-3 基准测试分数提升三倍
来源:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
*一段加速视频展示了 GPT‐5.6 Sol 尝试解决 ARC‐AGI‐3 基准测试中的谜题,左侧为官方测试框架,右侧为我们的 Responses API 测试框架,后者保留了推理过程并启用了压缩。在 **这个游戏** (opens in a new window) (https://arcprize.org/tasks/cd82) 的排行榜上,没有任何前沿模型能解决第一关之后的关卡。使用我们的测试框架,GPT‐5.6 Sol 解决了全部六个关卡。*
GPT‐5.6 Sol 已经解决了数学中长期存在的开放问题,例如**环双覆盖猜想** (opens in a new window) (https://cdn.openai.com/pdf/04d1d1e4-bc75-476a-97cf-49055cd98d31/cdc_proof.pdf),并在《宝可梦 火红》等游戏中取得胜利。但在 ARC-AGI-3(一个二维益智游戏基准测试)上,GPT-5.6 Sol 的得分仅为 7.8%,而 GPT-5.5 几乎无法正常进行游戏,得分仅有可怜的 0.4%。
是二维益智游戏对我们的模型特别困难吗?还是另有隐情?
基准测试很少单独衡量 AI 模型。它们同样衡量一些不那么明显的选择,例如 API 设置、测试框架设计和提示工程。在 ARC-AGI-3 的案例中,我们发现开启我们在 ChatGPT 和 Codex 中使用的两个 API 设置——保留推理和压缩——在公开任务集上使分数提升了三倍,并将输出 token 减少了 6 倍。
*使用官方测试框架,GPT‐5.6 Sol 在 ARC‐AGI‐3 公开集上的得分为 13.3%。启用保留推理和压缩后,得分达到 38.3%。得分衡量相对人类行动效率(**RHAE** (opens in a new window) (https://docs.arcprize.org/methodology))——一种将模型性能与人类基线进行比较的指标。根据 **官方游戏日志** (opens in a new window) (https://huggingface.co/datasets/magic-sword/arc_agi_3_public_demo_human_testing),我们估计人类测试者的平均得分为 48%。模型不会被告知如何计分,也无法在过程中看到自己的分数——行动仅返回每一帧的文本表示以及它们所处的关卡。*
## ARC-AGI-3
ARC-AGI-3 是一个旨在衡量 AI 智能体学习和推理能力的基准测试。智能体需要探索不熟悉的 2D 游戏,并在没有明确指令的情况下推断其工作原理。你可以在 arcprize.org/tasks (opens in a new window) (https://arcprize.org/tasks) 上玩 25 个演示游戏。
ARC-AGI-3 有意使用了一个通用的测试框架,不包含工具或特殊功能。ARC 的理由是,简单的测试框架会使模型的缺点更明显,并使模型之间的比较更公平。相比之下,商业开发者会针对每个模型的特性和怪癖优化测试框架。
Codex 中的 GPT-5.6 Sol 完成了《杀戮尖塔 2》中随机的每日挑战。
*Ethan Mollick **展示** (opens in a new window) (https://x.com/emollick/status/2075950897029374334) 了 Codex 中的 GPT‐5.6 Sol 如何击败《杀戮尖塔 2》中的随机每日挑战,这是一款在 GPT‐5.6 Sol 知识截止日期之后发布的游戏。*
但随着我们深入探究,我们发现模型的大部分困惑并非源于模型本身,而是源于测试框架中的设置。
首先,我们注意到每次游戏动作后,所有私有推理过程都会被丢弃。这意味着每次进行动作时,GPT-5.6 Sol 都要重新理解游戏,无法记住之前的思考过程。模型仍然可以看到过去动作的记录和简短的附注,但无法看到导致这些动作的计划、见解或想法。
其次,我们发现测试框架使用了一个滚动截断窗口,导致随着历史记录增长,较早的动作变得不可见。因此,GPT-5.6 Sol 不仅无法记住之前的思考,还在逐渐失去对之前动作的记忆。
这两个测试框架特性——丢弃推理和滚动截断——共同解释了为什么 GPT-5.6 Sol 难以随着时间推移进行学习。
## 智能体在记住自己做过什么时表现最佳
我们的模型经过训练,会在输出回复或工具调用之前,通过私有推理消息进行思考。这些私有思考消息作为对话历史的一部分被保留。如果对话变得过长,我们会进行总结并继续。
这就是我们训练模型的方式,也是它们在 ChatGPT 和 Codex 中的部署方式。为了更好地匹配我们的生产设置,我们使用我们的 Responses API (opens in a new window) (https://developers.openai.com/blog/responses-api) 实现了 ARC-AGI-3 测试框架。我们的 API 使得管理上下文变得容易:对于 GPT-5.6,传递之前的响应 ID 会自动在工具调用和轮次之间保留推理。
保留推理后,我们注意到两个重大变化。首先,GPT-5.6 Sol 在每个动作之前花更少的时间思考,因为它不再需要每回合都从头开始解读游戏。其次,当它能够记住之前的想法时,GPT-5.6 Sol 在随时间学习和采用连贯策略方面表现得好得多。
下一个改进来自用压缩 (opens in a new window) (https://developers.openai.com/api/docs/guides/compaction)(Responses API 中的另一个设置)替换滚动截断。
ARC-AGI-3 测试框架通过滚动截断来处理上下文限制。当对话上下文超过 175,000 个字符时,最旧的消息会被丢弃。
滚动截断有两个缺点。首先,模型会丢失早期的观察和动作。其次,它在大部分任务中都会使用较满的上下文窗口,这可能会略微影响性能。
当我们在 ARC-AGI-3 上启用压缩时,GPT-5.6 Sol 能够更好地在更长的运行过程中保留它对每个游戏所学到的知识,并使用更少的输出 token 获得更高的分数。
为了说明保留推理和启用压缩的效果,这里有一个动画,展示了 GPT-5.6 Sol 的 175K 上下文窗口在使用每个测试框架解决一系列 ARC-AGI-3 谜题时的变化情况。
*中间两列描述了每个测试框架如何不同地使用模型上下文窗口。凭借对过去更好的记忆,GPT‐5.6 Sol 每次动作思考更少,进展更快。注意:我们的实现使用了 175,000 个 token 的限制而不是字符,但这最终非常相似,因为绝大多数文本是动作网格,我们的分词器以 1:1 的比例对其进行分词。*
总之,保留推理和压缩使得 GPT-5.6 Sol(max)能够以 6 倍更少的输出 token 获得大约 3 倍的分数。
## 结论与建议
我们希望这些实验能提醒大家,评估很少单独衡量模型——它们同样衡量一系列关于 API 设置、测试框架设计和提示工程的、不那么明显的选择。这并非我们第一次对公开基准测试的低分感到惊讶,然后发现评估运行器使用了丢弃推理消息的通用测试框架。
如果你是想要最大化性能的 API 开发者,我们建议使用与我们产品中部署的相同设置:
- 使用我们的 Responses API,而不是我们旧版的 Chat Completions API
- 保留推理
- 使用压缩
如果你在比较模型,我们建议依赖使用上述设置的评估,这样最能匹配 ChatGPT 和 Codex 中的实际使用场景。
我们感谢 ARC 多年来在 AGI 评估方面的创造性工作,以及他们的分析启发我们在这里进行更仔细的审视。
相似文章
@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…
OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。
@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
@sama: 哥布林级别的博文
声称GPT-5.6 Sol通过使用规范压缩实现跨多个上下文窗口的推理,在ARC-AGI-3上达到了最先进水平。
GPT-5.6 系列 (2分钟阅读)
OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。
@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…
OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。