@OpenAI:基准分数既反映模型本身,也反映用于运行模型的测试框架和设置。对于长时间运行的智能体,保留…
摘要
OpenAI透露,启用保留推理和上下文压缩使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提升了三倍,凸显了测试框架设置对模型性能测量的显著影响。
查看缓存全文
缓存时间: 2026/07/30 01:46
基准得分反映的不仅是模型本身,还包括用于运行它的测试框架和设置。
对于长期运行的智能体来说,保留推理过程和压缩上下文能让模型基于已有学习成果持续构建知识。 https://t.co/JBIKCKrUfw
两项设置如何让我们的ARC-AGI-3基准测试得分翻了三倍
来源:https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/ 一段快进视频,展示GPT‑5.6 Sol在ARC-AGI-3基准测试中尝试解谜的过程,分别使用官方测试框架(左侧)和我们保留推理过程并启用压缩的Responses API测试框架(右侧)。在排行榜上本游戏(https://arcprize.org/tasks/cd82)(在新窗口中打开)中,没有前沿模型能通过第一关之后的任何关卡。而使用我们的测试框架,GPT‑5.6 Sol完成了全部六个关卡。
GPT‑5.6 Sol已经解决了数学中一些长期存在的开放问题,例如圈双重覆盖猜想(https://cdn.openai.com/pdf/04d1d1e4-bc75-476a-97cf-49055cd98d31/cdc_proof.pdf)(在新窗口中打开),并通关了《宝可梦:火红》等游戏。但在ARC-AGI-3(一个2D益智游戏基准测试)中,GPT‑5.6 Sol的得分仅为7.8%,而GPT‑5.5甚至几乎无法进行游戏,仅获得了可怜的0.4%。
难道2D益智游戏对我们的模型来说异常困难?还是另有原因?
基准测试很少孤立地衡量AI模型。它们同样衡量那些不那么显眼的选择,比如API设置、测试框架设计和提示词。以ARC-AGI-3为例,我们发现,开启我们在ChatGPT和Codex中使用的两项API设置——保留推理过程和压缩——在公开任务集上将得分提升了三倍,并将输出token减少了6倍。
使用官方测试框架时,GPT‑5.6 Sol在ARC-AGI-3公开集上的得分为13.3%。启用保留推理过程和压缩后,其得分达到38.3%。得分衡量的是相对人类操作效率(RHAE)(https://docs.arcprize.org/methodology)(在新窗口中打开)——一种将模型性能与人类基线进行比较的度量标准。根据官方游戏日志(https://huggingface.co/datasets/magic-sword/arc_agi_3_public_demo_human_testing)(在新窗口中打开),我们估计人类测试者的平均得分为48%。模型不会被告知如何计分,也无法在整个过程中看到自己的分数——每次操作只会返回每一帧的文本表示以及当前所处的关卡。
ARC-AGI-3
ARC-AGI-3是一个旨在衡量AI智能体学习和推理能力的基准测试。智能体需要探索不熟悉的2D游戏,并在没有明确指令的情况下推断其运作机制。你可以在arcprize.org/tasks(https://arcprize.org/tasks)(在新窗口中打开)试玩25个演示游戏。
ARC-AGI-3有意采用了通用的测试框架,不提供工具或特殊功能。ARC的考量是,简单的测试框架能让模型的缺陷更加明显,并使得模型之间的比较更加公平。相反,商业开发者会针对每个模型的特性和怪癖优化测试框架。
GPT-5.6 Sol在Codex中完成《杀戮尖塔2》随机每日挑战的视频。
Ethan Mollick展示(https://x.com/emollick/status/2075950897029374334)(在新窗口中打开)了GPT‑5.6 Sol在Codex中击败《杀戮尖塔2》的随机每日挑战,该游戏发布于GPT‑5.6 Sol的知识截止日期之后。
但当我们深入探究时,发现模型的大部分困惑并非模型本身固有,而是源于测试框架的设置。
首先,我们注意到每次游戏动作后,所有私有推理过程都会被丢弃。这意味着每一次动作,GPT‑5.6 Sol都被要求重新理解游戏,无法记住它之前的思考。模型仍然可以看到过往动作和简短附注的记录,但无法看到导致这些动作的计划、洞察或想法。
其次,我们发现测试框架使用了滚动截断窗口,导致随着历史记录的增长,较早的动作变得不可见。因此,GPT‑5.6 Sol不仅无法记住之前的思考,连之前的动作记忆也在丢失。
测试框架的这两个特点——丢弃推理过程和滚动截断——共同解释了为什么GPT‑5.6 Sol难以随时间进行学习。
智能体在记住自己做过什么时表现最佳
我们的模型经过训练,在输出回复或工具调用之前,会通过私有推理消息进行思考。这些私有思考消息会作为对话历史的一部分被保留。如果对话变得过长,我们会对其进行总结并继续。
这就是我们模型的训练方式,也是它们在ChatGPT和Codex中的部署方式。为了更好地匹配我们的生产设置,我们使用Responses API(https://developers.openai.com/blog/responses-api)(在新窗口中打开)实现了ARC-AGI-3测试框架。我们的API使上下文管理变得简单:对于GPT‑5.6,传递前一个响应ID会自动在工具调用和轮次之间保留推理过程。
启用保留推理后,我们注意到两个重大变化。首先,GPT‑5.6 Sol在每次动作前花费的思考时间减少了,因为它不再需要每回合都从头解读游戏。其次,当能够记住之前的想法时,GPT‑5.6 Sol能更好地随时间学习并采用连贯的策略。
下一个改进来自将滚动截断替换为压缩(https://developers.openai.com/api/docs/guides/compaction)(在新窗口中打开),这也是Responses API中的另一项设置。
ARC-AGI-3测试框架通过滚动截断来处理上下文限制。当对话上下文超过175,000个字符时,最早的消息会被丢弃。
滚动截断有两个缺点。首先,模型会丢失早期的观察和动作。其次,模型在大部分任务中都在一个较满的上下文窗口中运行,这可能会轻微影响性能。
当我们在ARC-AGI-3上启用压缩后,GPT‑5.6 Sol能够在更长的运行过程中更好地保留所学到的每个游戏的知识,并且用更少的输出token获得了更高的分数。
为了说明保留推理过程和启用压缩的效果,这里有一段动画展示了GPT‑5.6 Sol在使用不同测试框架解决一系列ARC-AGI-3谜题时,其175K上下文窗口的使用情况。
中间两列展示了两种测试框架在模型上下文窗口使用方式上的差异。凭借对过去的更好记忆,GPT‑5.6 Sol每次动作思考得更少,进展也快得多。注意:我们的实现使用175,000个token而非字符作为限制,但这最终非常相似,因为绝大多数文本是操作网格,我们的分词器以1:1的比例对其进行分词。
保留推理过程和压缩结合,使GPT‑5.6 Sol(最大)的得分提高了约3倍,同时输出token减少了6倍。
结论与建议
我们希望这些实验能够提醒大家,评估很少孤立地衡量模型——它们同样衡量一组关于API设置、测试框架设计和提示词的、不那么显眼的选择。这并非我们第一次因公共基准测试得分低而感到惊讶,随后发现评估程序使用了丢弃推理消息的通用测试框架。
如果你是一位努力最大化性能的API开发者,我们建议使用与我们在自身产品中部署相同的设置:
- 使用我们的Responses API,而不是旧的Chat Completions API
- 保留推理过程
- 使用压缩
如果你正在比较模型,我们建议依赖使用了上述设置的评估,因为这些设置最贴近ChatGPT和Codex中的实际使用场景。
我们感谢ARC多年来在AGI评估方面的创造性工作,以及他们的分析启发我们在这里进行更深入的审视。
相似文章
启用两项设置使我们的ARC-AGI-3基准测试得分提高了三倍
OpenAI发现,在API工具中启用保留推理和压缩设置,使GPT-5.6 Sol在ARC-AGI-3基准测试中的得分提高了三倍,同时将输出令牌减少了6倍,表明基准测试性能在很大程度上受工具设计影响。
@OpenAI:GPT-5.6 Sol 已被用于解决数学中的开放性问题。那为什么它在 ARC-AGI-3,一个基准测试中…
GPT-5.6 Sol,一个解决了开放数学问题的模型,最初由于测试框架的内存限制在 ARC-AGI-3 基准测试中表现不佳。启用两个 API 设置后,分数翻了三倍,输出令牌数减少了六倍。
GPT-5.6 系列 (2分钟阅读)
OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。
@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…
OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。