GPT-6 Astra的99.9% ARC-AGI-3得分实际测量了什么
摘要
本文分析了GPT-6 Astra在ARC-AGI-3基准测试中99.9%的得分,揭示了该得分因测试工具不同而变化,并在基准测试创建者澄清的同时,质疑了OpenAI对AGI的解释。
暂无内容
查看缓存全文
缓存时间: 2026/09/17 19:48
# GPT-6 Astra 的 ARC-AGI-3 得分解析 | Srutio Social
来源:https://srutiosocial.com/gpt-6-astra-arc-agi-3-score-explained/
OpenAI 称之为 AGI 时代的到来。本月,GPT-6 Astra 的 ARC-AGI-3 得分正通过各大头条新闻印证这一主张,而构建该基准测试的组织却不愿为 OpenAI 从中得出的结论背书。这个差距并非四舍五入的误差,也非竞争对手的抱怨。它已被记录在案,白纸黑字,就在基准测试自身发布的表格中,记录者正是那些职业声誉取决于该表格意义的人们。
相同的权重,不同的框架,不同的分数。这一句话概括了整个故事,在深入了解细节之前值得细品,因为几乎没有任何分享 99.9% 这个数字的人曾花哪怕这么一点时间思考它。
### 同一个模型,两个截然不同的分数
ARC Prize 是 ARC-AGI-3 背后的非营利组织,他们两次将 Astra 投入其基准测试,并于 2026 年 9 月 3 日发布日公布了两项结果。在 ARC Prize 自身的 **Standard 框架**下(该软件包装器为每个模型提供相同的最小接口,并强制其自主决定在移动步骤间保留哪些信息),Astra 在最大推理设置下得分为 62.7%,计算成本为 26,098 美元。而在 **OpenAI 自家的 Provider Adapter 框架**下(该框架保留了模型在请求间的私有推理状态,并自动压缩更长的对话),同一个模型得分高达 99.9%,成本为 18,817 美元。更高的分数对应更低的成本,这说明该适配器不仅对模型更“友好”,它还承担了 Standard 框架所省略的实质性工作。
一个额外的数字让这一点比任何论证都更具说服力。将 Provider Adapter 的推理努力程度设置为最低档 **none**,Astra 仍然得分 96.7%。这比该模型在 Standard 框架下以最大推理设置取得的自身最佳成绩还高出 34 个百分点。本应控制模型思考强度的旋钮几乎未对结果产生影响,而包裹它的包装器本身却让结果提升了超过 30 个百分点。
在两个框架都解决的 167 个游戏推理对中,Provider Adapter 的运行速度快了约 3.66 倍,并且使用了少 49% 的 token。这些都不是秘密。ARC Prize 在发布当天就打印了一张完整的表格,列出了他们测试的每一个推理水平。那个传遍全网的数字是 99.9% 对比 GPT-5.6 Sol 的 7.8%,而这两次得分从未在相同条件下进行:Astra 的结果来自适配器,Sol 的来自 Standard 框架。将同类进行对比,差距是 62.7% 对 7.8%,这仍然是一个巨大的飞跃,也是 ARC Prize 真正会为之辩护的那个飞跃。
即便是基准测试自身的人员,对于“诚实”的数字也存在分歧。联合创始人 François Chollet 发帖称 Astra 在 Standard 框架下得分为 66%。但公布的表格显示为 62.7%。据称在 9 月 2 日提交给 ARC Prize 的另一份结果显示表中,适配器得分为 99.95%,而非 99.9%。OpenAI 自己的发布帖则显示为 99.99%。四个来源,其中三个属于同两家组织,却没有一个能精确匹配到小数点后第二位。老实说,如果一个据称能证明朝通用智能迈进的数字,在从一个文档复制到另一个文档时都无法保持一致,那么值得暂停思考的时间就远比数字本身更长了。
ARC Prize 自己的结论比 OpenAI 图表中的任何内容都更直白。该基金会直接表示,它并未宣称 Astra 已经达到 AGI,联合创始人 Mike Knoop 写道:“我们目前还缺乏证据称其为 AGI。”展望未来,ARC Prize 将并列公布每个模型的两项框架结果。这是科学仪器在发现人们误读它时所做的修正。这不是营销主张所能承受的修正。
### 一个发布后仍在变动的数字
OpenAI 的发布帖原定于 9 月 3 日美国东部时间下午 2:00 上线。但通过一个返回错误的推文链接,它将近两个小时后才完全加载,公司声明将其归咎于技术故障。OpenAI 随后撤下了已发布的帖子并重新发布,且拒绝说明原因。
ARC Prize 还披露了其为比较目的支付给人类测试受试者的报酬,这是一个与这一切无关的细节:90 分钟的会话支付 115 美元,每完成一个游戏额外支付 5 美元,这大约相当于在获得奖金前,每尝试一个游戏支付 12.78 美元。这出奇地接近美国大多数城市外卖应用每次配送的报酬,这要么是巧合,要么标志着零工经济定价已成为任何尚未找到价值衡量标准的任务的默认单位,基准测试亦然。《财富》杂志记者 Emily Forlini 几乎是唯一费心做这件事的人:她对比了页面在加载过程中自动存档的快照。等到有人注意到数字已经改变时,最初的截图已经深入三个群聊,无法追溯。在第一次快照和第六次快照之间,五项指标发生了变化。Astra 声称的幻觉率在前五次快照中为 4.2%,然后在第六次快照中降至 2%,第六次快照拍摄于下午 5:20,大约比 OpenAI 带着最终版本的官方推文早十分钟。根据《财富》的报道,该数字又恢复为 4.2%。GPT-5.6 Sol 的幻觉数字也经历了同样的变化,从 12.2% 降至 9.4%,然后又返回。Sol 在一次内部网络安全评估 ExploitBench 上的得分大致翻了一番,从 5.5% 升至 11.5%,OpenAI 告诉《财富》正在调查将此项变更回退的可能性,因为较高的数字反映了一个 Sol 并未真正提供给付费客户的推理层级。并非所有的编辑都对 OpenAI 有利。Anthropic 自身在 HealthBench Professional 上的两项分数在同一时间段内上升,而 Anthropic 的 Fable 5.1 在 FrontierMath 上的得分则从 87.8% 骤降至 78%,然后稳定在 83%。
OpenAI 的一位发言人告诉《财富》,公司非常重视评估的正确性,大多数评估都会带有几个百分点的噪声,具体取决于检查点、框架和评估运行。这是事实,但这也是一种几乎无法解释为何噪声在首次被审视时总是落在同一方向的真实陈述。
斯坦福大学的两位研究人员,智能系统实验室的 Anka Reuel 和可信 AI 实验室的 Mike Hardy,对此有一个术语:**benchmaxxing**,即在不断变化的条件下反复运行评估,直到数字改善的做法。他们本想在理应记录评估确切进行方式的唯一地方——Astra 自己的系统卡——寻找细节,却几乎找不到关于内部幻觉测试的任何细节。它甚至没有列出测试包含多少项。一张精确到小数点后两位数字的发布图表,背后却没有一份技术文档能说明它实际问了多少问题,这不是任何需要统计学家才能发现的矛盾。
### 这以前发生过,所有人都记得结局如何
Meta 在 2025 年 4 月上演了完全相同的一幕,其后果如今已是公开记录,而非猜测。LMArena 是 Meta 用来推广 Llama 4 的众包基准测试,在发布几天内就更新了自己的政策,具体原因正如该平台所言,Meta 对提交规则的解释与平台对模型提供商的期望不符。Meta 实际提交测试的是一个特别调优的聊天变体,而非任何人都能下载并运行的版本。
随之而来的是长达九个月的否认。然后,在 2026 年 1 月接受《金融时报》采访时,即将卸任 Meta 首席 AI 科学家的 Yann LeCun 直接证实了这一点:结果“被稍微调整了一下”。他的团队测试了同一个模型的不同版本在不同基准测试上的表现,并报告了在每个测试中得分最高的版本,汇集成一张没有任何单一模型实际产出的表格。马克·扎克伯格对发布背后整个团队失去了信心,并将其边缘化。Meta 在 Scale AI 49% 的股权上花费了 143 亿至 150 亿美元,并任命 Scale 的 CEO Alexandr Wang 来运营新的 Meta 超级智能实验室。丑闻曝光大约一年后,负责此次数据调整的 AI 负责人 Ahmad Al-Dahle 离职,转而担任 Airbnb 的 CTO。
这就是当一个发布数字与真相之间的差距被内部人士证实时会发生的事情。它导致一个部门被裁撤、数个职业生涯终结,以及数十亿美元的恐慌性收购。硅谷称这种余波为“领导层重组”。所有经历过它的人都称之为“被抓现行”。
这一切并不意味着 Astra 的数字像 Llama 4 的那样是伪造的。OpenAI 没有人证实为在不同测试中取得好成绩而选择不同的模型检查点,并且 OpenAI 使用的适配器是有据可查的,可通过标准 API 调用,并且对任何愿意付费的开发者开放。但这种模式——发布一个干净到无法经受审查的数字,然后在有人核查后悄然调整——如今已成为该行业在十八个月内,至少公开进行过两次,涉及两家不同的实验室,采用两种不同的方法达到的模式。
### 谁真正需要这个数字达到 99.9%
OpenAI 于 2026 年 6 月 8 日向美国证券交易委员会秘密提交了 IPO 文件。该公司表示时间尚未确定,后续报道显示 OpenAI 倾向于在 2027 年上市,而非 2026 年秋季,这使得 Astra 在发布周的时机看起来不像是倒计时某个特定日期,更像是为选定的日期搭建舞台。OpenAI 最近一轮融资(2026 年 3 月)以 1220 亿美元的融资额将公司估值定为 8520 亿美元,由软银和微软领投,一些分析师认为公开上市的目标可能高达一万亿美元。Astra 的 API 定价定为每百万输入 token 10 美元,每百万输出 token 50 美元,这几乎与 Anthropic 的 Fable 5.1 完全一致,这是一项防御性举措,旨在上市前保护利润率,而非通过价格赢得客户。像 99.9% 这样的数字不会改变任何数学计算。它改变的是投资者关系部门在未来两个季度的每次路演演示文稿中可以重复使用的幻灯片,以及公司被潜在股东讲述的故事。
Nvidia 从这个答案中获得的直接利益比任何实验室都大。该公司于 2026 年 2 月向 OpenAI 投资了 300 亿美元,是其迄今为止最大的单笔投资,现在持有这家同时也是其客户的公司约 990 亿美元的股份。Astra 的训练运行充当了 Nvidia 最新一代芯片的参考销售,而黄仁勋承诺交付的额外 40 万张 GPU 代表着 Nvidia 尚未确认的收入。正是黄仁勋,而非 OpenAI 自己的总裁,做出了更强烈的公开声明,称 AGI 已经到来。实际上有公司和待进行 IPO 需要保护的 Greg Brockman 则措辞谨慎。芯片供应商无需如此。
框架本身已成为一条独立的产品线,由那些与 Astra 具体表现好坏无直接利益关系的公司销售。Nvidia 自己的 AVO 框架将 Claude Opus 5(在 ARC-AGI-3 的 Standard 框架下未经辅助得分为 30.2%)一路推到了 100%。AWS 的 Strands 框架让 Opus 5 达到了 99.95%。Anthropic、Google 和微软现在都将此类包装器作为商业产品销售,各有自己的定价。2026 年,一个模型的头条基准分数,告诉你关于模型的信息少于它告诉你的关于哪家供应商被付费来为其“装扮”以应对测试的信息。
所有这一切旁边有一个真正奇怪的注脚。在 OpenAI 发布 Astra 数字的同一天,其首席科学家 Jakub Pachocki 发表了一篇独立的文章,认为没有任何实验室(包括他自己的)能很好地解决对齐和监控问题,以便在不久的将来全速继续扩展,自愿减速应成为行业常规做法。公司网站上的一份文件主张谨慎行事。另一份则实际上宣称,公司刚刚跨入了一个新能力的时代。两者都是同一家组织在同一天下午做出的真实陈述,但几乎没有报道此事的媒体提及它们并列存在。
### 当没人能检查你的作业时,什么变了
独立的追踪机构并未将此解读为任何一方的干净胜利。Artificial Analysis 将 Astra 的智能指数得分定为 61,与其取代的模型持平,并落后于 Meta 的 Muse Spark 1.3 一分,这对于一个围绕“智能”一词发布的发布来说是个尴尬的落点。在该公司的编码代理指数上,Astra 得分为 67,与 Claude Fable 5 持平,但落后于 Fable 5.1 的 70 分。Artificial Analysis 在 Astra 发布的第二天将其整个指数重建至 4.2 版本,增加了更难的任务和更多的私有测试集,专门是为了使这种操纵在未来变得更困难。这次重建本身就是一个承认,即之前的版本迟早会被某人操纵。
加利福尼亚州通过了一项针对根本问题的部分解决方案,纽森州长于 2026 年 9 月 9 日将其签署成为法律。SB 813 及其配套法案 AB 1405 建立了加利福尼亚人工智能标准与安全委员会,该委员会将认证**独立验证组织**,即授权在发布前或后测试前沿模型的外部团体。但关键在于时机:首批此类组织的认证要求直到 2028 年 1 月 1 日才需完成,比 Astra 发布晚了一年多。任何在问题已为所有关注者可见十六个月后才解决问题的法律,并非真正的修复,它只是一个标记,显示机构与其正在制度化的事物相比有多缓慢。而目前唯一可用的独立验证现实案例并不令人鼓舞。METR 对一起无关的 OpenAI 安全事件的调查花费了大约 40 万美元的 API 积分,这些积分由 OpenAI 免费提供,并使用 OpenAI 自己的一个模型来帮助分析 OpenAI 自己的系统。撰写报告的研究人员称其为“垃圾调查”。在唯一一个完全实现的案例中,进行检查的工具、被检查的公司和支付检查费用的公司是同一家公司。
因此,本文开头提出的悖论得到了解决,但并非以 OpenAI 发布图表所期望的方式。99.9% 是真实的。它在真实条件下发生,并非像 Llama 4 的数字那样是伪造的。但它从来不是那个重要的数字,而目前,实验室之外没有人具备足够的地位、资金或期限来可靠地告诉你哪个数字才是重要的。在独立验证组织真正存在且不再依赖被测试公司自身的积分之前,对任何实验室发布日图表的正确反应,与 ARC Prize 自己示范的一样:将条件与分数一同公布,并首先阅读条件。
### 延伸阅读来源
- ARC Prize: "OpenAI's GPT-6 Astra on ARC-AGI-3": https://arcprize.org/blog/astra
- François Chollet (ARC Prize 联合创始人) on X: https://x.com/fchollet/status/2095598451115614371
- Fortune, Emily Forlini: "OpenAI quietly boosts some of Astra’s evaluation metrics, and continues to change others post-launch": https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement/
- The Next Web: "OpenAI’s AGI number came from a harness, not the model": https://thenextweb.com/news/openai-astra-arc-agi-3-harness-62-7-vs-99-9-benchmark-revisions
- Fast Company: "Yann LeCun: Meta ‘fudged’ on Llama 4 testing": https://www.fastcompany.com/91051203/yann-lecun-meta-fudged-llama-4-testing
相似文章
Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。
OpenAI的Astra在同一基准测试中分别取得了62.7%和99.9%的成绩,但我仍然不确定哪个结果更值得信赖
本文探讨了OpenAI的Astra模型在ARC Prize基准测试中的分数不一致性,强调了不同测试框架的差异以及OpenAI发布页面的更改,引发了对评估准确性的担忧。
关于GPT-6 Astra 98.6% ARC AGI-3:不要轻信炒作
文章警告不要炒作GPT-6 Astra的ARC AGI-3结果,指出Nvidia使用AVO达到了100%的成就,而OpenAI使用了非标准的测试环境。
GPT‑6 Astra
OpenAI 发布 GPT‑6 Astra,在安全任务和长上下文处理方面表现出色,在 ARC-AGI 3 上达到 99.9%,尽管在某些基准测试上仍落后于 Claude Fable。
OpenAI的AGI高分源于测试框架而非模型本身(6分钟阅读)
OpenAI声称GPT-6 Astra在AGI基准测试中取得99.9%的高分,实则依赖特定测试框架(Provider Adapter)达成;若使用标准框架测试,得分仅为62.7%。此举暴露出AI模型评估与基准测试透明度存在重大问题。