OpenAI的AGI高分源于测试框架而非模型本身(6分钟阅读)

TLDR AI 新闻

摘要

OpenAI声称GPT-6 Astra在AGI基准测试中取得99.9%的高分,实则依赖特定测试框架(Provider Adapter)达成;若使用标准框架测试,得分仅为62.7%。此举暴露出AI模型评估与基准测试透明度存在重大问题。

OpenAI曾宣称凭借在ARC-AGI-3基准测试中获得99.9%的高分实现了AGI。然而,使用该基准测试自身软件运行同一模型时,得分仅为62.7%。差距源自OpenAI围绕模型构建的外层软件——正是其智能体外层组件的差异设计,助力达成了此前的惊人成绩。
查看原文
查看缓存全文

缓存时间: 2026/09/07 23:52

# Astra的AGI分数源自测试框架而非模型本身 来源:https://thenextweb.com/news/openai-astra-arc-agi-3-harness-62-7-vs-99-9-benchmark-revisions OpenAI凭借99.9%的高分宣告AGI时代来临,但若使用该基准测试自身的标准软件运行同一模型,其得分仅为62.7%。 这并非四舍五入的误差或竞争对手的质疑——该差异来自测试工具开发机构自身。ARC奖项在GPT-6 Astra发布当日公布了两组数据(https://arcprize.org/blog/astra),完整列出了所有推理层级下的测试结果。 差异源于“测试框架”。测试框架是模型外围的软件系统,决定模型可调用的工具、请求间记忆保留方式以及上下文管理机制。相同权重参数搭配不同框架结构,将产生不同分数。 ## 表格数据的实际含义 ARC奖项以两种方式运行了Astra测试: - 标准框架为所有模型提供统一的最小化接口,允许模型自主决定需保留的推理记录 - OpenAI的提供者适配器则保留模型的不透明推理状态,并压缩长对话内容 在标准框架最大推理设置下,Astra得分为62.7%,耗费26,098美元;在提供者适配器高推理设置下,Astra获得99.9%高分且仅花费18,817美元。更优成绩反而对应更低的测试成本。 某组数据比任何论辩都更具说服力:在OpenAI适配器中将推理强度设为“无”时,Astra仍能获得96.7%分数。这比标准框架下同模型的最高推理表现高出34个百分点——框架结构的提升效果完全超越了推理强度的调节。 两种框架均解决了167组游戏推理任务。ARC奖项统计显示,使用适配器运行时消耗的令牌数量减少49%,速度提升约3.66倍。 ## 广泛流传的数字 99.9%与GPT-5.6 Sol的7.8%形成鲜明对比而被广泛传播。但二者并非使用相同测试条件:Astra的99.9%来自提供者适配器,Sol的7.8%出自标准框架。 这种对比报道曾广泛流传,包括TNW在首发报道中直接引用99.9%对比7.8%的数据(https://thenextweb.com/news/gpt-6-astra-benchmarks-monitorability-cyber),未说明框架差异。后续关于AGI主张的追踪报道(https://thenextweb.com/news/openai-astra-agi-claim-cybersecurity-containment)也基于相同前提描述了人类水平表现。 实际上同框架对比应为62.7%对7.8%——这依然是巨大的性能飞跃,也是基准测试所支持的数据对比。 ARC奖项本身否定了OpenAI的结论,明确表示“不主张这已是AGI”。联合创始人Mike Knoop撰文指出“目前缺乏认定其为AGI的证据”。未来基金会将并列公布两种框架的测试结果。 值得注意的是,François Chollet在文中给出的标准框架分数为66%,与发布表格中的62.7%存在出入。博客原文作为主要记录应以此为准。 ## 数据的后续变动 《财富》杂志发现发布后分数持续变化。Emily Forlini对比存档快照(https://fortune.com/2026/09/04/openai-quietly-boosts-some-of-astras-evaluation-metrics-amid-rare-delay-in-publication-of-the-modeblog-post-announcement/)发现五项指标被修改: - Astra的幻觉率首次快照为4.2%,下午5:20降至2%,后又恢复为4.2% - Anthropic的Fable 5.1在FrontierMath基准中从87.8%降至78%,后稳定在83% - Sol在ExploitBench的得分从5.5%翻倍至11.5%,OpenAI表示正调查是否回滚该数据,因11.5%反映的推理层级在商业版中未提供 发送给媒体的预发布草案显示ARC-AGI-3分数为98.6%,而最终发布版本显示为99.99%。 并非所有修改都对Astra有利:Anthropic在HealthBench Professional的两项评分有所上升。其他媒体独立发现类似问题,The New Stack在次日并列呈现了两种框架数据。但总体修改趋势呈单向性。OpenAI还曾在发布后撤下报告,后重新上传,称无法透露具体原因。 公司告诉《财富》杂志,大多数评估存在几个百分点的自然波动,具体取决于检查点、框架结构和评估运行方式。 ## 斯坦福学者的术语定义 Anka Reuel与Mike Hardy将这种行为称为“基准测试狂刷”,意指在不同条件下重复运行评估直至分数提升。二人分别任职于斯坦福智能系统实验室与可信AI实验室。 他们查阅系统卡片(应记录评估方法的文件)时发现,关于内部幻觉基准测试“几乎没有评估细节”,甚至“未包含测试项目数量”。 并非所有人都认为这是数据操纵。Snorkel AI的Vincent Sunn Chen向《财富》杂志表示,发布前最后几小时分数波动属于常态,检查点、配置、框架和评分机制都可能处于调整状态。他建议建立规范,要求企业在修改已发布数据时说明变更内容。 更严厉的解读存在先例:2025年Meta被指控发布Llama 4结果时使用的是内部构建版本而非公开版本,Yann LeCun后来承认数据确实经过调整。 ## Astra的真实定位 独立分析机构(https://artificialanalysis.ai/articles/benchmarking-gpt-6-astra)的测试呈现更平淡的图景: - 在编码智能体指数中,Astra在Codex获得67分,与Claude Opus 5和Fable 5持平,Fable 5.1以70分领先 - 在智能指数中,Astra得分为61,与前代模型持平,比Fable 5.1和Meta的Muse Spark 1.3低5分 - 价格方面,输入令牌10美元/百万,输出令牌50美元/百万,是Sol定价的2.5倍 实际改进有限但明确:知识基准幻觉率从92%降至51%,长程知识工作提升约80 Elo;但经济加权任务基准出现相近幅度下滑,银行支持、科学Python和长上下文推理等领域出现回退。 该机构后续重建指数体系,次日推出4.2版本,采用更复杂的任务和更多私有测试集,表示此举旨在防止分数操纵。 ## 测试框架已成为产品形态 “测试框架”一词已多次出现: - Booz Allen的AI威胁排行榜因廉价框架(https://thenextweb.com/news/booz-allen-cyber-weapon-index-attack-harness)发生重构 - CrowdStrike同样用该术语描述其为OpenAI(https://thenextweb.com/news/crowdstrike-openai-gpt-5-6-cyber-anthropic-claude-marketplace)网络模型提供的包装服务 Anthropic、Google和微软均已将测试框架作为独立产品销售。Nvidia构建的框架更将Claude Opus 5在ARC-AGI-3的得分从30.2%提升至全关卡通过。 OpenAI在此过程中并未隐瞒任何信息:适配器使用的API功能均公开可调用。但获得99.9%的是整合系统,而对外销售的是独立模型。 这种区分正是问题的核心,同样贯穿于可监控性争议(https://thenextweb.com/news/astra-chain-of-thought-monitorability-debate-greenblatt-pachocki-2025-position-paper-gpai-code-model-report-ai-office)。模型的能力与任何人独立验证其能力的可行性正在逐渐分离,而基准测试正是观察这一差距的窗口。

相似文章

Astra相关误导性基准报告的普遍问题

Reddit r/singularity

OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。

GPT-6 已发布 [N]

Reddit r/MachineLearning

OpenAI 发布了 GPT-6,在没有额外辅助工具的情况下,在 ARC-AGI-3 基准测试中展示了约 60% 的准确率。