Astra相关误导性基准报告的普遍问题
摘要
OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。
OpenAI对Astra在ARC-AGI-3上的基准报告是我最近见过最恶劣的例子之一,技术上真实的指标数据被用来故意误导大众。例如,目前在r/singularity热门页面顶部有一张OpenAI的截图,显示Astra在ARC-AGI-3上达到98.6%,而GPT 5.6 Sol为7.8%,Claude Opus 5为30.2%。天啊,对吧?实现了ASI,对吧?不幸的是,这些孤立的数据忽略了非常重要的背景:Astra的代理测试环境拥有GPT 5.6 Sol和Claude Opus 5所不具备的重要附加功能——特别是推理轨迹保留和自定义压缩(来源:https://arcprize.org/leaderboard)。我的主要结论是:比较Astra与Opus 5/Sol在此基准上表现的最诚实方式应该是:1)在相同的提供商适配器测试环境下测量它们的ARC-AGI-3性能(Astra的98.6%正是由此得出),或者2)在标准ARC-AGI-3测试环境下进行比较。在标准测试环境下,Astra达到62.7%,而Opus 5为30.2%,Sol为7.8%。差距仍然很大,但比OpenAI选择报告的对比要少误导得多。(来源:https://arcprize.org/leaderboard)顺便说一句,我绝不是Anthropic的粉丝。我认为Opus 5是基准测试狂魔,并且每天都祈祷Anthropic衰落。但Astra的基准炒作清楚地表明,人们对其基准的反应需要保持克制(如果Opus 5还没有说服你不要把基准当作圣经的话),尤其是在任何人都还没有时间在实际用例中广泛测试它之前。
相似文章
OpenAI博客上已删除的Astra基准测试
这篇文章讨论了OpenAI在其博客上发布后又删除的Astra系统性能基准,暗示了泄露或未公开的技术数据。
基准测试上25%的差异——只是运行方式的一个错误😬
讨论了ARC-AGI上25%的差异如何由测试框架设置导致,显示GPT-5.6 Sol在正确评估下得分38%,并批评了行业内天真的基准测试报告方式。
关于GPT-6 Astra 98.6% ARC AGI-3:不要轻信炒作
文章警告不要炒作GPT-6 Astra的ARC AGI-3结果,指出Nvidia使用AVO达到了100%的成就,而OpenAI使用了非标准的测试环境。
Arena.ai 可能正在运行迄今为止最欺诈性的基准测试
这篇文章批评 Arena.ai 涉嫌运行不诚实的基准测试,声称其将 GPT 5.5 在编程能力上排在 Meta 的 Muse Spark 之下,并将 Grok Imagine 在视频生成方面排在 Seedance 之上,作者断言这是客观错误的。
Astra不仅在ARC-AGI-3上达到饱和,而且使用的操作比普通人类更少
GPT-6 Astra在ARC-AGI-3基准测试中取得了最先进的分数,使用Provider Adapter接口得到99.9%的分数,并展示了比人类测试员更少的动作。该模型展示了将不熟悉的环境转换为紧凑符号世界模型以实现高效规划的能力。