Astra相关误导性基准报告的普遍问题

Reddit r/singularity 新闻

摘要

OpenAI对Astra在ARC-AGI-3上的基准报告具有误导性,因为它使用了不同的测试环境,并且在标准条件下,性能差距没有那么显著。

OpenAI对Astra在ARC-AGI-3上的基准报告是我最近见过最恶劣的例子之一,技术上真实的指标数据被用来故意误导大众。例如,目前在r/singularity热门页面顶部有一张OpenAI的截图,显示Astra在ARC-AGI-3上达到98.6%,而GPT 5.6 Sol为7.8%,Claude Opus 5为30.2%。天啊,对吧?实现了ASI,对吧?不幸的是,这些孤立的数据忽略了非常重要的背景:Astra的代理测试环境拥有GPT 5.6 Sol和Claude Opus 5所不具备的重要附加功能——特别是推理轨迹保留和自定义压缩(来源:https://arcprize.org/leaderboard)。我的主要结论是:比较Astra与Opus 5/Sol在此基准上表现的最诚实方式应该是:1)在相同的提供商适配器测试环境下测量它们的ARC-AGI-3性能(Astra的98.6%正是由此得出),或者2)在标准ARC-AGI-3测试环境下进行比较。在标准测试环境下,Astra达到62.7%,而Opus 5为30.2%,Sol为7.8%。差距仍然很大,但比OpenAI选择报告的对比要少误导得多。(来源:https://arcprize.org/leaderboard)顺便说一句,我绝不是Anthropic的粉丝。我认为Opus 5是基准测试狂魔,并且每天都祈祷Anthropic衰落。但Astra的基准炒作清楚地表明,人们对其基准的反应需要保持克制(如果Opus 5还没有说服你不要把基准当作圣经的话),尤其是在任何人都还没有时间在实际用例中广泛测试它之前。
查看原文

相似文章

Arena.ai 可能正在运行迄今为止最欺诈性的基准测试

Reddit r/singularity

这篇文章批评 Arena.ai 涉嫌运行不诚实的基准测试,声称其将 GPT 5.5 在编程能力上排在 Meta 的 Muse Spark 之下,并将 Grok Imagine 在视频生成方面排在 Seedance 之上,作者断言这是客观错误的。