一个AI在一项测试中得了1753分,而'人类专家'是1000分。这就是为什么我不完全信任这个数字
摘要
文章批评了一个病毒式传播的AI基准测试,该测试声称Grok 4.6得分为1753,而人类专家为1000。文章指出,该测试基于AI输出之间的偏好比较,而非客观正确性,因此外观精美的工作可能会获胜,但未必真正更好。
我一直在看到这种新的基准测试对比(Grok 4.6、Grok 4.5、GPT-5.6、Fable 5),这种数字天生就是为了病毒式传播而设计的。这个测试基本上就是“给AI真实的工作去做,写文档、电子表格、演示文稿,然后以人类专家产出的基线来打分。”人类专家大约在1000分左右。Grok 4.6得了1753分。从纸面上看,这就像“AI现在远远超过人类专业人士。”但问题是,没有一家大型AI公司提到这一点:这个测试并不是根据对错答案来评分的。它的运作方式是,将两个AI的输出并排比较,然后由评分者选择哪个“看起来更好。”没有客观真相,只是在两份作品之间进行偏好投票。如果你以前关注过AI聊天机器人排行榜,这个设置应该会让你觉得眼熟,因为那些排行榜也是同样的运作方式,而人们已经不完全信任它们了。基于偏好的评分倾向于奖励那些看起来精致、自信、格式良好的东西,而不一定是真正正确或有用的东西。一个格式干净、语气非常自信的幻灯片,可能会打败一个更凌乱但更准确的作品,即使准确的那份是更好的作品。所以1753分可能确实意味着“能生成非常专业的输出”,但并不自动意味着“比人类专家做得更好。”这并不意味着这个数字是假的,或者模型不令人印象深刻——它显然令人印象深刻。只是意味着,我会对这类测试中“AI击败人类专家”的标题持保留态度,直到它用真正有正确答案的东西来检验,而不仅仅是两个AI之间的选美比赛。我很好奇,是否真的有人把这些模型用于实际交付式的工作,能说出输出是否经得起考验,还是只是非常擅长看起来已完成。
相似文章
@BenjaminDEKR: 很多人表现得好像 Grok 4.6 刚刚击败了 Anthropic 和 OpenAI,但实际上并没有。Grok 4.6 的数字显示…
对 Grok 4.6 基准测试结果的评论,认为 xAI 并未击败 Anthropic 或 OpenAI,但仍在中上游区间保持竞争力。
SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61
SpaceXAI的Grok 4.6在Artificial Analysis Intelligence Index中得分61,与GPT-5.6 Sol和Claude模型一起跻身前沿,以较低成本展现出强大的智能体性能。
Arena.ai 可能正在运行迄今为止最欺诈性的基准测试
这篇文章批评 Arena.ai 涉嫌运行不诚实的基准测试,声称其将 GPT 5.5 在编程能力上排在 Meta 的 Muse Spark 之下,并将 Grok Imagine 在视频生成方面排在 Seedance 之上,作者断言这是客观错误的。
还有人觉得AI基准测试在预测实际性能方面越来越没用了吗?
本文讨论了AI基准测试高分与实际真实表现之间日益扩大的差距,重点强调了诸如一致性、延迟和上下文处理等问题。
SpaceXAI的Grok 4.5在人工智能分析智能指数中得分54,位列第四
SpaceXAI的Grok 4.5在人工智能分析智能指数上获得54分,排名第四。