Artificial Analysis "Intelligence": 一个毫无意义的基准测试
摘要
本文批评了Artificial Analysis Intelligence Index作为一个毫无意义的基准,质疑其在比较像Qwen 27B这样的LLM与更大模型如GPT-5.2和Opus 4.6时的有效性。
https://preview.redd.it/84zi5nsdawkh1.png?width=2368&format=png&auto=webp&s=1109e69db807b153064b1f5b61d22cf1e9fbca05 今天另一个用户发布了Qwen 3.8 27B的基准测试,虽然我认为Qwen 27B是一个非常强大的模型,但我忍不住注意到这些Artificial Analysis基准测试是多么毫无意义,我质疑为什么人们还在发布这些垃圾内容并把AA分数当作比较LLM的某种圣经。根据他们的“智能指数”,一个27B模型现在击败了DeepSeek v4 Flash和Pro、Kimi 2.7 Code、GPT-5.2、Opus 4.6以及Sonnet 5。在某些时候,我们必须问:这个指标到底在测量什么?因为无论“智能”对AA及其企业VC/记者/普通受众意味着什么,它绝对不是我们在这里应该使用的定义。Qwen 27B令人惊叹,在单个GPU上可运行的模型中明显独树一帜,但每当我看到像这样的帖子,将Qwen 27B等同于“基本上在笔记本电脑上运行三个月前的Opus”,我都会忍不住翻白眼。我理解用一个整数来概括模型的能力很困难,我知道我们喜欢我们的本地模型,但是时候停止发布AA的明显垃圾基准测试,并假装它证明了某个观点了。
相似文章
我对 Artificial Analysis 的“智能指数”的不满
这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。
Artificial Analysis 更新其 Intelligence Index 至 4.3 版本
Artificial Analysis 已将其 Intelligence Index 更新至 4.3 版本,新增了 Terminal-Bench v4.0 和 AutomationBench-AA 等基准测试,以更好地评估 AI 模型的性能和成本效率。
GLM5.3 Artificial Analysis 基准测试
本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。
为什么 artificialanalysis.ai 在 SciCode 上将 Gemma4 排在 Qwen3.6 27b 之上
关于 Artificial Analysis 如何在 SciCode 基准测试中将 Gemma 4 排在 Qwen3.6 27b 之上的讨论,质疑该排名是否反映现实世界的编码能力,还是揭示了基准测试的问题。
Artificial Analysis 的 GPT 5.6 系列基准测试
Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。