Artificial Analysis "Intelligence": 一个毫无意义的基准测试

Reddit r/LocalLLaMA 新闻

摘要

本文批评了Artificial Analysis Intelligence Index作为一个毫无意义的基准,质疑其在比较像Qwen 27B这样的LLM与更大模型如GPT-5.2和Opus 4.6时的有效性。

https://preview.redd.it/84zi5nsdawkh1.png?width=2368&format=png&auto=webp&s=1109e69db807b153064b1f5b61d22cf1e9fbca05 今天另一个用户发布了Qwen 3.8 27B的基准测试,虽然我认为Qwen 27B是一个非常强大的模型,但我忍不住注意到这些Artificial Analysis基准测试是多么毫无意义,我质疑为什么人们还在发布这些垃圾内容并把AA分数当作比较LLM的某种圣经。根据他们的“智能指数”,一个27B模型现在击败了DeepSeek v4 Flash和Pro、Kimi 2.7 Code、GPT-5.2、Opus 4.6以及Sonnet 5。在某些时候,我们必须问:这个指标到底在测量什么?因为无论“智能”对AA及其企业VC/记者/普通受众意味着什么,它绝对不是我们在这里应该使用的定义。Qwen 27B令人惊叹,在单个GPU上可运行的模型中明显独树一帜,但每当我看到像这样的帖子,将Qwen 27B等同于“基本上在笔记本电脑上运行三个月前的Opus”,我都会忍不住翻白眼。我理解用一个整数来概括模型的能力很困难,我知道我们喜欢我们的本地模型,但是时候停止发布AA的明显垃圾基准测试,并假装它证明了某个观点了。
查看原文

相似文章

我对 Artificial Analysis 的“智能指数”的不满

Reddit r/LocalLLaMA

这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。

GLM5.3 Artificial Analysis 基准测试

Reddit r/LocalLLaMA

本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。

Artificial Analysis 的 GPT 5.6 系列基准测试

Reddit r/singularity

Artificial Analysis 的基准测试显示,OpenAI 的 GPT-5.6 Sol 在智能方面几乎与 Claude Fable 5 相当,但成本仅为后者的三分之一;在编程智能体评测中领先;并引入了缓存写入定价。