Artificial Analysis 更新其 Intelligence Index 至 4.3 版本
摘要
Artificial Analysis 已将其 Intelligence Index 更新至 4.3 版本,新增了 Terminal-Bench v4.0 和 AutomationBench-AA 等基准测试,以更好地评估 AI 模型的性能和成本效率。
暂无内容
查看缓存全文
缓存时间: 2026/09/07 21:08
# 发布人工智能分析智能指数 v4.3
来源:https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3
## 结果
### 人工智能分析智能指数 (https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index)
人工智能分析智能指数 v4\.3 包含10项评估:AA\-Briefcase、GDPval\-AA v2、AutomationBench\-AA、Terminal\-Bench v4\.0、SciCode、Humanity's Last Exam、GDP\.pdf、CritPt、AA\-Omniscience、AA\-LCR v1\.1
人工智能分析智能指数 v4\.3包含:AA\-Briefcase、GDPval\-AA v2、AutomationBench\-AA、Terminal\-Bench v4\.0、SciCode、Humanity's Last Exam、GDP\.pdf、CritPt、AA\-Omniscience、AA\-LCR v1\.1。更多详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括各项评估的详细分解和执行方式。
- **Claude Fable 5\.1 和 GPT\-6 Astra 在智能指数中领先:** Claude Fable 5\.1(最大值带兜底)和 GPT\-6 Astra(最大值)在智能指数 v4\.3 上均获得53分,其次是 Claude Opus 5(最大值,51分)、Claude Fable 5(带兜底,50分)、Muse Spark 1\.3(最大值,48分)和 GPT\-5\.6 Sol(最大值,47分)。
- **GLM\-5\.3 和 Kimi K3 继续领跑开源权重模型:** GLM\-5\.3 Flash(42分)是第三强的开源权重模型,其次是 Qwen3\.8 2\.4T A95B(40分)和 DeepSeek V4 Pro 0813(最大值,36分)。
- **4家实验室占据智能与每任务成本帕累托前沿:** OpenAI 占据了成本效率前沿的大部分区域,其最近发布的 GPT\-6 Astra 的全部五个推理努力级别在各自智能水平上均提供了最低的每任务成本。MiMo\-V2\.5\-Pro(26分)、GLM\-5\.3\-Flash(42分)和 Claude Fable 5\.1(xhigh、最大值、53分)构成了前沿的其余部分。
## 更新日志
升级
### Terminal\-Bench:从 v2\.1 升级到 v4
完成了对最新版本 Terminal\-Bench 的升级。
替换
### τ3\-Banking 被 AutomationBench\-AA 取代
我们实现了 Zapier 的业务工作流自动化基准。
我们持续致力于保持智能指数的实用性,通过提前实施为指数 v5 规划的部分更改。v4\.2 和 v4\.3 中的每一项更改都基于其自身优点,并使指数更接近现实世界的问题解决、增加了更多私有测试集以防止游戏化,并减少了饱和度。
智能指数 v4\.3 提升了代理编码任务的难度,并扩展了测试的代理工作流类型。由于我们与 Zapier 合作为 AutomationBench 使用了保留测试集,因此分配给具有私有任务或答案的评估的权重从 40% 增加到 45%。类别权重与 v4\.2 保持不变:代理 30%、编码 20%、通用 30%、科学推理 20%。
阅读完整的方法论更新日志 (https://artificialanalysis.ai/methodology/intelligence-benchmarking#version-history)
## 评估更新
### Terminal\-Bench v4\.0
**我们正在从 Terminal\-Bench v2\.1 升级到 v4\.0,其包含来自终端的更难任务。** Terminal\-Bench v4\.0 测试代理是否能通过终端在软件、机器学习、科学、运维、安全、硬件和媒体领域完成复杂工作。此次更新重新校准了计算和时间配额,并改进了任务说明、环境和验证方式。我们对所有 66 个任务运行三次,并报告平均 pass@1。
GPT\-6 Astra(最大值)得分 59\.1%,而 Claude Fable 5\.1(最大值带兜底)得分为 52\.0%,Claude Opus 5(最大值)得分为 49\.0%。Astra 比 GPT\-5\.6 Sol(最大值)高出 19\.2 个百分点,后者得分为 39\.9%。
评估详情 (https://artificialanalysis.ai/evaluations/terminalbench-v4-0)### Terminal\-Bench v4\.0:得分
由人工智能分析独立基准测试
### AutomationBench\-AA
**我们用 AutomationBench\-AA 替换了 τ3\-Banking,后者涵盖更广泛的应用程序业务工作流。**
与 Zapier 合作,我们运行了包含 657 个任务的保留测试集,使用的是该基准的 v1\.0\.6 版本。我们将其实施称为 AutomationBench\-AA,因为我们为完成的目标提供了部分分数,任何护栏违规都会将该任务的分数降至零。
其 657 个任务涵盖财务、人力资源、市场营销、运营、销售和支持。代理在模拟的业务应用程序中工作,并发现相关的 API 以完成每项任务。对于每个任务,我们衡量完成目标的比例。任何护栏违规都会给该任务零分。'得分' 是这 657 个工作流的平均任务分数,也是智能指数中使用的指标。'完成的任务数' 单独报告了在没有护栏违规的情况下每个目标都已完成的工作流比例。
GPT\-6 Astra(最大值)得分 68\.5%,而 Grok 4\.6(高)得分为 66\.7%,GLM\-5\.3(最大值)得分为 62\.2%。Astra(最大值)在 41\.6% 的工作流中完成了所有目标且无护栏违规,而 Claude Fable 5\.1(最大值带兜底)为 32\.1%,Claude Opus 5(最大值)为 28\.3%。在遵守所有护栏的前提下完成所有目标,比完成部分工作流更难。
评估详情 (https://artificialanalysis.ai/evaluations/automationbench-aa)### AutomationBench\-AA:得分
完成的任务目标比例,且无护栏违规 · 越高越好 · 由 Zapier 开发的基准 · 由人工智能分析独立基准测试
AutomationBench\-AA 报告两个指标。得分是模型完成任务目标的比例,其中任何发生护栏违规的任务得分为零。完成的任务数是完全完成任务的比例,满足所有目标且无护栏违规。两者均是越高越好。
## 成本
**相似的智能指数得分可能对应截然不同的成本。** GPT\-6 Astra(最大值)和 Claude Fable 5\.1(最大值带兜底)均获得 53 分,但它们的智能指数每任务平均成本分别为 \$3\.26 和 \$7\.63 - Astra 的成本低 57%。
GLM\-5\.3\-Flash 和 GPT\-5\.6 Terra(最大值)在智能指数上均得 42 分,但 GLM\-5\.3\-Flash 每任务成本仅为前者的 18%(\$0\.25 对比 \$1\.40)。在更低的价格点上,GPT\-5\.6 Luna(最大值)得分为 38,每任务成本为 \$0\.18。
### 智能指数 vs\. 每智能指数任务成本
人工智能分析智能指数 · 人工智能分析智能指数任务的加权平均成本(美元)
每智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答代币价格计算,除以任务数,并按其在智能指数中的权重加权。
人工智能分析智能指数 v4\.3包含:AA\-Briefcase、GDPval\-AA v2、AutomationBench\-AA、Terminal\-Bench v4\.0、SciCode、Humanity's Last Exam、GDP\.pdf、CritPt、AA\-Omniscience、AA\-LCR v1\.1。更多详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括各项评估的详细分解和执行方式。
## 完整结果与方法论
**总分反映了不同的优势领域。** Claude Fable 5\.1 在 AA\-Briefcase 和 SciCode 上得分更高,而 GPT\-6 Astra 在 Terminal\-Bench v4\.0 和 AutomationBench\-AA 得分上更高。
类别对智能指数的贡献保持不变:代理 30%、编码 20%、通用 30%、科学推理 20%。Terminal\-Bench 4\.0 保持与 Terminal\-Bench 2\.1 相同的权重,AutomationBench\-AA 以 5% 的权重替代了 τ3\-Banking。
具有私有问题或答案的评估在智能指数 v4\.3 中的权重占比为 45%,高于 v4\.2 的 40%。
智能指数 v4\.3 - 评估、私有测试集和权重类别评估私有测试集权重代理30%AA\-Briefcase是15%GDPval\-AA v2否10%AutomationBench\-AA(指数新增)是5%编码20%Terminal\-Bench v4\.0(指数新增)否10%SciCode否10%通用30%AA\-Omniscience \- 准确性是10%AA\-Omniscience \- 非幻觉是5%GDP\.pdf否10%AA\-LCR v1\.1否5%科学推理20%HLE (Humanity’s Last Exam)否10%CritPt是10%总计100%
相似文章
Artificial Analysis "Intelligence": 一个毫无意义的基准测试
本文批评了Artificial Analysis Intelligence Index作为一个毫无意义的基准,质疑其在比较像Qwen 27B这样的LLM与更大模型如GPT-5.2和Opus 4.6时的有效性。
我对 Artificial Analysis 的“智能指数”的不满
这篇文章批评了 Artificial Analysis 的智能指数,声称突然的 v4.1.1 更新重新调整了指标权重,使开源模型 Qwen 3.8 Max 的排名降至 Anthropic 的 Claude Opus 之下,暗示存在偏见或赞助商影响。
GLM5.3 Artificial Analysis 基准测试
本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。
新基准测试发布
一个新基准测试已发布,可能用于评估AI或软件性能。
人工智能指数报告2026
第九版人工智能指数报告分析了AI进步与社会准备之间的差距,新增了对推理、安全、经济价值、劳动力影响的评估,并设有专门章节讨论AI在科学与医学中的应用。