Opus 5 目前在人工智能分析智能排行榜上排名第一
摘要
Opus 5 已荣登 Artificial Analysis Intelligence Leaderboard 榜首,该排行榜通过多个基准测试评估AI模型,包括 Artificial Analysis Intelligence Index 和 AA-Briefcase。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 23:04
# 跨智能、性能和价格的AI模型比较
来源:https://artificialanalysis.ai/models
## 智能
### Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 整合了9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR
推理模型由灯泡图标标识
Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。
### 按开放权重/专有划分的 Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index v4.1 整合了9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR
推理模型由灯泡图标标识
Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。
表示模型权重是否可用。若权重可用但商业用途受限(通常需要购买付费许可证),模型将被标注为“商业用途受限”。
### 智能评估
由 Artificial Analysis 独立测量的智能评估 · 数值越高越好
代理业务运营
推理模型由灯泡图标标识
虽然模型智能通常适用于各种用例,但某些评估可能对特定用例更为相关。
Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。
## AA-Briefcase
### AA-Briefcase Elo
AA-Briefcase 是 Artificial Analysis 开发的一项代理知识工作基准测试。AA-Briefcase Elo 是一项综合指标,聚合了评分标准通过率、分析质量 Elo 和演示 Elo · 数值越高越好
推理模型由灯泡图标标识
AA-Briefcase Elo 是一项综合指标,聚合了分析质量 Elo、演示 Elo 和评分标准通过率,并通过合成对局将评分标准表现转换为 Elo。Elo 及 95% 置信区间边界限制为 0。
## AA-Omniscience
### AA-Omniscience Index
AA-Omniscience Index(越高越好)衡量知识可靠性与幻觉情况。它对正确回答给予奖励,对幻觉行为进行惩罚,并且对拒绝回答不设惩罚。得分范围从 -100 到 100,其中 0 表示正确与错误回答数量相当,负分表示错误回答多于正确回答。
推理模型由灯泡图标标识
AA-Omniscience Index(越高越好)衡量知识可靠性与幻觉情况。它对正确回答给予奖励,对幻觉行为进行惩罚,并且对拒绝回答不设惩罚。得分范围从 -100 到 100,其中 0 表示正确与错误回答数量相当,负分表示错误回答多于正确回答。
## 开放性
### Artificial Analysis Openness Index:分数
Openness Index 在 0 到 100 的归一化尺度上评估模型开放性(数值越高越开放)
推理模型由灯泡图标标识
## 智能指数对比
### 智能指数 vs. 每智能指数任务成本
Artificial Analysis Intelligence Index · 每项 Artificial Analysis Intelligence Index 任务的加权平均成本(美元)
推理模型由灯泡图标标识
每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答 Token 价格计算,除以任务数量,并按其智能指数权重加权。
Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。
## Token使用
### 每智能指数任务的输出 Token 数量
运行 Artificial Analysis Intelligence Index 中一项任务所使用的加权平均输出 Token 数
推理模型由灯泡图标标识
每项智能指数任务所需的 Token 数量。计算方法为:将每个评估的输出 Token 数乘以智能指数中各基准测试的相对权重,然后除以任务数量(不包括重复)。
## 价格与成本
### 每智能指数任务成本
每项 Artificial Analysis Intelligence Index 任务的加权平均成本(美元),按 Token 类型细分。越低越好
推理模型由灯泡图标标识
每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答 Token 价格计算,除以任务数量,并按其智能指数权重加权。
### 运行 Artificial Analysis Intelligence Index 的成本
运行 Artificial Analysis Intelligence Index 中所有评估的成本(美元)
推理模型由灯泡图标标识
运行 Artificial Analysis Intelligence Index 中评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答 Token 价格以及跨评估使用的 Token 数量(不包括重复)计算。
### 定价:缓存命中、输入和输出
价格(每百万 Token 的美元数)
推理模型由灯泡图标标识
缓存提示(先前处理过)的每 Token 价格,通常比常规输入价格有显著折扣,以每百万Token的美元表示。此处显示的值为缓存命中价格;缓存写入和缓存存储按提供商单独计费——详情请参阅“各提供商的缓存定价”。
请求/消息中发送到 API 的每 Token 价格,以每百万 Token 的美元表示。
此处显示的混合缓存价格仅使用缓存命中价格。其他缓存成本因提供商而异:
- Anthropic:收取单独的缓存写入费用,5 分钟和 1 小时 TTL 的费率不同(1 小时 TTL 更贵)。
- Google (Vertex/Gemini):除缓存命中定价外,还收取按小时计费的缓存存储费用。部分提供商还对超过 200K Token 的提示采用分层定价。
- OpenAI、DeepSeek 等:通常仅收取缓存命中定价,不收取写入或存储费用。
请参阅提示缓存 (https://artificialanalysis.ai/models/caching) 获取完整细分说明。
模型生成的每 Token 价格(从 API 接收),以每百万 Token 的美元表示。
数据展示了模型自有 API(例如 OpenAI 的 o1)的性能表现,或在没有自有 API 的情况下(例如 Meta 的 Llama 模型)跨提供商的中位数表现。
## 上下文窗口
### 上下文窗口
上下文窗口:Token 限制 · 越高越好
推理模型由灯泡图标标识
更大的上下文窗口与 RAG(检索增强生成)LLM 工作流相关,这些工作流通常涉及大量数据的推理和信息检索。
输入和输出 Token 的最大数量。输出 Token 通常有显著更低的上限(因模型而异)。
## 速度
按输出速度(每秒 Token 数)衡量
### 输出速度
每秒输出 Token 数 · 越高越好
推理模型由灯泡图标标识
模型生成 Token 时每秒接收的 Token 数(即对于支持流传输的模型,从 API 接收到第一个数据块后开始)。
数据展示了模型自有 API(例如 OpenAI 的 o1)的性能表现,或在没有自有 API 的情况下(例如 Meta 的 Llama 模型)跨提供商的中位数表现。
### 每智能指数任务耗时
每项任务的加权平均解码时间(分钟);不包括 TTFT 和开销时间 · 越低越好
推理模型由灯泡图标标识
每项 Artificial Analysis Intelligence Index 任务的加权平均时间(秒)。计算方法为:将每项任务的输出 Token 数除以输出速度,并按智能指数中各基准测试的相对权重加权。
## 延迟
按首 Token 时间(秒)衡量
### 延迟:首回答 Token 时间
收到首回答 Token 的秒数 · 包含推理模型的“思考”时间
推理模型由灯泡图标标识
API 请求发送后收到首回答 Token 的时间(秒)。对于推理模型,这包括模型在提供答案之前的“思考”时间。对于不支持流传输的模型,这代表接收完整输出的时间。
## 端到端响应时间
基于首 Token 时间、推理模型“思考”时间和输出速度计算的输出 500 个 Token 的秒数
### 端到端响应时间
输出 500 个 Token 的秒数,包含推理模型的“思考”时间 · 越低越好
推理模型由灯泡图标标识
接收 500 Token 响应的秒数。关键组成部分:
- 输入时间:接收首个响应 Token 的时间
- 思考时间(仅限推理模型):推理模型在提供答案之前输出 Token 进行推理所花费的时间。Token 数量基于一组多样化的 60 个提示的平均推理 Token(方法论细节 (https://artificialanalysis.ai/methodology/performance-benchmarking))。
- 回答时间:基于输出速度生成 500 个输出 Token 的时间
数据展示了模型自有 API(例如 OpenAI 的 o1)的性能表现,或在没有自有 API 的情况下(例如 Meta 的 Llama 模型)跨提供商的中位数表现。
## 模型大小(仅开放权重模型)
### 模型大小:总参数量与活跃参数量
模型总参数量与推理期间活跃参数量的对比
推理模型由灯泡图标标识
模型中可训练权重和偏差的总数,以十亿为单位。这些参数在训练期间学习,决定了模型处理和生成响应的能力。
每次推理前向传播期间实际执行的参数数量,以十亿为单位。对于混合专家(MoE)模型,路由机制为每个 Token 选择一部分专家,导致活跃参数少于总参数。密集模型使用所有参数,因此活跃参数等于总参数。
相似文章
Opus 5 在 Simple Bench 上获得第二名
Opus 5 在 Simple Bench 基准测试中取得第二名,凸显了其在 AI 模型中的竞争力。
Opus 5 在 IMO 中获得满分
Opus 5 是一款人工智能模型,在国际数学奥林匹克竞赛中取得了满分,展现了先进的数学推理能力。
Opus 5 在 ARC AGI 基准测试中取得了最高分
Opus 5 在 ARC AGI 基准测试中获得了高分,表明其具有先进的推理能力。
Opus 5 基准测试 (ARC-AGI3 上达到 30.2%!!!)
Opus 5 在 ARC-AGI3 基准测试中达到 30.2%,标志着显著的性能提升。
据可靠推特爆料者称,Opus 5 可能最快本周推出
据可靠推特爆料者称,Opus 5 可能最快本周发布,引发关于重大AI模型更新的猜测。