Opus 5 目前在人工智能分析智能排行榜上排名第一

Hacker News Top 新闻

摘要

Opus 5 已荣登 Artificial Analysis Intelligence Leaderboard 榜首,该排行榜通过多个基准测试评估AI模型,包括 Artificial Analysis Intelligence Index 和 AA-Briefcase。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/24 23:04

# 跨智能、性能和价格的AI模型比较 来源:https://artificialanalysis.ai/models ## 智能 ### Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 整合了9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 推理模型由灯泡图标标识 Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。 ### 按开放权重/专有划分的 Artificial Analysis Intelligence Index Artificial Analysis Intelligence Index v4.1 整合了9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 推理模型由灯泡图标标识 Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。 表示模型权重是否可用。若权重可用但商业用途受限(通常需要购买付费许可证),模型将被标注为“商业用途受限”。 ### 智能评估 由 Artificial Analysis 独立测量的智能评估 · 数值越高越好 代理业务运营 推理模型由灯泡图标标识 虽然模型智能通常适用于各种用例,但某些评估可能对特定用例更为相关。 Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。 ## AA-Briefcase ### AA-Briefcase Elo AA-Briefcase 是 Artificial Analysis 开发的一项代理知识工作基准测试。AA-Briefcase Elo 是一项综合指标,聚合了评分标准通过率、分析质量 Elo 和演示 Elo · 数值越高越好 推理模型由灯泡图标标识 AA-Briefcase Elo 是一项综合指标,聚合了分析质量 Elo、演示 Elo 和评分标准通过率,并通过合成对局将评分标准表现转换为 Elo。Elo 及 95% 置信区间边界限制为 0。 ## AA-Omniscience ### AA-Omniscience Index AA-Omniscience Index(越高越好)衡量知识可靠性与幻觉情况。它对正确回答给予奖励,对幻觉行为进行惩罚,并且对拒绝回答不设惩罚。得分范围从 -100 到 100,其中 0 表示正确与错误回答数量相当,负分表示错误回答多于正确回答。 推理模型由灯泡图标标识 AA-Omniscience Index(越高越好)衡量知识可靠性与幻觉情况。它对正确回答给予奖励,对幻觉行为进行惩罚,并且对拒绝回答不设惩罚。得分范围从 -100 到 100,其中 0 表示正确与错误回答数量相当,负分表示错误回答多于正确回答。 ## 开放性 ### Artificial Analysis Openness Index:分数 Openness Index 在 0 到 100 的归一化尺度上评估模型开放性(数值越高越开放) 推理模型由灯泡图标标识 ## 智能指数对比 ### 智能指数 vs. 每智能指数任务成本 Artificial Analysis Intelligence Index · 每项 Artificial Analysis Intelligence Index 任务的加权平均成本(美元) 推理模型由灯泡图标标识 每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答 Token 价格计算,除以任务数量,并按其智能指数权重加权。 Artificial Analysis Intelligence Index v4.1包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking) ,包括各项评估及其运行方式的细分说明。 ## Token使用 ### 每智能指数任务的输出 Token 数量 运行 Artificial Analysis Intelligence Index 中一项任务所使用的加权平均输出 Token 数 推理模型由灯泡图标标识 每项智能指数任务所需的 Token 数量。计算方法为:将每个评估的输出 Token 数乘以智能指数中各基准测试的相对权重,然后除以任务数量(不包括重复)。 ## 价格与成本 ### 每智能指数任务成本 每项 Artificial Analysis Intelligence Index 任务的加权平均成本(美元),按 Token 类型细分。越低越好 推理模型由灯泡图标标识 每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答 Token 价格计算,除以任务数量,并按其智能指数权重加权。 ### 运行 Artificial Analysis Intelligence Index 的成本 运行 Artificial Analysis Intelligence Index 中所有评估的成本(美元) 推理模型由灯泡图标标识 运行 Artificial Analysis Intelligence Index 中评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答 Token 价格以及跨评估使用的 Token 数量(不包括重复)计算。 ### 定价:缓存命中、输入和输出 价格(每百万 Token 的美元数) 推理模型由灯泡图标标识 缓存提示(先前处理过)的每 Token 价格,通常比常规输入价格有显著折扣,以每百万Token的美元表示。此处显示的值为缓存命中价格;缓存写入和缓存存储按提供商单独计费——详情请参阅“各提供商的缓存定价”。 请求/消息中发送到 API 的每 Token 价格,以每百万 Token 的美元表示。 此处显示的混合缓存价格仅使用缓存命中价格。其他缓存成本因提供商而异: - Anthropic:收取单独的缓存写入费用,5 分钟和 1 小时 TTL 的费率不同(1 小时 TTL 更贵)。 - Google (Vertex/Gemini):除缓存命中定价外,还收取按小时计费的缓存存储费用。部分提供商还对超过 200K Token 的提示采用分层定价。 - OpenAI、DeepSeek 等:通常仅收取缓存命中定价,不收取写入或存储费用。 请参阅提示缓存 (https://artificialanalysis.ai/models/caching) 获取完整细分说明。 模型生成的每 Token 价格(从 API 接收),以每百万 Token 的美元表示。 数据展示了模型自有 API(例如 OpenAI 的 o1)的性能表现,或在没有自有 API 的情况下(例如 Meta 的 Llama 模型)跨提供商的中位数表现。 ## 上下文窗口 ### 上下文窗口 上下文窗口:Token 限制 · 越高越好 推理模型由灯泡图标标识 更大的上下文窗口与 RAG(检索增强生成)LLM 工作流相关,这些工作流通常涉及大量数据的推理和信息检索。 输入和输出 Token 的最大数量。输出 Token 通常有显著更低的上限(因模型而异)。 ## 速度 按输出速度(每秒 Token 数)衡量 ### 输出速度 每秒输出 Token 数 · 越高越好 推理模型由灯泡图标标识 模型生成 Token 时每秒接收的 Token 数(即对于支持流传输的模型,从 API 接收到第一个数据块后开始)。 数据展示了模型自有 API(例如 OpenAI 的 o1)的性能表现,或在没有自有 API 的情况下(例如 Meta 的 Llama 模型)跨提供商的中位数表现。 ### 每智能指数任务耗时 每项任务的加权平均解码时间(分钟);不包括 TTFT 和开销时间 · 越低越好 推理模型由灯泡图标标识 每项 Artificial Analysis Intelligence Index 任务的加权平均时间(秒)。计算方法为:将每项任务的输出 Token 数除以输出速度,并按智能指数中各基准测试的相对权重加权。 ## 延迟 按首 Token 时间(秒)衡量 ### 延迟:首回答 Token 时间 收到首回答 Token 的秒数 · 包含推理模型的“思考”时间 推理模型由灯泡图标标识 API 请求发送后收到首回答 Token 的时间(秒)。对于推理模型,这包括模型在提供答案之前的“思考”时间。对于不支持流传输的模型,这代表接收完整输出的时间。 ## 端到端响应时间 基于首 Token 时间、推理模型“思考”时间和输出速度计算的输出 500 个 Token 的秒数 ### 端到端响应时间 输出 500 个 Token 的秒数,包含推理模型的“思考”时间 · 越低越好 推理模型由灯泡图标标识 接收 500 Token 响应的秒数。关键组成部分: - 输入时间:接收首个响应 Token 的时间 - 思考时间(仅限推理模型):推理模型在提供答案之前输出 Token 进行推理所花费的时间。Token 数量基于一组多样化的 60 个提示的平均推理 Token(方法论细节 (https://artificialanalysis.ai/methodology/performance-benchmarking))。 - 回答时间:基于输出速度生成 500 个输出 Token 的时间 数据展示了模型自有 API(例如 OpenAI 的 o1)的性能表现,或在没有自有 API 的情况下(例如 Meta 的 Llama 模型)跨提供商的中位数表现。 ## 模型大小(仅开放权重模型) ### 模型大小:总参数量与活跃参数量 模型总参数量与推理期间活跃参数量的对比 推理模型由灯泡图标标识 模型中可训练权重和偏差的总数,以十亿为单位。这些参数在训练期间学习,决定了模型处理和生成响应的能力。 每次推理前向传播期间实际执行的参数数量,以十亿为单位。对于混合专家(MoE)模型,路由机制为每个 Token 选择一部分专家,导致活跃参数少于总参数。密集模型使用所有参数,因此活跃参数等于总参数。

相似文章

Opus 5 在 IMO 中获得满分

Reddit r/singularity

Opus 5 是一款人工智能模型,在国际数学奥林匹克竞赛中取得了满分,展现了先进的数学推理能力。