MiMo-v2.6-Pro: 智能、性能与价格分析
摘要
基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。
暂无内容
查看缓存全文
缓存时间: 2026/09/22 06:48
# MiMo-V2.6-Pro - 智能、性能与价格分析 | Artificial Analysis
来源:https://artificialanalysis.ai/models/mimo-v2-6-pro
## 智能更新
### Artificial Analysis 智能指数 (https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index)
Artificial Analysis 智能指数 v4.3.2 涵盖了 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
### 按开放权重/专有划分的 Artificial Analysis 智能指数
Artificial Analysis 智能指数 v4.3.2 涵盖了 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
表明模型权重是否可用。如果商业使用受限于某些条件,模型会被标记为“商业使用受限”;如果许可证禁止商业使用,则标记为“非商业”。
## 能力指数 (https://artificialanalysis.ai/models/capabilities)
衡量模型在特定能力和行业的表现
### 智能评估
由 Artificial Analysis 独立衡量 · 数值越高越好
智能体知识工作,(Elo-500)/2000
智能体现实世界工作任务,(Elo-500)/2000
智能体编码与终端使用
专业文档推理,全通过
医学长上下文推理
虽然模型智能通常可以跨用例迁移,但特定评估可能对某些用例更具相关性。
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
### AA-Briefcase v1.1 更新
### AA-Briefcase Elo
AA-Briefcase v1.1 是由 Artificial Analysis 开发的智能体知识工作基准测试。AA-Briefcase Elo 是一个组合指标,汇总了评分标准通过率、分析质量 Elo 和展示 Elo · 数值越高越好
AA-Briefcase Elo 是一个组合指标,汇总了分析质量 Elo、展示 Elo 和评分标准通过率。其中,评分标准表现通过合成的一对一匹配转换为 Elo。Elo 及其 95% 置信区间上下限被限制在 0 以上。
### AA-Omniscience
### AA-Omniscience 指数
AA-Omniscience 指数(数值越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对于拒绝回答没有惩罚。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相同,负分数表示错误答案多于正确答案。
AA-Omniscience 指数(数值越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对于拒绝回答没有惩罚。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相同,负分数表示错误答案多于正确答案。
## 开放性指数
### Artificial Analysis 开放性指数:分数
开放性指数在 0 到 100 的归一化尺度上评估模型的开放性(数值越高越开放)
## 智能指数对比
### 智能指数 vs. 每个智能指数任务的成本
Artificial Analysis 智能指数 · 每个 Artificial Analysis 智能指数任务的加权平均成本(美元)
每个智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量,并按其在智能指数中的权重加权。
Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
## Token 使用量
### 每个智能指数任务的输出 Token 数
运行 Artificial Analysis 智能指数中一个任务所使用的输出 token 加权平均数
每个智能指数任务所需的 token 数。计算方法是:将每项评估的输出 token 数乘以该评估在智能指数中的相对权重,然后除以任务数量(不包括重复)。
## 成本
### 每个智能指数任务的成本
按 token 类型划分的,每个 Artificial Analysis 智能指数任务的加权平均成本(美元)。数值越低越好
每个智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量,并按其在智能指数中的权重加权。
### 运行 Artificial Analysis 智能指数的成本
运行 Artificial Analysis 智能指数中所有评估的成本(美元)
运行 Artificial Analysis 智能指数中所有评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答 token 价格以及跨评估使用的 token 数量(不包括重复)计算。
### 定价:缓存命中、输入和输出
价格(美元/每百万 Token)
用于缓存提示(已处理过)的每 token 价格,通常比常规输入价格有显著折扣,以每百万 token 的美元数表示。此处显示的数值是缓存命中价格;缓存写入和缓存存储单独计费,且因提供商而异——详情请参阅“按提供商划分的缓存定价”。
## 上下文窗口
### 上下文窗口
上下文窗口:token 限制 · 数值越高越好
更大的上下文窗口与 RAG(检索增强生成)LLM 工作流程相关,这些工作流程通常涉及对大量数据的推理和信息检索。
组合输入和输出 token 的最大数量。输出 token 的限制通常显著较低(因模型而异)。
## 速度
通过输出速度(每秒 Token 数)衡量
### 输出速度
每秒输出 token 数 · 数值越高越好
模型在生成 token 时收到的每秒 token 数(即对于支持流式传输的模型,在从 API 收到第一个 chunk 之后)。
数据代表模型官方 API 的性能,或在没有官方 API 的情况下跨提供商的中位数性能。
### 每个智能指数任务的时间
每个任务的加权平均解码时间(分钟);不包括 TTFT 和开销时间 · 数值越低越好
每个 Artificial Analysis 智能指数任务的加权平均时间(秒)。计算方法是:将每个任务的输出 token 数除以输出速度,并按每个评估在智能指数中的相对权重加权。
## 延迟
通过首个 Token 的时间(秒)衡量
### 延迟:首个回答 Token 的时间
收到首个回答 token 所需的秒数 · 包括推理模型的“思考”时间
从发送 API 请求到收到首个回答 token 所需的时间(秒)。对于推理模型,这包括模型在提供答案之前的“思考”时间。对于不支持流式传输的模型,这代表收到完成结果的时间。
## 端到端响应时间
输出 500 个 token 所需的秒数,基于首个 token 的时间、推理模型的“思考”时间以及输出速度计算
### 端到端响应时间
输出 500 个 token 所需的秒数,包括推理模型的“思考”时间 · 数值越低越好
收到 500 个 token 响应所需的秒数。关键组成部分:
- 输入时间:收到第一个响应 token 的时间
- 思考时间(仅适用于推理模型):推理模型在提供答案之前输出用于推理的 token 所花费的时间。基于 60 个多样化提示的平均推理 token 数量确定(方法论详情见 (https://artificialanalysis.ai/methodology/performance-benchmarking))。
- 回答时间:基于输出速度生成 500 个输出 token 的时间。
数据代表模型官方 API 的性能,或在没有官方 API 的情况下跨提供商的中位数性能。
## 模型规模(仅适用于开放权重模型)
### 模型规模:总参数与活跃参数
总模型参数与推理期间活跃参数的比较
模型中可训练的权重和偏置的总数量,以十亿为单位。这些参数在训练期间学习,并决定了模型处理和生成响应的能力。
每次推理前向传播中实际执行的参数数量,以十亿为单位。对于混合专家(MoE)模型,路由机制为每个 token 选择一个专家子集,导致活跃参数少于总参数。稠密模型使用所有参数,因此活跃参数等于总参数。
相似文章
MiMo v2.6 pro
MiMo v2.6 pro 是一款以开源权重发布的AI模型,据称在基准测试中表现出色。
Xiaomi MiMo v2.6
Xiaomi 发布了 MiMo 模型的 2.6 版本,这暗示了对其 AI 能力的增量更新。
我测试了小米 MiMo V2.5 Pro 在自主编程方面的表现:完成了 301 次提交,生成了 60 多页代码,API 费用仅 70 美元。如今它已开源。
小米已开源其 MiMo V2.5 Pro 模型,这是一个拥有 1020 亿参数、专为自主编码任务设计的混合专家(MoE)模型。本文详细介绍了一项现实世界中的测试,结果表明该模型凭借高缓存命中率实现了高效运行且 API 调用成本极低。
价格战开始。MiMo 2.5 Pro现在与DeepSeek V4 Pro价格相同
MiMo 2.5 Pro降低了价格以对标DeepSeek V4 Pro,引发了AI模型提供商之间的价格战。
Xiaomi开源MiMo-V2.6 Pro和Flash模型(2分钟阅读)
Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。