MiMo-v2.6-Pro: 智能、性能与价格分析

Hacker News Top 新闻

摘要

基于Artificial Analysis的基准和指标对MiMo-v2.6-Pro AI模型的智能、性能与价格进行分析。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/22 06:48

# MiMo-V2.6-Pro - 智能、性能与价格分析 | Artificial Analysis 来源:https://artificialanalysis.ai/models/mimo-v2-6-pro ## 智能更新 ### Artificial Analysis 智能指数 (https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index) Artificial Analysis 智能指数 v4.3.2 涵盖了 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ### 按开放权重/专有划分的 Artificial Analysis 智能指数 Artificial Analysis 智能指数 v4.3.2 涵盖了 10 项评估:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 表明模型权重是否可用。如果商业使用受限于某些条件,模型会被标记为“商业使用受限”;如果许可证禁止商业使用,则标记为“非商业”。 ## 能力指数 (https://artificialanalysis.ai/models/capabilities) 衡量模型在特定能力和行业的表现 ### 智能评估 由 Artificial Analysis 独立衡量 · 数值越高越好 智能体知识工作,(Elo-500)/2000 智能体现实世界工作任务,(Elo-500)/2000 智能体编码与终端使用 专业文档推理,全通过 医学长上下文推理 虽然模型智能通常可以跨用例迁移,但特定评估可能对某些用例更具相关性。 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ### AA-Briefcase v1.1 更新 ### AA-Briefcase Elo AA-Briefcase v1.1 是由 Artificial Analysis 开发的智能体知识工作基准测试。AA-Briefcase Elo 是一个组合指标,汇总了评分标准通过率、分析质量 Elo 和展示 Elo · 数值越高越好 AA-Briefcase Elo 是一个组合指标,汇总了分析质量 Elo、展示 Elo 和评分标准通过率。其中,评分标准表现通过合成的一对一匹配转换为 Elo。Elo 及其 95% 置信区间上下限被限制在 0 以上。 ### AA-Omniscience ### AA-Omniscience 指数 AA-Omniscience 指数(数值越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对于拒绝回答没有惩罚。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相同,负分数表示错误答案多于正确答案。 AA-Omniscience 指数(数值越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对于拒绝回答没有惩罚。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相同,负分数表示错误答案多于正确答案。 ## 开放性指数 ### Artificial Analysis 开放性指数:分数 开放性指数在 0 到 100 的归一化尺度上评估模型的开放性(数值越高越开放) ## 智能指数对比 ### 智能指数 vs. 每个智能指数任务的成本 Artificial Analysis 智能指数 · 每个 Artificial Analysis 智能指数任务的加权平均成本(美元) 每个智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量,并按其在智能指数中的权重加权。 Artificial Analysis 智能指数 v4.3.2 包含:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。更多详情,包括每项评估的细分及我们如何执行它们,请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ## Token 使用量 ### 每个智能指数任务的输出 Token 数 运行 Artificial Analysis 智能指数中一个任务所使用的输出 token 加权平均数 每个智能指数任务所需的 token 数。计算方法是:将每项评估的输出 token 数乘以该评估在智能指数中的相对权重,然后除以任务数量(不包括重复)。 ## 成本 ### 每个智能指数任务的成本 按 token 类型划分的,每个 Artificial Analysis 智能指数任务的加权平均成本(美元)。数值越低越好 每个智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答的 token 价格计算,除以任务数量,并按其在智能指数中的权重加权。 ### 运行 Artificial Analysis 智能指数的成本 运行 Artificial Analysis 智能指数中所有评估的成本(美元) 运行 Artificial Analysis 智能指数中所有评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答 token 价格以及跨评估使用的 token 数量(不包括重复)计算。 ### 定价:缓存命中、输入和输出 价格(美元/每百万 Token) 用于缓存提示(已处理过)的每 token 价格,通常比常规输入价格有显著折扣,以每百万 token 的美元数表示。此处显示的数值是缓存命中价格;缓存写入和缓存存储单独计费,且因提供商而异——详情请参阅“按提供商划分的缓存定价”。 ## 上下文窗口 ### 上下文窗口 上下文窗口:token 限制 · 数值越高越好 更大的上下文窗口与 RAG(检索增强生成)LLM 工作流程相关,这些工作流程通常涉及对大量数据的推理和信息检索。 组合输入和输出 token 的最大数量。输出 token 的限制通常显著较低(因模型而异)。 ## 速度 通过输出速度(每秒 Token 数)衡量 ### 输出速度 每秒输出 token 数 · 数值越高越好 模型在生成 token 时收到的每秒 token 数(即对于支持流式传输的模型,在从 API 收到第一个 chunk 之后)。 数据代表模型官方 API 的性能,或在没有官方 API 的情况下跨提供商的中位数性能。 ### 每个智能指数任务的时间 每个任务的加权平均解码时间(分钟);不包括 TTFT 和开销时间 · 数值越低越好 每个 Artificial Analysis 智能指数任务的加权平均时间(秒)。计算方法是:将每个任务的输出 token 数除以输出速度,并按每个评估在智能指数中的相对权重加权。 ## 延迟 通过首个 Token 的时间(秒)衡量 ### 延迟:首个回答 Token 的时间 收到首个回答 token 所需的秒数 · 包括推理模型的“思考”时间 从发送 API 请求到收到首个回答 token 所需的时间(秒)。对于推理模型,这包括模型在提供答案之前的“思考”时间。对于不支持流式传输的模型,这代表收到完成结果的时间。 ## 端到端响应时间 输出 500 个 token 所需的秒数,基于首个 token 的时间、推理模型的“思考”时间以及输出速度计算 ### 端到端响应时间 输出 500 个 token 所需的秒数,包括推理模型的“思考”时间 · 数值越低越好 收到 500 个 token 响应所需的秒数。关键组成部分: - 输入时间:收到第一个响应 token 的时间 - 思考时间(仅适用于推理模型):推理模型在提供答案之前输出用于推理的 token 所花费的时间。基于 60 个多样化提示的平均推理 token 数量确定(方法论详情见 (https://artificialanalysis.ai/methodology/performance-benchmarking))。 - 回答时间:基于输出速度生成 500 个输出 token 的时间。 数据代表模型官方 API 的性能,或在没有官方 API 的情况下跨提供商的中位数性能。 ## 模型规模(仅适用于开放权重模型) ### 模型规模:总参数与活跃参数 总模型参数与推理期间活跃参数的比较 模型中可训练的权重和偏置的总数量,以十亿为单位。这些参数在训练期间学习,并决定了模型处理和生成响应的能力。 每次推理前向传播中实际执行的参数数量,以十亿为单位。对于混合专家(MoE)模型,路由机制为每个 token 选择一个专家子集,导致活跃参数少于总参数。稠密模型使用所有参数,因此活跃参数等于总参数。

相似文章

MiMo v2.6 pro

Reddit r/singularity

MiMo v2.6 pro 是一款以开源权重发布的AI模型,据称在基准测试中表现出色。

Xiaomi MiMo v2.6

Hacker News Top

Xiaomi 发布了 MiMo 模型的 2.6 版本,这暗示了对其 AI 能力的增量更新。