Cohere 开源 Command A+,一款为智能体构建的 218B MoE 模型
摘要
Cohere 发布了 Command A+,一款总参数 218B、激活参数 25B 的混合专家模型,将之前五个模型整合为一个,在企业智能体任务上性能提升。该模型在 Apache 2.0 协议下开源,并可在 Hugging Face 上获取。
暂无内容
查看缓存全文
缓存时间: 2026/05/23 13:58
# Cohere 开源 Command A+:专为企业 Agent 打造的 218B MoE 模型 - Firethering
来源:https://firethering.com/cohere-command-a-plus-open-source-enterprise-ai-model/
\- 广告 \-
在过去一年里,Cohere 一直在部署其企业 AI 工作空间 North,由真实客户处理实际工作。基于公司文件系统的 Agent 问答、跨电子表格的数据分析、需要在实际生产环境中保持稳定的多会话记忆。Command A+ 正是这一过程的产物——一个在观察企业工作流如何崩溃并找出原因的一年中锤炼出来的模型。
结果是:一个 218B 的混合专家模型,推理时仅激活 25B 参数,今日在 Hugging Face 上以 Apache 2.0 许可证开源。它取代了 Command A 系列中五个独立的模型,每个模型原本只处理一件事。现在一个模型处理所有任务,而在这些专家模型原本擅长的绝大多数任务上,它表现更优。
## **五合一**
此版本发布前,Command A 系列分散且碎片化:通用型 Command A、复杂问题求解型 Reasoning、多模态型 Vision、多语言型 Translate 以及单独的工具使用型。五个模型需要五套基础设施来管理。
Command A+ 将所有功能整合为一体。一个模型,支持语言从 23 种扩展到 48 种,内置多模态推理、工具使用和推理模式。对于负责私有部署的企业团队而言,这意味着更少的模型数量、更少的硬件配置和更少的版本管理麻烦。
这种整合只有当统一模型的实际表现能与专家模型相匹敌时才有效。在 North 最看重的 Agent 任务上,它不仅匹敌,还实现了超越。Agent 问答准确率比 Command A Reasoning 提升了 20%,电子表格分析质量提升了 32%。记忆性能(测试模型能否利用上次会话的上下文回答新问题)从 39% 跃升至 54%。与它所取代的专家模型相比,这些是实实在在的提升。
## **效率数据**
218B 总参数听起来像是一个集群问题。其实不然——而这一区别正是此处 MoE 架构的核心。
在密集模型中,每个 token 都要激活所有参数。Command A+ 在推理时只激活 25B 参数,其余参数闲置。实际效果是:在 W4A4 量化下,它只需两块 NVIDIA H100 或一块 Blackwell GPU 即可运行,Cohere 称其与全精度版本相比质量差异几乎不可察觉。对于希望私有部署、在自己的硬件上运行、且无需通过外部 API 传输敏感数据的团队来说,这一最低配置要求改变了游戏规则。
速度方面也比前代有显著提升。与相同量化和并发级别下的 Command A Reasoning 相比,Command A+ 的输出 token 每秒数量最高提升 63%,首次 token 生成时间缩短最高 17%。W4A4 量化在此基础上再带来 47% 的速度提升。Cohere 还使用了专门为 MoE 架构优化的推测解码,进一步带来 1.5 到 1.6 倍的推理加速。
此外还有全新的分词器。Command A+ 是 Cohere 第一个使用该分词器的模型,其压缩增益对非欧洲语言尤为重要:阿拉伯语分词效率提升 20%,韩语 16%,日语 18%。每个响应的 token 更少意味着每次查询的推理成本更低,在企业规模下,这种优势会迅速累积。
##### **你可能也会喜欢:** ZAYA1-8B 以少于 1B 的激活参数在数学任务上媲美 DeepSeek-R1。(https://firethering.com/zaya1-8b-open-source-math-coding-model/)
## **真正强劲的领域**
Cohere 最有信心的基准测试是那个最难造假的项目:τ2-Bench Telecom,它测试真实企业场景中多步骤 Agent 任务的完成能力。Command A Reasoning 在它上面得分 37%。Command A+ 的得分是 85%。这不是渐进式提升,而是在模型专门构建的任务上达到了完全不同的能力等级。
Terminal-Bench Hard 从 3% 提升到 25%。这个数字虽然还不足以让 Command A+ 成为代码专家,但它反映了当模型围绕真实工作流完成进行设计,并在完整的 Agent 循环(而不仅仅是孤立的代码生成)上得到充分训练时会发生什么。
多模态推理是该模型新增的功能,数据表现扎实:MMMU Pro 达到 63%,MathVista 达到 80.6%(高于 Command A Vision 的 73.5%),CharXiv 推理达到 52.7%(高于 46.9%)。企业多模态应用真正活跃的场景是图表、表格和混合格式文档的理解,而这些基准测试正好针对这些场景进行测试。
多语言能力也真正得到了扩展。从上一代的 23 种语言扩展到 48 种,推理能力延伸至阿拉伯语、日语和韩语,这是之前的模型不支持的。Cohere 使用 AIME 2025(一个数学基准测试)的内部阿拉伯语、日语和韩语翻译版本进行了测试,以验证推理质量在不同语言中是否保持一致,而不仅仅是翻译流畅度。对全球企业部署而言,这是一个有意义的区别。
在 Artificial Analysis Intelligence Index 上,Command A+ 得分 37,Cohere 表示这优于其他领先的开源模型。该指数是跨任务通用能力的综合指标,得分反映了一个模型在多个维度上真正强劲,而非针对单一基准类别进行狭窄优化。
## **它不擅长什么**
通用聊天质量并非此模型的重点。如果你将其作为对话式助手或写作工具来评估,基准测试会令人失望。这不是模型本身的缺陷,而是设计选择,但在有人期望它成为全面助手却只得到一个能力强大但聚焦狭窄的模型之前,值得明确说明。
该模型还需要 vLLM 或 Transformers 进行推理。对于这一规模的开源权重模型来说,这是标准配置,但运行自定义推理栈的企业团队应在假设能顺利融入现有基础设施之前核实兼容性。
硬件是另一个现实约束。两块 H100 是最低要求,而实际中的最低规格通常意味着“可接受”的性能而非“良好”的性能。期望大规模运行高要求 Agent 工作流的团队很可能需要超出最低配置的资源。单块 Blackwell GPU 也可以工作,但 Blackwell 硬件目前仍不便宜,且在主要云提供商之外并不广泛可用。
Agent 编程能力方面,Terminal-Bench Hard 的 25% 虽然比前代好,但绝对值仍然有限。对于以编程为主要用例的团队,有更适合该特定任务的开源模型。
## **这是为谁准备的**
Apache 2.0 许可证和两块 H100 的最低规格说明了很多问题,它们指向的都是同一类客户。
需要将数据保留在自有基础设施上的企业团队。受监管行业中的公司,将查询发送到外部 API 不可行。被告知主权 AI 很重要,但之前没有能力如此配置且可实际部署的开源模型的组织。
Command A+ 并非试图成为最好的通用聊天机器人。它的核心价值在于:Agent 任务完成、私有部署、多语言推理和多模态文档理解——所有这些打包在一个团队用两块 H100 就能运行的单一模型中。
对于希望在承诺投入基础设施之前先尝试的开发者,权重已在 Hugging Face 上提供 BF16、FP8 和 W4A4 量化版本。Cohere 还提供了一个免费 Space 用于测试,以及通过 Model Vault 提供的托管推理选项,供那些希望获得企业级部署但又不想自己管理硬件的团队使用。
此次开源发布还意味着社区能够了解模型是如何构建的——这是 Cohere 在前几代中较少透露的。这能否转化为有意义的社区贡献,还是仅仅促成更知情的评估,仍有待观察。
相似文章
Command A+
Cohere 发布了 Command A+,这是一款面向商业应用的开放企业级AI模型。
@ClementDelangue:Cohere 近来在开源方面进展非常出色。优秀的 Apache 2.0 模型!https://huggingface.co/CohereLabs/…
Cohere 发布了 Command A+,这是一个开源模型,拥有 250 亿活跃参数和 2180 亿总参数,采用 Apache 2.0 许可,针对智能体、多语言和重推理任务进行了优化。
回复:Cohere的Command-A系列模型后来怎么样了?
Cohere发布Command A+,其首个混合专家模型,采用Apache 2.0许可,具备高效量化,可在1-2块GPU上部署,优先考虑实用性和对开发者的开放访问。
CohereLabs/command-a-plus-05-2026-bf16 · Hugging Face
Cohere发布了Command A+,这是一个开源模型,拥有250亿活跃参数(总计2180亿),针对代理型、多语言和重度推理任务进行了优化,支持视觉输入和128K上下文,采用Apache 2.0许可证。
CohereLabs/command-a-plus-05-2026-w4a4
CohereLabs 发布了 Command A+,一个开源的 25B 活跃参数模型,针对智能体、多语言和推理任务进行了优化,支持视觉功能,采用 Apache 2.0 许可证。