JetBrains 推出 Mellum2:一款面向代码生成与推理任务的 12B 参数混合专家模型
摘要
JetBrains 推出 Mellum2,这是一款基于 12B 参数的混合专家模型,专为代码生成和推理任务优化,重点支持私有部署并集成到开发工作流中。
查看缓存全文
缓存时间: 2026/06/01 18:57
介绍 Mellum2:JetBrains 打造的 12B 混合专家模型
来源:https://huggingface.co/blog/JetBrains/mellum2-launch 返回文章列表 (https://huggingface.co/blog)
Nikita Pavlichenko 的头像 (https://huggingface.co/pavlichenko)
Mellum 标志
- Mellum2 是一个 12B 参数的混合专家模型,从头训练于自然语言和代码。
- 该模型每个 token 仅激活 2.5B 参数,因此适用于高吞吐量、低延迟的推理场景。Mellum2 可用于路由、RAG、摘要、子代理、高吞吐量编码功能以及私有部署。
- 它基于 Apache 2.0 许可证发布。
- 与相似规模的模型相比,Mellum2 在基准测试中表现出竞争力,同时推理速度提升超过 2 倍。
- 在 Hugging Face 上下载模型:https://huggingface.co/collections/JetBrains/mellum-2
- 关于架构细节、训练设置、基准测试和评估方法,请阅读完整技术报告:https://arxiv.org/pdf/2605.31268
今天,我们发布 Mellum2,一个开源的混合专家模型,专为低延迟的文本与代码工作负载优化。Mellum 最初是一个代码补全模型。通过 Mellum2,我们将这一基础扩展到更广泛的自然语言和软件工程任务,同时保持模型在高效推理和可部署性上的专注。现代 AI 系统越来越依赖多次模型调用:路由、检索、摘要、规划、验证和工具使用。这些操作中有许多对延迟敏感,并且不需要使用最大的可用模型。Mellum2 正是针对这些工作负载。
基准测试亮点
Mellum2 评估 (https://huggingface.co/JetBrains/Mellum2-12B-A2.5B-Thinking/resolve/main/mellum_evals_grid_1700.jpg)
在我们的技术报告中,我们在代码生成、推理、科学和数学基准上评估了 Mellum2。Mellum2 与同等规模的开源模型相比具有竞争力,同时推理速度提升超过 2 倍,因此适用于高吞吐量的生产工作负载。模型架构 Mellum2 是一个混合专家模型:
| 模型 | 总参数 | 每 token 活跃参数 | 模态 | 许可证 |
|---|---|---|---|---|
| Mellum2 | 12B | 2.5B | 文本和代码 | Apache 2.0 |
MoE 架构在保持总模型容量较高的同时,仅对每个 token 激活部分参数。这使得推理更高效,并有助于降低实时工作负载的服务成本。Mellum2 有意专注于文本和代码,而非多模态任务。这种专精使模型保持紧凑高效,适用于软件工程工作负载。
关键用例
路由与编排
Mellum2 在多模型系统中作为轻量级路由和编排模型表现出色,包括提示分类、工具选择以及中间控制流步骤。
RAG 流水线
该模型非常适合延迟敏感的检索流水线,包括上下文压缩、摘要和检索后处理。
子代理
Mellum2 可用于代理子任务,如规划、验证、转换和上下文准备,从而减少为中间操作调用更大模型的需求。
私有部署
由于 Mellum2 是开源且服务高效,它可以部署在涉及专有代码或内部数据的自托管环境中。
为何精确定位模型如此重要
随着 AI 系统的成熟,最高效的架构正变得不那么单一。单一的前沿模型可以很强大,但生产系统通常需要多个专门组件协同工作:检索器、路由器、代码感知模型、验证器、工具调用者和更大的推理模型。我们将 Mellum2 视为一个“焦点”模型:一个快速、精确定位的模型,针对较大 AI 系统中的高频任务进行优化。目标不是取代栈中的每个模型,而是让整个栈更快、更便宜、更易于控制。
开始使用 Mellum2
如果你正在为软件工程构建 AI 系统——无论是在 IDE 内部、RAG 流水线中、作为代理工作流的一部分,还是在私有基础设施上——Mellum2 已经准备好让你尝试 (https://huggingface.co/collections/JetBrains/mellum-2)。
相似文章
JetBrains 的 Mellum 2(阅读时间 49 分钟)
JetBrains 发布 Mellum 2,这是一个 12B 参数的开源权重混合专家语言模型,专注于软件工程领域,在代码生成、推理和工具使用方面性能具有竞争力,基于 Apache 2.0 许可证发布。
Mellum2 开源:一款适用于 AI 工作流的快速模型 | JetBrains AI 博客
JetBrains 将 Mellum2 开源,这是一个快速的 12B 混合专家模型,专为软件工程中的低延迟 AI 工作流设计,遵循 Apache 2.0 许可证。
Mellum2 技术报告
Mellum 2 是一个由 JetBrains 开发的 12B 参数开源权重的 MoE 语言模型,具有 2.5B 活跃参数,专注于软件工程任务,并针对商用 GPU 上的高效推理进行了优化。
JetBrains/Mellum2-12B-A2.5B-Thinking
JetBrains releases Mellum2-12B-A2.5B-Thinking, an open-source Mixture-of-Experts reasoning model with 131k context length, trained with RLVR for explicit chain-of-thought reasoning.
Mellum 2 12B A2.5B
JetBrains发布了Mellum 2 12B A2.5B,这是一个专注于编码的小型MoE模型,其推理性能与Qwen 3.5 9B相当,但在其他任务上较弱。