JetBrains 推出 Mellum2:一款面向代码生成与推理任务的 12B 参数混合专家模型

Hugging Face Blog 模型

摘要

JetBrains 推出 Mellum2,这是一款基于 12B 参数的混合专家模型,专为代码生成和推理任务优化,重点支持私有部署并集成到开发工作流中。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/01 18:57

介绍 Mellum2:JetBrains 打造的 12B 混合专家模型

来源:https://huggingface.co/blog/JetBrains/mellum2-launch 返回文章列表 (https://huggingface.co/blog)

Nikita Pavlichenko 的头像 (https://huggingface.co/pavlichenko)

Mellum 标志

  • Mellum2 是一个 12B 参数的混合专家模型,从头训练于自然语言和代码。
  • 该模型每个 token 仅激活 2.5B 参数,因此适用于高吞吐量、低延迟的推理场景。Mellum2 可用于路由、RAG、摘要、子代理、高吞吐量编码功能以及私有部署。
  • 它基于 Apache 2.0 许可证发布。
  • 与相似规模的模型相比,Mellum2 在基准测试中表现出竞争力,同时推理速度提升超过 2 倍。
  • 在 Hugging Face 上下载模型:https://huggingface.co/collections/JetBrains/mellum-2
  • 关于架构细节、训练设置、基准测试和评估方法,请阅读完整技术报告:https://arxiv.org/pdf/2605.31268

今天,我们发布 Mellum2,一个开源的混合专家模型,专为低延迟的文本与代码工作负载优化。Mellum 最初是一个代码补全模型。通过 Mellum2,我们将这一基础扩展到更广泛的自然语言和软件工程任务,同时保持模型在高效推理和可部署性上的专注。现代 AI 系统越来越依赖多次模型调用:路由、检索、摘要、规划、验证和工具使用。这些操作中有许多对延迟敏感,并且不需要使用最大的可用模型。Mellum2 正是针对这些工作负载。

基准测试亮点

Mellum2 评估 (https://huggingface.co/JetBrains/Mellum2-12B-A2.5B-Thinking/resolve/main/mellum_evals_grid_1700.jpg)

在我们的技术报告中,我们在代码生成、推理、科学和数学基准上评估了 Mellum2。Mellum2 与同等规模的开源模型相比具有竞争力,同时推理速度提升超过 2 倍,因此适用于高吞吐量的生产工作负载。模型架构 Mellum2 是一个混合专家模型:

模型总参数每 token 活跃参数模态许可证
Mellum212B2.5B文本和代码Apache 2.0

MoE 架构在保持总模型容量较高的同时,仅对每个 token 激活部分参数。这使得推理更高效,并有助于降低实时工作负载的服务成本。Mellum2 有意专注于文本和代码,而非多模态任务。这种专精使模型保持紧凑高效,适用于软件工程工作负载。

关键用例

路由与编排

Mellum2 在多模型系统中作为轻量级路由和编排模型表现出色,包括提示分类、工具选择以及中间控制流步骤。

RAG 流水线

该模型非常适合延迟敏感的检索流水线,包括上下文压缩、摘要和检索后处理。

子代理

Mellum2 可用于代理子任务,如规划、验证、转换和上下文准备,从而减少为中间操作调用更大模型的需求。

私有部署

由于 Mellum2 是开源且服务高效,它可以部署在涉及专有代码或内部数据的自托管环境中。

为何精确定位模型如此重要

随着 AI 系统的成熟,最高效的架构正变得不那么单一。单一的前沿模型可以很强大,但生产系统通常需要多个专门组件协同工作:检索器、路由器、代码感知模型、验证器、工具调用者和更大的推理模型。我们将 Mellum2 视为一个“焦点”模型:一个快速、精确定位的模型,针对较大 AI 系统中的高频任务进行优化。目标不是取代栈中的每个模型,而是让整个栈更快、更便宜、更易于控制。

开始使用 Mellum2

如果你正在为软件工程构建 AI 系统——无论是在 IDE 内部、RAG 流水线中、作为代理工作流的一部分,还是在私有基础设施上——Mellum2 已经准备好让你尝试 (https://huggingface.co/collections/JetBrains/mellum-2)。

相似文章

JetBrains 的 Mellum 2(阅读时间 49 分钟)

TLDR AI

JetBrains 发布 Mellum 2,这是一个 12B 参数的开源权重混合专家语言模型,专注于软件工程领域,在代码生成、推理和工具使用方面性能具有竞争力,基于 Apache 2.0 许可证发布。

Mellum2 技术报告

Hugging Face Daily Papers

Mellum 2 是一个由 JetBrains 开发的 12B 参数开源权重的 MoE 语言模型,具有 2.5B 活跃参数,专注于软件工程任务,并针对商用 GPU 上的高效推理进行了优化。

JetBrains/Mellum2-12B-A2.5B-Thinking

Hugging Face Models Trending

JetBrains releases Mellum2-12B-A2.5B-Thinking, an open-source Mixture-of-Experts reasoning model with 131k context length, trained with RLVR for explicit chain-of-thought reasoning.

Mellum 2 12B A2.5B

Reddit r/LocalLLaMA

JetBrains发布了Mellum 2 12B A2.5B,这是一个专注于编码的小型MoE模型,其推理性能与Qwen 3.5 9B相当,但在其他任务上较弱。