openbmb/MiniCPM5-2B-GGUF

Hugging Face Models Trending 模型

摘要

发布 MiniCPM5-2B-GGUF,这是一个针对设备端部署优化的20亿参数AI模型,使用开源训练数据集在同类产品中达到了最先进的性能水平。

任务:文本生成 标签:transformers, gguf, minicpm, minicpm5, llama, 文本生成, 长上下文, 工具调用, 设备端, 边缘AI, en, zh, 数据集:openbmb/Ultra-FineWeb, 数据集:openbmb/UltraX-Preview, 数据集:openbmb/Ultra-FineWeb-L3, 数据集:openbmb/UltraData-Math, 数据集:openbmb/UltraData-Code, 数据集:openbmb/UltraData-SFT-2605, 数据集:openbmb/UltraData-SFT-Agent-2609, 数据集:openbmb/UltraData-RL-2609, arxiv:2506.07900, arxiv:2602.09003, 许可证:apache-2.0, 端点兼容, 区域:us, 对话式
查看原文
查看缓存全文

缓存时间: 2026/09/10 14:15

openbmb/MiniCPM5-2B-GGUF · Hugging Face

来源:https://huggingface.co/openbmb/MiniCPM5-2B-GGUF

MiniCPM 技术报告 (https://arxiv.org/pdf/2506.07900)|MiniCPM Wiki (中文) (https://modelbest.feishu.cn/wiki/UtWxwcERfiRIpIkBOjuc3h9tn1D)|GitHub 仓库 (https://github.com/OpenBMB/MiniCPM)|UltraData (https://ultradata.openbmb.cn/)|在线演示 (https://huggingface.co/spaces/openbmb/MiniCPM5-2B-Demo)

English |中文 (https://huggingface.co/openbmb/MiniCPM5-2B/blob/main/README-cn.md)

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#highlights亮点

我们发布了 MiniCPM5-2B,这是 MiniCPM5 系列中的第二个模型,继 MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) 之后。它是一个密集的 2B Transformer,扩展了相同的训练方案,专为设备端、本地部署和资源受限场景打造,达到了 2B 级开源 SOTA 水平。

🏆 2B 级开源 SOTA:与同尺寸的强力开源模型相比,MiniCPM5-2B 在该对比集内达到了 SOTA 性能。整体上与 4B 级模型保持竞争力,同时在编码、数学、长上下文理解、工具使用和智能体任务中展现出对同尺寸模型的优势。

📂 开放高质量数据:随模型一起,我们发布了其背后的高质量训练数据集,作为 UltraData (https://ultradata.openbmb.cn/) 家族的一部分:UltraX (https://huggingface.co/datasets/openbmb/UltraX-Preview),一个高质量的网络预训练数据集;UltraData-Code (https://huggingface.co/datasets/openbmb/UltraData-Code),采用 L0–L3 分层代码数据管理,显著提升编码能力;UltraData-SFT-Agent-2609 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609),包含 500K 智能体训练样本,增强全面的设备端智能体能力;以及 UltraData-RL-2609 (https://huggingface.co/datasets/openbmb/UltraData-RL-2609),包含 80K+ 高质量 RL 训练样本,涵盖数学、代码、通用知识和长上下文推理。

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#model-list模型列表

使用此目录选择与您的运行时匹配的模型格式:

MiniCPM5-2B

  • MiniCPM5-2B (https://huggingface.co/openbmb/MiniCPM5-2B) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B) · BF16 最终发布版(经 RL + OPD 后训练)
  • MiniCPM5-2B-SFT (https://huggingface.co/openbmb/MiniCPM5-2B-SFT) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-SFT) · BF16 仅 SFT 检查点(RL / OPD 之前)
  • MiniCPM5-2B-Midtrain (https://huggingface.co/openbmb/MiniCPM5-2B-Midtrain) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-Midtrain) · BF16 中间训练检查点(SFT 之前)
  • MiniCPM5-2B-Base (https://huggingface.co/openbmb/MiniCPM5-2B-Base) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-Base) · BF16 基础检查点(仅预训练)
  • MiniCPM5-2B-GGUF (https://huggingface.co/openbmb/MiniCPM5-2B-GGUF) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-GGUF) · 适用于 llama.cpp / Ollama / LM Studio 的 GGUF 👈 您正在此处
  • MiniCPM5-2B-MLX (https://huggingface.co/openbmb/MiniCPM5-2B-MLX) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-MLX) · 适用于 Apple Silicon 的 MLX / 4bit 版本
  • MiniCPM5-2B-GPTQ (https://huggingface.co/openbmb/MiniCPM5-2B-GPTQ) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-GPTQ) · GPTQ / 4bit 量化模型
  • MiniCPM5-2B-DSpark (https://huggingface.co/openbmb/MiniCPM5-2B-DSpark) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-DSpark) · 用于推理加速的 DSpark 草稿模型
  • MiniCPM5-2B-DSpark-GGUF (https://huggingface.co/openbmb/MiniCPM5-2B-DSpark-GGUF) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-DSpark-GGUF) · DSpark 草稿模型的 GGUF 版本
  • MiniCPM5-2B-LiteRT (https://huggingface.co/litert-community/MiniCPM5-2B) · ModelScope (https://www.modelscope.cn/models/litert-community/MiniCPM5-2B) · MiniCPM5-2B 的 LiteRT-LM 版本

MiniCPM5-1B

  • MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B) · BF16 最终发布版(经 RL + OPD 后训练)
  • MiniCPM5-1B-SFT (https://huggingface.co/openbmb/MiniCPM5-1B-SFT) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-SFT) · BF16 仅 SFT 检查点(RL / OPD 之前)
  • MiniCPM5-1B-Base (https://huggingface.co/openbmb/MiniCPM5-1B-Base) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-Base) · BF16 基础检查点(仅预训练)
  • MiniCPM5-1B-GGUF (https://huggingface.co/openbmb/MiniCPM5-1B-GGUF) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-GGUF) · 适用于 llama.cpp / Ollama / LM Studio 的 GGUF
  • MiniCPM5-1B-MLX (https://huggingface.co/openbmb/MiniCPM5-1B-MLX) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-MLX) · 适用于 Apple Silicon 的 MLX / 4bit 版本

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#model-information模型信息

MiniCPM5-2B 具有以下特征:

  • 类型:因果语言模型
  • 架构:标准 LlamaForCausalLM
  • 参数数量:2,516,756,480
  • 非嵌入参数数量:1,981,982,720
  • 层数:42
  • 注意力头数 (GQA):Q 为 16 个,KV 为 2 个
  • 上下文长度:131,072

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#introduction简介

MiniCPM5-2B 是 MiniCPM5 系列中的第二个模型。它专为本地助手、编码智能体、工具使用工作流以及偏好紧凑模型的推理场景而设计。该模型在保持较小部署占用空间的同时,提供原生的长上下文支持。

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#evaluation-results评估结果

我们将 MiniCPM5-2B 与同尺寸类别中的强力开源模型进行了比较,包括 LFM2.5-2.6BQwen3.5-2BGemma-4-E2B-it,同时列出了 Qwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1B 等更大模型作为参考。

在此对比集内,MiniCPM5-2B 以 53.9 的平均分达到了 2B 级开源 SOTA,并且超过了此处包含的所有更大模型(最高分为 51.1)。其在代码推理、数学推理、长上下文理解、工具使用以及多项智能体任务中的优势最为明显。

MiniCPM5-2B 与基线模型评估结果

模型MiniCPM5-2BLFM2.5-2.6BQwen3.5-2BGemma-4-E2B-itQwen3.5-4Bgranite-4.2-3BNemotron-3-Nano-4BGemma-4-E4B-itLFM2.5-8B-A1B平均
平均分53.933.228.024.651.142.732.631.228.4
代码推理
LiveCodeBench v669.142.120.242.956.458.950.753.939.8
LCB-Pro 25Q2 (Easy)68.030.910.327.158.354.651.645.827.8
LCB-Pro 25Q2 (Medium)17.50.00.00.07.05.35.31.80.0
OJBench32.511.22.611.624.821.820.019.08.2
SciCode (wbg)26.314.2†2.8†20.9†16.1†24.9†16.4†24.4†7.8†
数学推理
AIME 202586.541.929.631.778.879.456.337.146.0
AIME 202686.545.229.039.882.783.562.145.056.7
HMMT Feb 202663.833.720.517.864.060.851.330.138.5
MATH-50094.689.685.885.499.097.091.688.293.2
指令遵循
IFBench66.359.046.025.759.073.058.328.351.0
IFEval86.793.477.531.490.293.788.044.490.8
Multi-IF71.876.857.140.373.675.965.945.971.4
通用知识
MMLU-Pro70.865.264.356.078.065.865.768.363.1
MMLU-Redux84.780.080.071.888.778.979.883.780.0
HLE8.96.2†2.6†4.8†9.96.6†4.9†3.8†6.9†
GPQA-Diamond70.255.8†45.6†43.3†77.155.9†51.3†57.6†51.3†
SuperGPQA40.826.238.630.352.839.937.838.734.5
长上下文
AA-LCR59.05.3†28.7†17.0†61.024.3†17.3†33.0†0.0†
NoLiMa68.10.717.13.943.55.11.12.30.5
LongBenchPro44.823.78.242.258.434.827.953.519.6
LongBench v243.730.324.933.247.336.032.042.730.4
工具使用
τ3-Bench Banking20.87.2†2.13.96.8†5.6†1.24.13.4
τ2-Bench Telecom97.190.469.0†20.8†92.1†40.928.1†20.8†16.1†
BFCL v466.661.143.636.656.852.243.747.049.2
编码智能体
SWE-bench Verified46.46.05.02.033.636.83.015.00.4
SWE-bench Pro14.40.60.80.028.212.30.13.30.4
Terminal-Bench v2.18.64.5†3.0†0.4†25.813.9†3.8†1.9†1.9†
搜索智能体
BrowseComp-ZH43.59.818.24.739.621.13.37.013.2
BrowseComp Top10039.713.719.36.033.319.04.76.39.7
GAIA Text-10388.749.547.930.178.657.326.539.541.1
通用智能体
GDPval-AA v219.64.50.00.011.70.0†0.00.00.0
Claw-Gym59.219.325.531.351.660.033.737.92.7
WildClaw23.910.29.28.917.020.08.914.34.5
QwenClaw42.919.318.214.537.136.416.816.74.5
  1. 蓝色粗体表示该行所有模型(包括 4B 级模型)中的最佳结果;黑色粗体表示 2B 级模型中的最佳结果。
  2. 标有†的分数来自官方 Artificial Analysis 发布;其他所有分数均为内部复现。

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#training-recipe训练方案

MiniCPM5-2B 的训练是 UltraData 分层数据管理 (https://arxiv.org/pdf/2602.09003) 的一次全栈实践,涵盖三个阶段:基础训练、中间训练和后训练。

基础训练 期间,模型经历稳定训练和衰减训练,以构建核心语言能力和训练稳定性。随后进入 中间训练,以进一步强化目标能力并适应目标数据分布。训练语料库随模型一起发布,包括 Ultra-FineWeb (https://huggingface.co/datasets/openbmb/Ultra-FineWeb)、Ultra-FineWeb-L3 (https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3)、UltraX (https://huggingface.co/datasets/openbmb/UltraX-Preview)、UltraData-Code (https://huggingface.co/datasets/openbmb/UltraData-Code) 和 UltraData-Math (https://huggingface.co/datasets/openbmb/UltraData-Math)。

后训练 期间,我们分三步进行:SFTRLOPD。我们首先使用 400B tokens 的深度思考 SFT 来建立深度思考和通用聊天能力;SFT 数据发布为 UltraData-SFT-2605 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605),智能体 SFT 数据发布为 UltraData-SFT-Agent-2609 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609)。然后,我们为数学、代码、智能体任务、写作及相关领域训练专门的 RL 教师(相应数据也已开源为 UltraData-RL-2609 (https://huggingface.co/datasets/openbmb/UltraData-RL-2609)),并使用 基于策略的蒸馏 (OPD) 将这些教师的知识蒸馏回一个发布模型。

MiniCPM5-2B 训练方案 (https://raw.githubusercontent.com/OpenBMB/MiniCPM/main/assets/minicpm5/minicpm5_2b_training_recipe.jpg)

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#what-does-rl–opd-bringRL + OPD 带来了什么?

RL + OPD 是 MiniCPM5-2B 后训练的关键部分。在 RL 阶段,我们采用了 JustRL II (https://panhaoxuan.notion.site/justrl-ii-scaling-small-llms-to-128k-reasoning-with-a-critic) 中描述的基于评论家的算法,显著提高了训练稳定性,并在多个领域取得了显著提升。在以下基准测试中,RL + OPD 平均提升推理和通用能力 ↑10.96 分,智能体能力提升 ↑6.96 分

OPD 融合了 RL 训练产生的 16 个专家模型的能力,包括 5 个智能体专家模型。在每个响应位置,我们计算学生和教师 logits 之间的全词汇表反向 KL 散度作为优势估计,替代了原始的基于验证的优势。OPD 直接重用训练每个 RL 教师时使用的提示作为蒸馏数据,因此无需构建额外的语料库。

MiniCPM5-2B RL + OPD 收益 (https://raw.githubusercontent.com/OpenBMB/MiniCPM/main/assets/minicpm5/minicpm5_2b_rl_opd_score_gains.png)

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#quickstart快速开始

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#vllmvLLM

pip install "vllm>=0.21"
vllm serve openbmb/MiniCPM5-2B --port 8000
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openbmb/MiniCPM5-2B",
    "messages": [{"role": "user", "content": "你是谁?请简要自我介绍。"}],
    "max_tokens": 128,
    "temperature": 1.0
  }'

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#sglangSGLang

pip install "sglang[srt]>=0.5.16"
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000
curl http://localhost:30000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openbmb/MiniCPM5-2B",
    "messages": [{"role": "user", "content": "你是谁?请简要自我介绍。"}],
    "max_tokens": 128,
    "temperature": 1.0
  }'

投机解码 (DSpark):我们还发布了 MiniCPM5-2B-DSpark (https://huggingface.co/openbmb/MiniCPM5-2B-DSpark),一个为 MiniCPM5-2B 训练的 DSpark 草稿模型。在 SGLang 中启用它,可以在保持目标模型输出不变的情况下加速解码:

python -m sglang.launch_server \
  --model-path openbmb/MiniCPM5-2B \
  --trust-remote-code \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark \
  --speculative-dspark-block-size 7 \
  --port 30000

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#transformersTransformers

pip install -U "transformers>=5.6" accelerate torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "openbmb/MiniCPM5-2B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
    model_id,
    torch_dtype="auto",
    device_map="auto",
)

messages = [{"role": "user", "content": "你是谁?请简要自我介绍。"}]
inputs = tokenizer.apply_chat_template(
    messages,
    tokenize=True,
    add_generation_prompt=True,
    enable_thinking=True,
    return_dict=True,
    return_tensors="pt",
).to(model.device)

outputs = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))

推荐采样参数:temperature=1.0, top_p=0.95

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#tool-calling工具调用

对于工具/函数调用,SGLang 是推荐的后端。MiniCPM5-2B 发出 XML 风格的工具调用,SGLang 内置的 minicpm5 解析器会将其原生转换为 OpenAI 兼容的 tool_calls

python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000 \
    --tool-call-parser minicpm5      # 或:--tool-call-parser auto

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#github-cookbooks-and-agent-skillsGitHub 食谱与智能体技能

MiniCPM5-2B 使用 标准 LlamaForCausalLM 架构,因此主流推理引擎可以直接加载它:无需自定义内核,无需模型代码分叉。有关分步部署和微调说明,请使用以下 GitHub 食谱。智能体技能作为 GitHub 资源链接,供使用 Cursor / Claude Code 风格编码智能体的用户使用。

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#deployment部署

https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#fine-tuning微调

相似文章

openbmb/MiniCPM5-2B

Hugging Face Models Trending

OpenBMB发布了MiniCPM5-2B,这是一个2B参数的密集Transformer模型,在设备端部署的同类模型中达到了最先进的性能,并提供了开源的高质量训练数据集。

MiniCPM5-1B

Reddit r/LocalLLaMA

OpenBMB 发布了 MiniCPM5-1B,这是一个密集型1B参数Transformer模型,在开源1B级模型中达到SOTA,专为设备端部署设计,支持混合推理和长上下文。