openbmb/MiniCPM5-2B-GGUF
摘要
发布 MiniCPM5-2B-GGUF,这是一个针对设备端部署优化的20亿参数AI模型,使用开源训练数据集在同类产品中达到了最先进的性能水平。
查看缓存全文
缓存时间: 2026/09/10 14:15
openbmb/MiniCPM5-2B-GGUF · Hugging Face
来源:https://huggingface.co/openbmb/MiniCPM5-2B-GGUF
MiniCPM 技术报告 (https://arxiv.org/pdf/2506.07900)|MiniCPM Wiki (中文) (https://modelbest.feishu.cn/wiki/UtWxwcERfiRIpIkBOjuc3h9tn1D)|GitHub 仓库 (https://github.com/OpenBMB/MiniCPM)|UltraData (https://ultradata.openbmb.cn/)|在线演示 (https://huggingface.co/spaces/openbmb/MiniCPM5-2B-Demo)
English |中文 (https://huggingface.co/openbmb/MiniCPM5-2B/blob/main/README-cn.md)
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#highlights亮点
我们发布了 MiniCPM5-2B,这是 MiniCPM5 系列中的第二个模型,继 MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) 之后。它是一个密集的 2B Transformer,扩展了相同的训练方案,专为设备端、本地部署和资源受限场景打造,达到了 2B 级开源 SOTA 水平。
🏆 2B 级开源 SOTA:与同尺寸的强力开源模型相比,MiniCPM5-2B 在该对比集内达到了 SOTA 性能。整体上与 4B 级模型保持竞争力,同时在编码、数学、长上下文理解、工具使用和智能体任务中展现出对同尺寸模型的优势。
📂 开放高质量数据:随模型一起,我们发布了其背后的高质量训练数据集,作为 UltraData (https://ultradata.openbmb.cn/) 家族的一部分:UltraX (https://huggingface.co/datasets/openbmb/UltraX-Preview),一个高质量的网络预训练数据集;UltraData-Code (https://huggingface.co/datasets/openbmb/UltraData-Code),采用 L0–L3 分层代码数据管理,显著提升编码能力;UltraData-SFT-Agent-2609 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609),包含 500K 智能体训练样本,增强全面的设备端智能体能力;以及 UltraData-RL-2609 (https://huggingface.co/datasets/openbmb/UltraData-RL-2609),包含 80K+ 高质量 RL 训练样本,涵盖数学、代码、通用知识和长上下文推理。
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#model-list模型列表
使用此目录选择与您的运行时匹配的模型格式:
MiniCPM5-2B
- MiniCPM5-2B (https://huggingface.co/openbmb/MiniCPM5-2B) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B) · BF16 最终发布版(经 RL + OPD 后训练)
- MiniCPM5-2B-SFT (https://huggingface.co/openbmb/MiniCPM5-2B-SFT) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-SFT) · BF16 仅 SFT 检查点(RL / OPD 之前)
- MiniCPM5-2B-Midtrain (https://huggingface.co/openbmb/MiniCPM5-2B-Midtrain) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-Midtrain) · BF16 中间训练检查点(SFT 之前)
- MiniCPM5-2B-Base (https://huggingface.co/openbmb/MiniCPM5-2B-Base) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-Base) · BF16 基础检查点(仅预训练)
- MiniCPM5-2B-GGUF (https://huggingface.co/openbmb/MiniCPM5-2B-GGUF) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-GGUF) · 适用于 llama.cpp / Ollama / LM Studio 的 GGUF 👈 您正在此处
- MiniCPM5-2B-MLX (https://huggingface.co/openbmb/MiniCPM5-2B-MLX) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-MLX) · 适用于 Apple Silicon 的 MLX / 4bit 版本
- MiniCPM5-2B-GPTQ (https://huggingface.co/openbmb/MiniCPM5-2B-GPTQ) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-GPTQ) · GPTQ / 4bit 量化模型
- MiniCPM5-2B-DSpark (https://huggingface.co/openbmb/MiniCPM5-2B-DSpark) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-DSpark) · 用于推理加速的 DSpark 草稿模型
- MiniCPM5-2B-DSpark-GGUF (https://huggingface.co/openbmb/MiniCPM5-2B-DSpark-GGUF) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-2B-DSpark-GGUF) · DSpark 草稿模型的 GGUF 版本
- MiniCPM5-2B-LiteRT (https://huggingface.co/litert-community/MiniCPM5-2B) · ModelScope (https://www.modelscope.cn/models/litert-community/MiniCPM5-2B) · MiniCPM5-2B 的 LiteRT-LM 版本
MiniCPM5-1B
- MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B) · BF16 最终发布版(经 RL + OPD 后训练)
- MiniCPM5-1B-SFT (https://huggingface.co/openbmb/MiniCPM5-1B-SFT) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-SFT) · BF16 仅 SFT 检查点(RL / OPD 之前)
- MiniCPM5-1B-Base (https://huggingface.co/openbmb/MiniCPM5-1B-Base) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-Base) · BF16 基础检查点(仅预训练)
- MiniCPM5-1B-GGUF (https://huggingface.co/openbmb/MiniCPM5-1B-GGUF) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-GGUF) · 适用于 llama.cpp / Ollama / LM Studio 的 GGUF
- MiniCPM5-1B-MLX (https://huggingface.co/openbmb/MiniCPM5-1B-MLX) · ModelScope (https://www.modelscope.cn/models/OpenBMB/MiniCPM5-1B-MLX) · 适用于 Apple Silicon 的 MLX / 4bit 版本
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#model-information模型信息
MiniCPM5-2B 具有以下特征:
- 类型:因果语言模型
- 架构:标准
LlamaForCausalLM - 参数数量:2,516,756,480
- 非嵌入参数数量:1,981,982,720
- 层数:42
- 注意力头数 (GQA):Q 为 16 个,KV 为 2 个
- 上下文长度:131,072
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#introduction简介
MiniCPM5-2B 是 MiniCPM5 系列中的第二个模型。它专为本地助手、编码智能体、工具使用工作流以及偏好紧凑模型的推理场景而设计。该模型在保持较小部署占用空间的同时,提供原生的长上下文支持。
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#evaluation-results评估结果
我们将 MiniCPM5-2B 与同尺寸类别中的强力开源模型进行了比较,包括 LFM2.5-2.6B、Qwen3.5-2B 和 Gemma-4-E2B-it,同时列出了 Qwen3.5-4B、granite-4.2-3B、Nemotron-3-Nano-4B、Gemma-4-E4B-it 和 LFM2.5-8B-A1B 等更大模型作为参考。
在此对比集内,MiniCPM5-2B 以 53.9 的平均分达到了 2B 级开源 SOTA,并且超过了此处包含的所有更大模型(最高分为 51.1)。其在代码推理、数学推理、长上下文理解、工具使用以及多项智能体任务中的优势最为明显。
MiniCPM5-2B 与基线模型评估结果
| 模型 | MiniCPM5-2B | LFM2.5-2.6B | Qwen3.5-2B | Gemma-4-E2B-it | Qwen3.5-4B | granite-4.2-3B | Nemotron-3-Nano-4B | Gemma-4-E4B-it | LFM2.5-8B-A1B | 平均 |
|---|---|---|---|---|---|---|---|---|---|---|
| 平均分 | 53.9 | 33.2 | 28.0 | 24.6 | 51.1 | 42.7 | 32.6 | 31.2 | 28.4 | |
| 代码推理 | ||||||||||
| LiveCodeBench v6 | 69.1 | 42.1 | 20.2 | 42.9 | 56.4 | 58.9 | 50.7 | 53.9 | 39.8 | |
| LCB-Pro 25Q2 (Easy) | 68.0 | 30.9 | 10.3 | 27.1 | 58.3 | 54.6 | 51.6 | 45.8 | 27.8 | |
| LCB-Pro 25Q2 (Medium) | 17.5 | 0.0 | 0.0 | 0.0 | 7.0 | 5.3 | 5.3 | 1.8 | 0.0 | |
| OJBench | 32.5 | 11.2 | 2.6 | 11.6 | 24.8 | 21.8 | 20.0 | 19.0 | 8.2 | |
| SciCode (wbg) | 26.3† | 14.2† | 2.8† | 20.9† | 16.1† | 24.9† | 16.4† | 24.4† | 7.8† | |
| 数学推理 | ||||||||||
| AIME 2025 | 86.5 | 41.9 | 29.6 | 31.7 | 78.8 | 79.4 | 56.3 | 37.1 | 46.0 | |
| AIME 2026 | 86.5 | 45.2 | 29.0 | 39.8 | 82.7 | 83.5 | 62.1 | 45.0 | 56.7 | |
| HMMT Feb 2026 | 63.8 | 33.7 | 20.5 | 17.8 | 64.0 | 60.8 | 51.3 | 30.1 | 38.5 | |
| MATH-500 | 94.6 | 89.6 | 85.8 | 85.4 | 99.0 | 97.0 | 91.6 | 88.2 | 93.2 | |
| 指令遵循 | ||||||||||
| IFBench | 66.3 | 59.0 | 46.0 | 25.7 | 59.0 | 73.0 | 58.3 | 28.3 | 51.0 | |
| IFEval | 86.7 | 93.4 | 77.5 | 31.4 | 90.2 | 93.7 | 88.0 | 44.4 | 90.8 | |
| Multi-IF | 71.8 | 76.8 | 57.1 | 40.3 | 73.6 | 75.9 | 65.9 | 45.9 | 71.4 | |
| 通用知识 | ||||||||||
| MMLU-Pro | 70.8 | 65.2 | 64.3 | 56.0 | 78.0 | 65.8 | 65.7 | 68.3 | 63.1 | |
| MMLU-Redux | 84.7 | 80.0 | 80.0 | 71.8 | 88.7 | 78.9 | 79.8 | 83.7 | 80.0 | |
| HLE | 8.9† | 6.2† | 2.6† | 4.8† | 9.9† | 6.6† | 4.9† | 3.8† | 6.9† | |
| GPQA-Diamond | 70.2† | 55.8† | 45.6† | 43.3† | 77.1† | 55.9† | 51.3† | 57.6† | 51.3† | |
| SuperGPQA | 40.8 | 26.2 | 38.6 | 30.3 | 52.8 | 39.9 | 37.8 | 38.7 | 34.5 | |
| 长上下文 | ||||||||||
| AA-LCR | 59.0† | 5.3† | 28.7† | 17.0† | 61.0† | 24.3† | 17.3† | 33.0† | 0.0† | |
| NoLiMa | 68.1 | 0.7 | 17.1 | 3.9 | 43.5 | 5.1 | 1.1 | 2.3 | 0.5 | |
| LongBenchPro | 44.8 | 23.7 | 8.2 | 42.2 | 58.4 | 34.8 | 27.9 | 53.5 | 19.6 | |
| LongBench v2 | 43.7 | 30.3 | 24.9 | 33.2 | 47.3 | 36.0 | 32.0 | 42.7 | 30.4 | |
| 工具使用 | ||||||||||
| τ3-Bench Banking | 20.8† | 7.2† | 2.1 | 3.9 | 6.8† | 5.6† | 1.2 | 4.1 | 3.4 | |
| τ2-Bench Telecom | 97.1 | 90.4 | 69.0 | †20.8† | 92.1† | 40.9 | 28.1 | †20.8† | 16.1† | |
| BFCL v4 | 66.6 | 61.1 | 43.6 | 36.6 | 56.8 | 52.2 | 43.7 | 47.0 | 49.2 | |
| 编码智能体 | ||||||||||
| SWE-bench Verified | 46.4 | 6.0 | 5.0 | 2.0 | 33.6 | 36.8 | 3.0 | 15.0 | 0.4 | |
| SWE-bench Pro | 14.4 | 0.6 | 0.8 | 0.0 | 28.2 | 12.3 | 0.1 | 3.3 | 0.4 | |
| Terminal-Bench v2.1 | 8.6† | 4.5† | 3.0† | 0.4† | 25.8† | 13.9† | 3.8† | 1.9† | 1.9† | |
| 搜索智能体 | ||||||||||
| BrowseComp-ZH | 43.5 | 9.8 | 18.2 | 4.7 | 39.6 | 21.1 | 3.3 | 7.0 | 13.2 | |
| BrowseComp Top100 | 39.7 | 13.7 | 19.3 | 6.0 | 33.3 | 19.0 | 4.7 | 6.3 | 9.7 | |
| GAIA Text-103 | 88.7 | 49.5 | 47.9 | 30.1 | 78.6 | 57.3 | 26.5 | 39.5 | 41.1 | |
| 通用智能体 | ||||||||||
| GDPval-AA v2 | 19.6† | 4.5 | 0.0 | 0.0 | 11.7 | 0.0 | †0.0 | 0.0 | 0.0 | |
| Claw-Gym | 59.2 | 19.3 | 25.5 | 31.3 | 51.6 | 60.0 | 33.7 | 37.9 | 2.7 | |
| WildClaw | 23.9 | 10.2 | 9.2 | 8.9 | 17.0 | 20.0 | 8.9 | 14.3 | 4.5 | |
| QwenClaw | 42.9 | 19.3 | 18.2 | 14.5 | 37.1 | 36.4 | 16.8 | 16.7 | 4.5 |
- 蓝色粗体表示该行所有模型(包括 4B 级模型)中的最佳结果;黑色粗体表示 2B 级模型中的最佳结果。
- 标有†的分数来自官方 Artificial Analysis 发布;其他所有分数均为内部复现。
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#training-recipe训练方案
MiniCPM5-2B 的训练是 UltraData 分层数据管理 (https://arxiv.org/pdf/2602.09003) 的一次全栈实践,涵盖三个阶段:基础训练、中间训练和后训练。
在 基础训练 期间,模型经历稳定训练和衰减训练,以构建核心语言能力和训练稳定性。随后进入 中间训练,以进一步强化目标能力并适应目标数据分布。训练语料库随模型一起发布,包括 Ultra-FineWeb (https://huggingface.co/datasets/openbmb/Ultra-FineWeb)、Ultra-FineWeb-L3 (https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3)、UltraX (https://huggingface.co/datasets/openbmb/UltraX-Preview)、UltraData-Code (https://huggingface.co/datasets/openbmb/UltraData-Code) 和 UltraData-Math (https://huggingface.co/datasets/openbmb/UltraData-Math)。
在 后训练 期间,我们分三步进行:SFT、RL 和 OPD。我们首先使用 400B tokens 的深度思考 SFT 来建立深度思考和通用聊天能力;SFT 数据发布为 UltraData-SFT-2605 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605),智能体 SFT 数据发布为 UltraData-SFT-Agent-2609 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609)。然后,我们为数学、代码、智能体任务、写作及相关领域训练专门的 RL 教师(相应数据也已开源为 UltraData-RL-2609 (https://huggingface.co/datasets/openbmb/UltraData-RL-2609)),并使用 基于策略的蒸馏 (OPD) 将这些教师的知识蒸馏回一个发布模型。
MiniCPM5-2B 训练方案 (https://raw.githubusercontent.com/OpenBMB/MiniCPM/main/assets/minicpm5/minicpm5_2b_training_recipe.jpg)
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#what-does-rl–opd-bringRL + OPD 带来了什么?
RL + OPD 是 MiniCPM5-2B 后训练的关键部分。在 RL 阶段,我们采用了 JustRL II (https://panhaoxuan.notion.site/justrl-ii-scaling-small-llms-to-128k-reasoning-with-a-critic) 中描述的基于评论家的算法,显著提高了训练稳定性,并在多个领域取得了显著提升。在以下基准测试中,RL + OPD 平均提升推理和通用能力 ↑10.96 分,智能体能力提升 ↑6.96 分。
OPD 融合了 RL 训练产生的 16 个专家模型的能力,包括 5 个智能体专家模型。在每个响应位置,我们计算学生和教师 logits 之间的全词汇表反向 KL 散度作为优势估计,替代了原始的基于验证的优势。OPD 直接重用训练每个 RL 教师时使用的提示作为蒸馏数据,因此无需构建额外的语料库。
MiniCPM5-2B RL + OPD 收益 (https://raw.githubusercontent.com/OpenBMB/MiniCPM/main/assets/minicpm5/minicpm5_2b_rl_opd_score_gains.png)
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#quickstart快速开始
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#vllmvLLM
pip install "vllm>=0.21"
vllm serve openbmb/MiniCPM5-2B --port 8000
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "openbmb/MiniCPM5-2B",
"messages": [{"role": "user", "content": "你是谁?请简要自我介绍。"}],
"max_tokens": 128,
"temperature": 1.0
}'
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#sglangSGLang
pip install "sglang[srt]>=0.5.16"
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000
curl http://localhost:30000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "openbmb/MiniCPM5-2B",
"messages": [{"role": "user", "content": "你是谁?请简要自我介绍。"}],
"max_tokens": 128,
"temperature": 1.0
}'
投机解码 (DSpark):我们还发布了 MiniCPM5-2B-DSpark (https://huggingface.co/openbmb/MiniCPM5-2B-DSpark),一个为 MiniCPM5-2B 训练的 DSpark 草稿模型。在 SGLang 中启用它,可以在保持目标模型输出不变的情况下加速解码:
python -m sglang.launch_server \
--model-path openbmb/MiniCPM5-2B \
--trust-remote-code \
--speculative-algorithm DSPARK \
--speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark \
--speculative-dspark-block-size 7 \
--port 30000
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#transformersTransformers
pip install -U "transformers>=5.6" accelerate torch
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "openbmb/MiniCPM5-2B"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id,
torch_dtype="auto",
device_map="auto",
)
messages = [{"role": "user", "content": "你是谁?请简要自我介绍。"}]
inputs = tokenizer.apply_chat_template(
messages,
tokenize=True,
add_generation_prompt=True,
enable_thinking=True,
return_dict=True,
return_tensors="pt",
).to(model.device)
outputs = model.generate(**inputs, max_new_tokens=128)
print(tokenizer.decode(outputs[0][inputs["input_ids"].shape[-1]:], skip_special_tokens=True))
推荐采样参数:temperature=1.0, top_p=0.95
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#tool-calling工具调用
对于工具/函数调用,SGLang 是推荐的后端。MiniCPM5-2B 发出 XML 风格的工具调用,SGLang 内置的 minicpm5 解析器会将其原生转换为 OpenAI 兼容的 tool_calls:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --port 30000 \
--tool-call-parser minicpm5 # 或:--tool-call-parser auto
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#github-cookbooks-and-agent-skillsGitHub 食谱与智能体技能
MiniCPM5-2B 使用 标准 LlamaForCausalLM 架构,因此主流推理引擎可以直接加载它:无需自定义内核,无需模型代码分叉。有关分步部署和微调说明,请使用以下 GitHub 食谱。智能体技能作为 GitHub 资源链接,供使用 Cursor / Claude Code 风格编码智能体的用户使用。
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#deployment部署
https://huggingface.co/openbmb/MiniCPM5-2B-GGUF#fine-tuning微调
相似文章
openbmb/MiniCPM5-2B
OpenBMB发布了MiniCPM5-2B,这是一个2B参数的密集Transformer模型,在设备端部署的同类模型中达到了最先进的性能,并提供了开源的高质量训练数据集。
@ModelScope2022: MiniCPM5-1B 现已完全开源,包含权重、训练数据和部署代码。1B参数,在Artificial Analysis上排名第一…
MiniCPM5-1B 已完全开源,包含权重、训练数据和部署代码;它在2B以下模型中取得最高评分,并可在边缘设备上运行。
MiniCPM5-1B
OpenBMB 发布了 MiniCPM5-1B,这是一个密集型1B参数Transformer模型,在开源1B级模型中达到SOTA,专为设备端部署设计,支持混合推理和长上下文。
@akshay_pachaar: 中国研究人员又做到了!OpenBMB刚刚开源了MiniCPM5-2B,一个用于推理的密集2B参数模型……
OpenBMB已经开源了MiniCPM5-2B,一个2B参数的AI模型,针对资源受限硬件优化,用于推理、编码和工具使用,在其尺寸类别中达到最先进的性能,并展示了有效的本地部署能力。
@AdinaYakup: MiniCPM5-1B 是 1B 参数级别中的一款令人印象深刻的发布!@OpenBMB https://huggingface.co/collections/openbmb/minicpm5… 1B …
MiniCPM5-1B 是 OpenBMB 推出的全新 1B 参数 AI 模型,具有 Think/No-Think 模式的混合推理能力、128K 上下文窗口、Apache 2.0 许可证,并可在多种硬件上运行。