MiniCPM5-1B 表明小模型竞赛尚未结束
摘要
MiniCPM5-1B 是 OpenBMB 推出的一个拥有 10 亿参数的模型,在 AIME 2025 和 τ2-Bench Telecom 上取得了令人瞩目的成绩,超越了更大的模型。它从单个检查点同时提供快速模式和推理模式,这得益于包括监督微调、强化学习和在线策略蒸馏在内的三阶段后训练过程。
暂无内容
查看缓存全文
缓存时间: 2026/05/31 13:32
# MiniCPM5-1B 揭示小型模型竞赛远未结束 - Firethering
来源:https://firethering.com/minicpm5-1b-small-model-reasoning/
\- 广告 \-
一个拥有1B参数的模型在AIME 2025上取得40.42分,这按理说不应该发生。AIME是美国数学邀请赛,是一项能淘汰大多数人类参赛者的测试。Qwen3-0.6B在同一基准上得分16.25。更大的模型LFM2.5-1.2B得分31.88。而MiniCPM5-1B,约十亿参数,却击败了它们两个。
OpenBMB发布了MiniCPM5-1B,这是其MiniCPM5系列的首个模型,专为设备端部署、资源受限环境、消费级硬件本地推理等场景而构建。
AIME得分令人惊讶。电信智能体基准测试更令人惊讶。然后还有桌面宠物。我们稍后会谈到。
## **一个检查点,两种性格**
大多数模型要么提供快速版本,要么提供推理版本。MiniCPM5-1B则从同一权重中同时提供两者。
将 enable_thinking 设置为 True,模型进入刻意推理模式,在回答前逐步解决问题。关闭它,你得到一个快速的对话助手。
在受限硬件上运行两个独立模型往往不切实际。拥有一个能根据任务自我调整、无需管理多个下载和上下文的模型,才是真正的便利。
推荐设置反映了两种模式的不同工作方式。思考模式使用温度0.9和top_p 0.95,为推理过程留出探索空间。非思考模式降至0.7,以获得更可预测、更聚焦的响应。两者都是合理的默认值,并可通过标准推理参数进行调整。
## **解读这些数字的训练方案**
OpenBMB公布了完整的训练堆栈,值得理解,因为它解释了为什么MiniCPM5-1B在特定任务上优于类似或更大尺寸的模型。
训练后处理分三个阶段进行:监督微调、强化学习和在线策略蒸馏。SFT阶段总共使用400B tokens,分为深度思考数据和混合思考数据,建立了基础的推理和对话能力。然后RL分别针对数学、代码、闭卷问答、写作和指令遵循训练了专门的教师模型。OPD随后将这些教师模型蒸馏回单一的发布模型。
RL加OPD的组合结果,相比仅SFT的检查点,平均分数提升了16点,同时达到最大token预算的响应比例下降了29个百分点。第二个数字与第一个同样重要。一个能够高效推理并在得到答案时停止的模型,在生产中比一个填充响应直到耗尽上下文的模型更有用。过长的响应浪费算力、拖慢推理,并且通常表明模型不确定而非考虑周全。
训练数据也与模型一起完全发布,称为Ultra-FineWeb、Ultra-FineWeb-L3、UltraData-Math和UltraData-SFT-2605,供任何想要研究或复现该方案的人使用。
## **基准测试**
minicpm5 1b evaluation resultsvia: MiniCPM5 1B HF最突出的基准并非AIME,而是τ2-Bench Telecom的79.53分。
τ2-Bench测试现实企业环境中多步骤智能体任务完成能力,特别是电信工作流,这些工作流以极其复杂和程序化著称。Qwen3-0.6B在同一基准上得分21.10。LFM2.5-1.2B得分19.60。MiniCPM5-1B几乎是它们的两倍。这个差距足够大,值得被视为真正的能力差异,而非基准噪音。
以下是能说明问题的几个相关基准的紧密对比:
基准MiniCPM5-1B(思考模式)Qwen3-0.6BQwen3.5-0.8BLFM2.5-1.2BAIME 202540.4216.251.0431.88AIME 202640.4212.290.2131.67MATH-50091.6072.6030.4089.00τ2-Bench Telecom79.5321.1047.7019.60IFEval80.4159.8959.8984.84BBH71.8947.8654.5857.32LCB-v633.5216.005.3321.33*所有数据来自OpenBMB的评估。自报告基准数据需注意这一前提。*
编程数字也值得注意。LCB-Pro Easy得分22.68,而Qwen3-0.6B为4.12,Qwen3.5-0.8B为零。OJBench得分7.33,而两个Qwen模型均低于1。这些是编程竞赛基准,在1B规模上的差距异常之大。
GPQA-Diamond得分26.26,落后于LFM2.5-1.2B的34.85,这是大型模型在困难科学推理上领先的最明显基准。
##### **相关文章:**MiniCPM-V 4.6:在手机上运行、挑战更大模型的1.3B模型 (https://firethering.com/minicpm-v-4-6-on-device-multimodal-model/)
## **如何运行它,以及那个桌面宠物**
MiniCPM5-1B使用标准的LlamaForCausalLM架构,这意味着主流推理引擎可以直接加载它,无需自定义内核或模型代码分支。Ollama、vLLM、SGLang、llama.cpp、LM Studio以及针对Apple Silicon的MLX都能开箱即用。对于工具调用,推荐使用SGLang作为后端,因为它通过内置解析器原生处理MiniCPM5的XML风格工具调用。
该模型在Hugging Face上以Apache 2.0许可证发布,这是最宽松的许可证之一。
现在说说桌面宠物。OpenBMB随模型一起发布了MiniCPM-Desk-Pet (https://github.com/OpenBMB/MiniCPM-Desk-Pet),这是一个完全由运行在你自己硬件上的MiniCPM5-1B驱动的本地桌面伴侣。它支持Apple Silicon、NVIDIA GPU和CPU路径,可与Cursor和Claude Code等编程智能体集成,并支持LoRA角色切换。看到一个严肃的推理模型发布时捆绑如此有趣的东西,实属罕见。这说明了OpenBMB的目标用户是谁:不仅仅是研究人员和企业团队,还有那些希望在本地运行强大AI、以他们觉得合适的任何形式使用的人们。
如果你正在评估用于本地部署、智能体工具使用或受限推理场景的小型模型,MiniCPM5-1B绝对值得考虑。
相似文章
MiniCPM5 1B - 这是什么?
MiniCPM5-1B 是 OpenBMB 推出的一款新型小语言模型,据称是从头构建的,拥有自己的分词器和独特行为,作为一款功能强大的 1B 模型引发了热议。
@AdinaYakup: MiniCPM5-1B 是 1B 参数级别中的一款令人印象深刻的发布!@OpenBMB https://huggingface.co/collections/openbmb/minicpm5… 1B …
MiniCPM5-1B 是 OpenBMB 推出的全新 1B 参数 AI 模型,具有 Think/No-Think 模式的混合推理能力、128K 上下文窗口、Apache 2.0 许可证,并可在多种硬件上运行。
MiniCPM5-1B
OpenBMB 发布了 MiniCPM5-1B,这是一个密集型1B参数Transformer模型,在开源1B级模型中达到SOTA,专为设备端部署设计,支持混合推理和长上下文。
OpenBMB 发布 MiniCPM5-1B 大语言模型。目前同尺寸下最强大的大语言模型之一。(在 Artificial Analysis Intelligence Index 上得分为 17.9)
OpenBMB 发布 MiniCPM5-1B,这是一款领先的 1B 参数开源权重大语言模型,在同尺寸类别中取得了 Artificial Analysis Intelligence Index 最高分(17.9),超越了 Qwen3.5 2B 等更大模型,而使用的参数更少。
@ModelScope2022: MiniCPM5-1B 现已完全开源,包含权重、训练数据和部署代码。1B参数,在Artificial Analysis上排名第一…
MiniCPM5-1B 已完全开源,包含权重、训练数据和部署代码;它在2B以下模型中取得最高评分,并可在边缘设备上运行。