MiniCPM5-1B 表明小模型竞赛尚未结束

Reddit r/ArtificialInteligence 模型

摘要

MiniCPM5-1B 是 OpenBMB 推出的一个拥有 10 亿参数的模型,在 AIME 2025 和 τ2-Bench Telecom 上取得了令人瞩目的成绩,超越了更大的模型。它从单个检查点同时提供快速模式和推理模式,这得益于包括监督微调、强化学习和在线策略蒸馏在内的三阶段后训练过程。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/31 13:32

# MiniCPM5-1B 揭示小型模型竞赛远未结束 - Firethering 来源:https://firethering.com/minicpm5-1b-small-model-reasoning/ \- 广告 \- 一个拥有1B参数的模型在AIME 2025上取得40.42分,这按理说不应该发生。AIME是美国数学邀请赛,是一项能淘汰大多数人类参赛者的测试。Qwen3-0.6B在同一基准上得分16.25。更大的模型LFM2.5-1.2B得分31.88。而MiniCPM5-1B,约十亿参数,却击败了它们两个。 OpenBMB发布了MiniCPM5-1B,这是其MiniCPM5系列的首个模型,专为设备端部署、资源受限环境、消费级硬件本地推理等场景而构建。 AIME得分令人惊讶。电信智能体基准测试更令人惊讶。然后还有桌面宠物。我们稍后会谈到。 ## **一个检查点,两种性格** 大多数模型要么提供快速版本,要么提供推理版本。MiniCPM5-1B则从同一权重中同时提供两者。 将 enable_thinking 设置为 True,模型进入刻意推理模式,在回答前逐步解决问题。关闭它,你得到一个快速的对话助手。 在受限硬件上运行两个独立模型往往不切实际。拥有一个能根据任务自我调整、无需管理多个下载和上下文的模型,才是真正的便利。 推荐设置反映了两种模式的不同工作方式。思考模式使用温度0.9和top_p 0.95,为推理过程留出探索空间。非思考模式降至0.7,以获得更可预测、更聚焦的响应。两者都是合理的默认值,并可通过标准推理参数进行调整。 ## **解读这些数字的训练方案** OpenBMB公布了完整的训练堆栈,值得理解,因为它解释了为什么MiniCPM5-1B在特定任务上优于类似或更大尺寸的模型。 训练后处理分三个阶段进行:监督微调、强化学习和在线策略蒸馏。SFT阶段总共使用400B tokens,分为深度思考数据和混合思考数据,建立了基础的推理和对话能力。然后RL分别针对数学、代码、闭卷问答、写作和指令遵循训练了专门的教师模型。OPD随后将这些教师模型蒸馏回单一的发布模型。 RL加OPD的组合结果,相比仅SFT的检查点,平均分数提升了16点,同时达到最大token预算的响应比例下降了29个百分点。第二个数字与第一个同样重要。一个能够高效推理并在得到答案时停止的模型,在生产中比一个填充响应直到耗尽上下文的模型更有用。过长的响应浪费算力、拖慢推理,并且通常表明模型不确定而非考虑周全。 训练数据也与模型一起完全发布,称为Ultra-FineWeb、Ultra-FineWeb-L3、UltraData-Math和UltraData-SFT-2605,供任何想要研究或复现该方案的人使用。 ## **基准测试** minicpm5 1b evaluation resultsvia: MiniCPM5 1B HF最突出的基准并非AIME,而是τ2-Bench Telecom的79.53分。 τ2-Bench测试现实企业环境中多步骤智能体任务完成能力,特别是电信工作流,这些工作流以极其复杂和程序化著称。Qwen3-0.6B在同一基准上得分21.10。LFM2.5-1.2B得分19.60。MiniCPM5-1B几乎是它们的两倍。这个差距足够大,值得被视为真正的能力差异,而非基准噪音。 以下是能说明问题的几个相关基准的紧密对比: 基准MiniCPM5-1B(思考模式)Qwen3-0.6BQwen3.5-0.8BLFM2.5-1.2BAIME 202540.4216.251.0431.88AIME 202640.4212.290.2131.67MATH-50091.6072.6030.4089.00τ2-Bench Telecom79.5321.1047.7019.60IFEval80.4159.8959.8984.84BBH71.8947.8654.5857.32LCB-v633.5216.005.3321.33*所有数据来自OpenBMB的评估。自报告基准数据需注意这一前提。* 编程数字也值得注意。LCB-Pro Easy得分22.68,而Qwen3-0.6B为4.12,Qwen3.5-0.8B为零。OJBench得分7.33,而两个Qwen模型均低于1。这些是编程竞赛基准,在1B规模上的差距异常之大。 GPQA-Diamond得分26.26,落后于LFM2.5-1.2B的34.85,这是大型模型在困难科学推理上领先的最明显基准。 ##### **相关文章:**MiniCPM-V 4.6:在手机上运行、挑战更大模型的1.3B模型 (https://firethering.com/minicpm-v-4-6-on-device-multimodal-model/) ## **如何运行它,以及那个桌面宠物** MiniCPM5-1B使用标准的LlamaForCausalLM架构,这意味着主流推理引擎可以直接加载它,无需自定义内核或模型代码分支。Ollama、vLLM、SGLang、llama.cpp、LM Studio以及针对Apple Silicon的MLX都能开箱即用。对于工具调用,推荐使用SGLang作为后端,因为它通过内置解析器原生处理MiniCPM5的XML风格工具调用。 该模型在Hugging Face上以Apache 2.0许可证发布,这是最宽松的许可证之一。 现在说说桌面宠物。OpenBMB随模型一起发布了MiniCPM-Desk-Pet (https://github.com/OpenBMB/MiniCPM-Desk-Pet),这是一个完全由运行在你自己硬件上的MiniCPM5-1B驱动的本地桌面伴侣。它支持Apple Silicon、NVIDIA GPU和CPU路径,可与Cursor和Claude Code等编程智能体集成,并支持LoRA角色切换。看到一个严肃的推理模型发布时捆绑如此有趣的东西,实属罕见。这说明了OpenBMB的目标用户是谁:不仅仅是研究人员和企业团队,还有那些希望在本地运行强大AI、以他们觉得合适的任何形式使用的人们。 如果你正在评估用于本地部署、智能体工具使用或受限推理场景的小型模型,MiniCPM5-1B绝对值得考虑。

相似文章

MiniCPM5 1B - 这是什么?

Reddit r/LocalLLaMA

MiniCPM5-1B 是 OpenBMB 推出的一款新型小语言模型,据称是从头构建的,拥有自己的分词器和独特行为,作为一款功能强大的 1B 模型引发了热议。

MiniCPM5-1B

Reddit r/LocalLLaMA

OpenBMB 发布了 MiniCPM5-1B,这是一个密集型1B参数Transformer模型,在开源1B级模型中达到SOTA,专为设备端部署设计,支持混合推理和长上下文。