当前 10B 以下 SOTA 模型(如 MiniCPM5-2B)搭配现代工具,能否超越 2025 年 3 月前的前沿模型(如 Grok 3、GPT-4o)?
摘要
本文探讨当前如 MiniCPM5-2B 这样的 10B 以下 AI 模型,通过现代工具增强,能否在日常使用中达到 2025 年 3 月前前沿模型(如 Grok 3 和 GPT-4o)的实际能力。
各位专家!我真的有这个问题,希望听听实际使用这些模型的人的普遍共识。LLMs 在基准测试和实际使用中都有很大进步。甚至 GPT-4o 和 Grok 3 已经足以用于一般聊天、搜索查询、角色扮演(RP)等。所以如果把那些模型放回今天,我觉得很多普通用户不会在“日常通用使用”中注意到巨大差异。那么 10B 以下 SOTA 实际进展如何?例如,MiniCPM5-2B 只有约 2.5B 参数,但拥有 131K 上下文,并在数学、编码、长上下文、工具使用和代理任务方面有强大当前表现。如果你将类似 MiniCPM5-2B 的模型(包括一个 abliterated/heretic 变体)与现代工具、工具调用、网络搜索、RAG/外部记忆、Python/代码执行、文件系统/浏览器、上下文管理、验证/重试循环结合,生成的助手系统能否真正达到那些 2025 年 3 月前前沿模型的实际能力?如果不能,它具体在哪些方面仍有不足?如硬推理、规划、编码、长期代理、知识、指令遵循等?我真的很希望得到基于实际使用情况的答案!另外声明:上图仅是一个粗略的基准参考,并非苹果对苹果的比较。我知道较旧的模型是在较旧的基准版本/任务和不同条件下评估的,而像 MiniCPM5-2B 这样的新模型则是在更新且通常更难的测试中评估的。Artificial Analysis 也随时间改变其智能指数的组成和方法。所以我认为这更像是菠萝对苹果,而非苹果对苹果。我主要是将其用作讨论的粗略参考点,而非声称分数直接证明等效智能。
相似文章
MiniCPM5-1B
OpenBMB 发布了 MiniCPM5-1B,这是一个密集型1B参数Transformer模型,在开源1B级模型中达到SOTA,专为设备端部署设计,支持混合推理和长上下文。
@patpcj: Fable-5/Mythos 今早发布了,我们在智能体搜索上测试了一下——结果它成了新的 SOTA。性能差距确实存在……
Fable-5/Mythos 在智能体搜索中达到了新的 SOTA,但自托管成本高昂;而开放权重的 Harness-1 以更少的查询限制提供了更具性价比的替代方案。
新 SOTA:Poetiq 使用自优化框架以 Gemini 3 Flash 超越 Opus 4.7 等模型
Poetiq 宣称使用配备 Gemini 3 Flash 的自优化框架实现了新的最先进编码性能,超越了 Opus 4.7。
结合Computer Use与表现优异的前沿模型的AI框架——非文件/浏览器使用讨论,非MCP讨论,仅模型与训练讨论
讨论了一种将Computer Use与前沿模型相结合的AI框架,重点在于模型能力和训练,而非文件/浏览器或MCP相关主题。
MiniCPM5-1B 表明小模型竞赛尚未结束
MiniCPM5-1B 是 OpenBMB 推出的一个拥有 10 亿参数的模型,在 AIME 2025 和 τ2-Bench Telecom 上取得了令人瞩目的成绩,超越了更大的模型。它从单个检查点同时提供快速模式和推理模式,这得益于包括监督微调、强化学习和在线策略蒸馏在内的三阶段后训练过程。