@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
摘要
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
查看缓存全文
缓存时间: 2026/06/16 11:53
3B 模型的卓越表现。这些结果主要通过 Qwen2.5-Coder 的后训练优化实现。论文未提供过多细节,但似乎是先从强化学习检查点中进行蒸馏,再进行基于强化学习的指令微调。
🔗https://t.co/FmdRwGNMOg https://t.co/QPez8Ddbgp
VibeThinker-3B:探索小型语言模型中可验证推理的前沿
来源:https://arxiv.org/html/2606.16140
摘要
本技术报告介绍了 VibeThinker-3B,这是一个紧凑型密集模型,拥有 3B 参数,旨在探究在严格的小模型框架内,可验证推理能推进到何种程度。基于“频谱到信号”后训练范式,我们通过一条优化后的流水线系统地增强模型,该流水线包括基于课程的监督微调、多领域强化学习和离线自蒸馏。实验评估表明,VibeThinker-3B 在要求极高的可验证任务上达到了前沿水平。具体而言,它在 AIME26 上获得了 94.3 分(采用声明级测试时扩展提升至 97.1),在 LiveCodeBench v6 上取得了 80.2 的 Pass@1,并在最近的未见 LeetCode 竞赛中展现出强大的分布外泛化能力,接受率达到 96.1%。这实际上使其跻身于一流推理系统的性能区间,匹配甚至超越参数规模大数个数量级的旗舰模型,如 DeepSeek V3.2、GLM-5 和 Gemini 3 Pro。此外,IFEval 上的 93.4 分证实,这种极端的推理增强并未损害严格的指令可控性。延续我们之前 1.5B 模型的工作,这些发现引出了“参数压缩-覆盖假设”,该假设将可验证推理视为可压缩为紧凑推理核心的产物,而开放领域知识和通用能力则需要在大范围的事实、概念和长尾场景上进行参数覆盖。这一视角表明,紧凑型模型不仅仅是部署效率更高的替代品,更是通往参数密集能力范围内前沿性能的补充路径。
参见图注图 1:VibeThinker-3B 在 3B 规模下达到了前沿推理性能。CLR 表示声明级可靠性评估,一种声明级测试时扩展策略。参见图注图 2:在 IMO-AnswerBench(一个包含 400 道 IMO 级别问题的高要求基准测试)上,公开参数数量的开源推理模型之间的参数效率。VibeThinker-3B 仅用 3B 参数就达到了 76.4,借助 CLR 达到 80.6,证明严格的小模型框架可以进入参数规模大得多的模型的性能范围,如 DeepSeek V3.2(78.3,671B)、GLM-5(82.5,744B)和 Kimi K2.5(81.8,1T)。## 1 引言
随着强化学习[32 (https://arxiv.org/html/2606.16140#bib.bib1),44 (https://arxiv.org/html/2606.16140#bib.bib2),47 (https://arxiv.org/html/2606.16140#bib.bib3),18 (https://arxiv.org/html/2606.16140#bib.bib4)]日益融入语言模型的后训练阶段,大型模型的复杂逻辑推理能力已显著提升。当前,学术界普遍遵循缩放定律,通过增加参数规模来跨越困难推理任务所需的门槛。因此,前沿推理能力往往集中在拥有数百亿或数千亿参数的模型上。相比之下,参数在 3B 或更少的小型语言模型(SLM)在部署成本、推理效率以及学术研究的更广泛可及性方面具有明显优势,但一般认为它们在处理复杂数学推导或编程任务时面临着固有瓶颈。
我们之前在 VibeThinker-1.5B[42 (https://arxiv.org/html/2606.16140#bib.bib5)]上的工作表明,即使参数数量极小的模型也能被激发产生稳定且基础的逻辑链。这是对“小型模型难以进行长距离推理”这一普遍观点的初步挑战。然而,1.5B 模型主要展示了小型模型中进行推理的可行性,其上限仍有待探索。这引导我们思考一个更深层的问题:与其仅仅将 SLM 视为节省计算资源的后备方案,它们真正的能力边界在哪里?一个严格的 3B 模型是否真的能达到与顶尖大语言模型(LLM)相当的前沿性能?因此,在本报告中,我们呈现 VibeThinker-3B 的实证观察,以进一步检验 3B 规模下复杂可验证推理的极限。
为了进一步释放 3B 模型的推理能力,我们在 VibeThinker-1.5B 引入的“频谱到信号”原则基础上,系统性地升级了后训练流水线。在 SFT 阶段,我们加强了数据合成、质量过滤和课程学习,使模型首先获得数学、代码、STEM、通用对话和指令遵循方面的广泛覆盖,然后再聚焦于更困难的长期推理样本。在 RL 阶段,我们保留了 MGPO[42 (https://arxiv.org/html/2606.16140#bib.bib5)]的核心思路,同时将训练扩展到多个可验证领域,并采用更稳定的长上下文策略以保留完整的推理轨迹。我们进一步引入了 Long2Short 数学 RL,通过减少冗余 token 来提高推理效率,同时不牺牲准确性。最后,离线自蒸馏和 Instruct RL 将不同阶段获取的能力整合到一个统一的模型中,并提高了其在复杂、约束严格的用户指令下的可控性。与 VibeThinker-1.5B 相比,VibeThinker-3B 因此不仅代表了参数规模的适度增长,更代表了一个更完整的后训练系统,该系统共同解决了能力构建、推理增强、效率优化和指令对齐等问题。
在严格的去污染措施下,跨多个独立竞赛系统的广泛评估证实了 VibeThinker-3B 卓越的参数效率,并确保我们的发现并非局限于单一基准测试。虽然它持续优于现有的大小型推理模型,但其最重要的成就是展示了与参数规模大数个数量级的一流系统竞争的能力。尽管仅有 3B 参数,VibeThinker-3B 在 AIME26[24 (https://arxiv.org/html/2606.16140#bib.bib51)]上获得 94.3 分,与 DeepSeek V3.2[20 (https://arxiv.org/html/2606.16140#bib.bib26)](671B)和 Kimi K2.5[34 (https://arxiv.org/html/2606.16140#bib.bib27)](1T)等规模大得多的模型性能相当。它在 HMMT25[17 (https://arxiv.org/html/2606.16140#bib.bib53)]上也获得 89.3 分,并在 LiveCodeBench[19 (https://arxiv.org/html/2606.16140#bib.bib48)]v6 上取得 80.2 的 Pass@1,紧随 GPT-OSS-120B 和 DeepSeek V3.2 之后。此外,我们采用了声明级可靠性评估(CLR)这一测试时扩展策略,在可验证答案的数学基准上取得了额外收益,将其 AIME26 分数提升至 97.1,HMMT25 提升至 95.4,BruMO25[8 (https://arxiv.org/html/2606.16140#bib.bib52)]提升至 99.2。除了标准基准测试,VibeThinker-3B 还展现出强大的分布外泛化能力,在最近的 LeetCode 周赛和双周赛(2026.04.25–2026.05.31)中达到 96.1% 的接受率,这一通过率与 GPT-5.2[27 (https://arxiv.org/html/2606.16140#bib.bib41)]和 Gemini 3 Flash[14 (https://arxiv.org/html/2606.16140#bib.bib42)]等行业领先模型相当。延续 VibeThinker 系列的技术脉络,这些成就表明,严格的 3B 参数预算完全足以接近 Gemini 3 Pro、GLM-5 和 Kimi K2.5 等领先推理模型的性能范围,证明了紧凑型模型推理能力的边界远超传统预期。
受这些发现的启发,我们引入了“参数压缩-覆盖假设”,该假设认为基础模型能力不仅在所需的参数容量上有所不同,而且在参数需求的结构形式上也有所不同。根据这一观点,它们可以大致分为“参数密集型能力”和“参数扩张型能力”。可验证推理属于前者:其核心挑战不在于记忆大量开放领域的事实,而在于在结构化的解空间内执行搜索、约束满足、错误修正和多步组合。因此,这类能力可以被高度压缩成一个紧凑且可复用的推理核心。相反,知识密集型和通用型能力更接近后者,因为它们需要广泛覆盖开放领域的事实、特定领域的概念、语义关联和长尾场景。因此,它们的参数需求更像是一个覆盖问题,而不是一个可复用推理核心的压缩问题。这一视角阐明了为什么 VibeThinker-3B 在数学和编码等可验证任务上达到了与顶级系统相当的性能,而在 GPQA-Diamond 等知识密集型基准测试上仍与更大模型存在差距。
虽然参数缩放仍然是推动广泛模型能力的基本驱动力,但我们提出“推理-知识解耦范式”以揭示小型模型的专门化潜力。在此范式下,大规模模型继续作为广阔知识广度的自然载体,因为吸收多样化的语义和长尾分布本质上需要巨大的参数容量。相反,给定结构化的约束空间和可靠的训练信号,较小的模型已经足以封装高密度的推理深度。因此,VibeThinker-3B 的真正意义不在于证明一个 3B 模型可以取代大规模通才模型,而在于提供一个具体的实证信号:紧凑型模型的发展不再仅仅是为了部署效率或成本控制而做出的被动妥协;它正演变为一个充满希望的研究轨迹,从根本上与传统参数缩放范式互补。
参见图注图 3:VibeThinker-3B 的完整训练流水线。
2 方法
整体流水线。VibeThinker-3B 通过一个分阶段的后训练流水线开发,该流水线基于 Qwen2.5-Coder-3B 基础模型,这是一个紧凑的 3B 密集基础模型。我们的重点是通过数据合成、面向多样性的监督微调、多领域强化学习、离线自蒸馏和面向指令的对齐,系统性地激发和巩固推理能力。整体后训练框架延续了 VibeThinker-1.5B[42 (https://arxiv.org/html/2606.16140#bib.bib5)]中引入的“频谱到信号原则”(SSP)。基于我们之前工作的核心方法论,我们在 SFT 阶段继续采用“多样性探索蒸馏”来构建广泛的解空间(“频谱”),并在 RL 阶段使用“最大熵引导策略优化”(MGPO)来放大高价值推理信号(“信号”)。
对于这个 3B 迭代版本,我们基于原始基础全面优化了数据构建和整体训练流水线。如图 3 (https://arxiv.org/html/2606.16140#S1.F3) 所示,完整的后训练框架按阶段顺序展开。首先,在监督微调(SFT)阶段,我们升级了严格的数据合成和过滤流水线,从而支持引入两阶段课程学习策略。这使得模型能够从广泛的能力覆盖平稳过渡到深层的长期推理。随后,在强化学习(RL)阶段,我们将 MGPO 应用于多领域推理任务,利用显著扩展的上下文窗口;此外,在数学 RL 阶段,我们引入了 Long2Short 阶段,旨在优化推理效率而不牺牲准确性。在核心推理 RL 完成后,流水线立即进入离线自蒸馏阶段,以回馈新激发的能力,最后以 Instruct RL 阶段结束,进一步加强模型对复杂的多步骤指令的严格遵守。后续小节将系统阐述每个阶段的详细实现。
2.1 监督微调
2.1.1 数据构建
在 SFT 阶段,我们基于基础模型构建了一个多领域混合的监督数据集,为后续的 RL 阶段提供稳定的冷启动策略。该数据集涵盖多种任务,包括数学、代码、STEM 推理、通用对话和指令遵循。
数据合成与查询扩展。VibeThinker-3B 在 SFT 阶段引入了自动化数据合成流水线,以拓宽训练查询的覆盖范围。我们仅从现有数据集中选择具有可靠监督信号的查询作为种子查询:数学查询必须具有明确且可信的最终答案或解题思路,而竞赛编程查询必须配备可靠的单元测试或可执行的评估规则。基于这些高置信度的种子样本,我们在多个维度(例如概念组合、解题骨架、约束条件和评估目标)上重写并扩展查询,从而得到涵盖更广泛知识配置和推理模式的衍生查询。对于初步过滤后的合成查询,我们进一步使用强教师模型进行多次独立采样,并通过多数投票生成伪标签,为后续的蒸馏和训练奠定基础。
多路径推理蒸馏。对于数学、代码和 STEM 中推理密集型的样本,我们采用多路径蒸馏方法来构建 SFT 响应。具体而言,我们使用强教师模型为每个查询采样多个候选推理轨迹,保留完整的中间推理步骤,而不是只保留一个标准解法。这种设计继承了 VibeThinker-1.5B 的“频谱到信号”范式,即 SFT 阶段的任务是构建一个涵盖多种有效方法的解频谱,为后续的 RL 提供更广泛的候选解空间。通过明确保留这种多解结构,模型学习了各种分解方法、推导路径和验证策略,从而提高了后续在线策略采样期间的探索多样性。
多层次质量控制。SFT 数据的质量直接决定了后续 RL 的性能上限。因此,我们实施了更严格的多层次质量控制流程:
- •1) 基于 N-gram 的过滤。我们丢弃包含异常重复片段、模板化退化模式或与评估集存在 N-gram 重叠的样本,以去除低质量生成和基准测试污染。
- •2) 基于 LLM 的查询质量过滤。我们利用有能力的 LLM 评估查询质量,过滤掉描述不完整、条件不合理、逻辑无效或无法有效评估目标知识点的样本。
- •3) 轨迹正确性过滤。在蒸馏响应层面,我们对推理轨迹进行筛选
相似文章
WeiboAI/VibeThinker-3B
VibeThinker-3B 是一个拥有 3B 参数的模型,通过优化 Spectrum-to-Signal Principle (SSP) 后训练流程,在数学、编程和 STEM 基准测试上实现了前沿水平的推理性能,达到了与更大模型相当的性能。
VibeThinker-3B:探索小型语言模型中可验证推理的前沿
VibeThinker-3B是一款紧凑型3B参数量模型,通过专门的训练流程在可验证推理任务上实现了前沿水平的性能,与DeepSeek V3.2和Gemini 3 Pro等更大模型相当。
@kimmonismus: 太疯狂了:一个3B模型现在在可验证推理任务上取得了极具竞争力的结果。VibeThinker-3B得分94.3……
一个3B模型VibeThinker-3B通过在Qwen2.5-Coder上进行后训练优化,包括课程SFT、多领域RL、离线自我蒸馏以及最终的基于RL的指令阶段,在可验证推理任务上取得了极具竞争力的结果。
VibeThinker: 在推理上击败Opus 4.5的3B参数模型,采用新颖的SFT+GRPO方法
本技术报告介绍了VibeThinker-3B,一个3B参数的密集模型,在AIME26和LiveCodeBench等基准测试上实现了前沿水平的推理性能,通过结合基于课程的SFT、多领域RL和离线自蒸馏,匹配或超越了DeepSeek V3.2和GLM-5等更大的模型。
@cjzafir: 一个3B参数的小语言模型:VibeThinker(基于Qwen 2.5微调)性能媲美Claude Opus 4.5。性能与以下模型相当: > De…
VibeThinker是一个3B参数的模型,基于Qwen 2.5微调,通过创新的后训练方法(包括多路径思维和在数学、编程、科学上的分阶段训练),实现了与Claude Opus 4.5以及更大的模型(如DeepSeek v3)相当的性能。