VibeThinker-3B:探索小型语言模型中可验证推理的前沿
摘要
VibeThinker-3B是一款紧凑型3B参数量模型,通过专门的训练流程在可验证推理任务上实现了前沿水平的性能,与DeepSeek V3.2和Gemini 3 Pro等更大模型相当。
查看缓存全文
缓存时间: 2026/06/16 11:33
论文页面 - VibeThinker-3B:探索小型语言模型中可验证推理的前沿
来源: https://huggingface.co/papers/2606.16140
摘要
VibeThinker-3B 证明,通过专门的训练技术,紧凑型模型可以在可验证推理任务上实现最先进的性能,挑战了传统的缩放假设。
本技术报告介绍了 VibeThinker-3B,一个具有 30 亿参数的紧凑型密集模型,旨在探究在严格的小模型范围内,可验证推理 能够被推至何种极限。基于 从频谱到信号的训练后范式,我们通过一个优化的流水线系统性地提升了模型,该流水线包括:基于课程的监督微调、多领域强化学习 和 离线自蒸馏。实验评估表明,VibeThinker-3B 在极具挑战性的可验证任务上达到了前沿水平。具体而言,它在 AIME26 上获得了 94.3 分(采用声明级测试时扩展后提升至 97.1),在 LiveCodeBench v6 上达到了 80.2 的 Pass@1,并在近期未见过的 LeetCode 竞赛中表现出强大的分布外泛化能力,接受率达到 96.1%。这有效地使其跻身于第一梯队推理系统的性能区间,与规模大数个数量级的旗舰模型(如 DeepSeek V3.2、GLM-5 和 Gemini 3 Pro)相匹配或超越。此外,在 IFEval 上获得 93.4 分证实了这种极端的推理增强并未损害严格的指令可控性。在之前 1.5B 工作的基础上,这些发现推动了参数压缩-覆盖假设的形成,该假设将可验证推理视为可压缩到紧凑推理核心中,而开放领域知识和通用能力则需要覆盖事实、概念和长尾场景的广泛参数。这一观点表明,紧凑型模型不仅仅是部署高效的替代品,更是在参数密集型能力领域迈向前沿性能的互补路径。
查看 arXiv 页面 (https://arxiv.org/abs/2606.16140)查看 PDF (https://arxiv.org/pdf/2606.16140)项目页面 (https://github.com/WeiboAI/VibeThinker)GitHub577 (https://github.com/WeiboAI/VibeThinker)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.16140)
在你的代理中获取此论文:
hf papers read 2606\.16140
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
WeiboAI/VibeThinker-3B 文本生成• 3B• 更新于约4小时前 • 16 (https://huggingface.co/WeiboAI/VibeThinker-3B)
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.16140 以从此页面链接。
引用此论文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.16140 以从此页面链接。
包含此论文的收藏1
相似文章
WeiboAI/VibeThinker-3B
VibeThinker-3B 是一个拥有 3B 参数的模型,通过优化 Spectrum-to-Signal Principle (SSP) 后训练流程,在数学、编程和 STEM 基准测试上实现了前沿水平的推理性能,达到了与更大模型相当的性能。
VibeThinker: 在推理上击败Opus 4.5的3B参数模型,采用新颖的SFT+GRPO方法
本技术报告介绍了VibeThinker-3B,一个3B参数的密集模型,在AIME26和LiveCodeBench等基准测试上实现了前沿水平的推理性能,通过结合基于课程的SFT、多领域RL和离线自蒸馏,匹配或超越了DeepSeek V3.2和GLM-5等更大的模型。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
将原先的VibeThinker-1.5B扩展到3B——现已达到前沿数学与编程性能
VibeThinker-3B模型在数学和编程推理性能上达到了最先进水平,在AIME'26上得分为94.3,在未见过的LeetCode问题上正确率为96.1%,表明小模型在可验证领域可以达到前沿推理水平。
@kimmonismus: 太疯狂了:一个3B模型现在在可验证推理任务上取得了极具竞争力的结果。VibeThinker-3B得分94.3……
一个3B模型VibeThinker-3B通过在Qwen2.5-Coder上进行后训练优化,包括课程SFT、多领域RL、离线自我蒸馏以及最终的基于RL的指令阶段,在可验证推理任务上取得了极具竞争力的结果。