@TheAhmadOsman: 性能媲美Opus 4.5的3B模型VibeThinker 3B(基于Qwen 2.5)
摘要
Ahmad Osman宣布了VibeThinker 3B,这是一个基于Qwen 2.5的30亿参数模型,声称性能可与Claude Opus 4.5媲美,并预测可在消费级硬件上进行本地部署。
查看缓存全文
缓存时间: 2026/06/16 11:39
3B模型,性能堪比Opus 4.5
VibeThinker 3B(基于Qwen 2.5)https://t.co/pQIr2bC8IR
Ahmad(@TheAhmadOsman): 预测
今年年底前,我们将能在本地一台RTX PRO 6000上运行具备Claude Code + Opus 4.5品质(非阉割版)的模型。
相似文章
@cjzafir: 一个3B参数的小语言模型:VibeThinker(基于Qwen 2.5微调)性能媲美Claude Opus 4.5。性能与以下模型相当: > De…
VibeThinker是一个3B参数的模型,基于Qwen 2.5微调,通过创新的后训练方法(包括多路径思维和在数学、编程、科学上的分阶段训练),实现了与Claude Opus 4.5以及更大的模型(如DeepSeek v3)相当的性能。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
VibeThinker-3B:这是什么黑科技?在MathQA上表现如同拥有约300亿参数
VibeThinker-3B是一个仅有30亿参数的小模型,却在MathQA基准测试中达到了堪比约300亿参数模型的性能,展现了极高的效率。
VibeThinker: 在推理上击败Opus 4.5的3B参数模型,采用新颖的SFT+GRPO方法
本技术报告介绍了VibeThinker-3B,一个3B参数的密集模型,在AIME26和LiveCodeBench等基准测试上实现了前沿水平的推理性能,通过结合基于课程的SFT、多领域RL和离线自蒸馏,匹配或超越了DeepSeek V3.2和GLM-5等更大的模型。
Qwen 3.6 35B A3B 的热度绝非虚名!
作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。