@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……
摘要
一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。
查看缓存全文
缓存时间: 2026/06/17 01:42
疯狂的模型!它实际上使用了旧的 Qwen2.5-Coder-3B 架构,并通过它们的后训练流程取得了非常出色的性能。接下来几天需要实际用一下,看看 VibeCoder 的体验在实践里是否真的成立。但第一印象令人印象深刻!
根据技术报告,它们的后训练流程中一些重要环节包括:
-
高信号合成数据(有可靠解答的数学问题、附测试的代码)
-
每个答案的多种推理路径
-
过滤、过滤、再过滤
-
两阶段 SFT(先进行广泛训练,再在困难的长推理样本上训练)
-
基于目标(pass@k)准确率而非验证损失来选择检查点
-
用于 RLVR 的 MGPO(最大熵引导策略优化):基本是 GRPO 风格的 RL 方法,但额外加权,倾向于当前策略既不太容易也不太难的样本
-
单次 64k 长上下文 RL(他们发现常规的渐进式上下文扩展会损害该模型,因为早期截断破坏了长思考行为)
-
训练数据顺序:他们按照数学 RL、代码 RL、STEM RL 的顺序进行,发现这种顺序对整体效果有帮助
-
优化准确率后,他们会增加一个阶段,奖励更短的正确答案轨迹;基本上让模型在准确率不下降的情况下更高效
orcus108 (@orcus108): AI 界到底发生了什么?
一个 3B 参数模型居然在编程基准测试中与 Claude Opus 4.5 达到了同一水准。
30 亿参数。
权重已发布在 Hugging Face,任何人都可以测试。
我真的不知道这是突破,还是基准测试出了问题。
相似文章
@xdotli: 我的朋友 @xeophon 认为编码问题已经解决了,这里有一个验证:一个3B模型接受了以算法效率为重点的训练……
Nanbeige 4.1,一个3B模型,在编码任务中专注于算法效率,超越了Qwen3-30b-A3b和Qwen 3.5 4b,实现了600多次工具调用的长时任务。
@f14bertolotti:一款3B模型的出色表现。这些成果主要通过对Qwen2.5进行训练后优化而实现……
本技术报告介绍了VibeThinker-3B,一个3B参数的模型,通过对Qwen2.5-Coder进行训练后优化(包括基于课程的有监督微调、多域强化学习和离线自蒸馏),实现了前沿水平的可验证推理性能,达到或超越了DeepSeek V3.2等更大的模型。
Qwen3.6-27B:27B稠密模型实现旗舰级代码能力
Qwen发布Qwen3.6-27B,这款27B稠密模型号称代码性能达到旗舰水准,甚至超越更大的Qwen3.5-397B-A17B MoE,并展示了令人惊艳的SVG生成演示。
@KyleHessling1: 大家好,再次见面!我们又有一个非常有趣的9b,这个专门为工具调用和智能体编码…
发布了名为Qwopus3.5-9B-Coder的新型9B微调模型,该模型针对工具调用和智能体编码工作流进行了优化,在SWE-bench和HermesAgent-20测试中取得了出色成绩,同时可在经济实惠的硬件上运行。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。