@rasbt: 疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过后训练取得了非常出色的性能……

X AI KOLs Following 模型

摘要

一个使用Qwen2.5-Coder-3B栈的3B参数模型,在编程基准测试中取得了与Claude Opus 4.5相媲美的分数,采用了详细的后训练技术,包括合成数据、过滤、两阶段SFT,以及一种新颖的RL方法(MGPO)。

疯狂模型!它实际上使用了旧的Qwen2.5-Coder-3B栈,并通过他们的后训练栈取得了非常出色的性能。 接下来几天需要实际使用它,看看VibeCoder的“氛围”在实际中是否奏效。但第一印象令人印象深刻! 根据技术报告,他们的后训练栈的一些重要组成部分: 1. 高信号合成数据(带有可信解决方案的数学问题,以及带测试的代码) 2. 每个答案的多个推理路径 3. 过滤,过滤,再过滤 4. 两阶段SFT(先进行广泛训练,然后在困难的长推理样本上训练) 5. 使用目标(pass@k)准确率而非验证损失来选择检查点 6. 用于RLVR的MGPO(最大熵引导策略优化):基本上是一种GRPO风格的RL方法,带有一个额外权重,偏好那些对当前策略既不太容易也不太难的例子 7. 单独的64k长上下文RL(他们发现通常的渐进式上下文扩展会损害这个模型,因为早期截断破坏了长思考行为) 8. 训练数据顺序:他们按照数学RL、代码RL、STEM RL的特定顺序进行,他们发现这样整体上有所帮助 9. 在优化准确率之后,他们增加了一个奖励更短正确轨迹的阶段;基本上在不降低准确率的情况下使模型更高效
查看原文
查看缓存全文

缓存时间: 2026/06/17 01:42

疯狂的模型!它实际上使用了旧的 Qwen2.5-Coder-3B 架构,并通过它们的后训练流程取得了非常出色的性能。接下来几天需要实际用一下,看看 VibeCoder 的体验在实践里是否真的成立。但第一印象令人印象深刻!

根据技术报告,它们的后训练流程中一些重要环节包括:

  1. 高信号合成数据(有可靠解答的数学问题、附测试的代码)

  2. 每个答案的多种推理路径

  3. 过滤、过滤、再过滤

  4. 两阶段 SFT(先进行广泛训练,再在困难的长推理样本上训练)

  5. 基于目标(pass@k)准确率而非验证损失来选择检查点

  6. 用于 RLVR 的 MGPO(最大熵引导策略优化):基本是 GRPO 风格的 RL 方法,但额外加权,倾向于当前策略既不太容易也不太难的样本

  7. 单次 64k 长上下文 RL(他们发现常规的渐进式上下文扩展会损害该模型,因为早期截断破坏了长思考行为)

  8. 训练数据顺序:他们按照数学 RL、代码 RL、STEM RL 的顺序进行,发现这种顺序对整体效果有帮助

  9. 优化准确率后,他们会增加一个阶段,奖励更短的正确答案轨迹;基本上让模型在准确率不下降的情况下更高效

orcus108 (@orcus108): AI 界到底发生了什么?

一个 3B 参数模型居然在编程基准测试中与 Claude Opus 4.5 达到了同一水准。

30 亿参数。

权重已发布在 Hugging Face,任何人都可以测试。

我真的不知道这是突破,还是基准测试出了问题。

相似文章

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。