@witcheer:这是我测量到的第一个能提升实际Bug修复的Qwen3.6-27B编码调优(!!!)。 - 质量(MMLU/ARC/HellaS…)
摘要
一个Qwen3.6-27B的社区微调在SWE-bench上提升了实际Bug修复能力,同时保持了质量,这与导致退化的合成蒸馏不同。
这是我测量到的第一个能提升实际Bug修复的Qwen3.6-27B编码调优(!!!)。
- 质量(MMLU/ARC/HellaSwag/GSM8K/HumanEval):93.3对比基准94.0。持平。
- 智能体分数(原生工具调用,40个任务):98.0对比基准98.6。持平。
- 实际Bug(SWE-bench Verified,30个,官方测试框架):20/30对比基准19/30。提升。它能解决基准无法解决的2个,且放弃更少(6个空补丁对比8个)。
- MTP起草器:2.0到2.4倍,对比基准1.8到2.2倍。微调保留了其起草器。
这是我测评的第三个Qwen3.6-27B编码调优。另外两个是在合成智能体轨迹上蒸馏的,两者在实际Bug上都退化了。
~~~
在所有三个中,合成智能体分数处于2.4分的区间(97.6到100),而实际SWE范围是11到20。
低级评估轴无法区分它们。
pi-tune甚至是组中质量最低但实际解决能力最好的。真实能力追踪的是训练数据,而不是智能体编码器标签:真实轨迹提升了它,合成蒸馏削弱了它。
只有现实锚点才能看到差异。
查看缓存全文
缓存时间: 2026/06/17 16:00
这是我测量的第一个能提升实际Bug修复能力的Qwen3.6-27B编码微调版本(!!!)。
- 质量(MMLU/ARC/HellaSwag/GSM8K/HumanEval):93.3 vs 基准94.0。持平。
- 智能体评分(原生工具调用,40个任务):98.0 vs 基准98.6。持平。
- 实际Bug(SWE-bench Verified,30个,官方测试框架):20/30 vs 基准19/30。提升。它能解决2个基准无法处理的Bug,且放弃更少(6个空补丁 vs 8个)。
- MTP起草器:2.0至2.4倍 vs 基准1.8至2.2倍。微调保留了起草器。
这是我测评的第三个Qwen3.6-27B编码微调版本。前两个是在合成智能体轨迹上蒸馏的,并且都在实际Bug上退步。
所有三个版本的合成智能体评分都在2.4个百分点的区间内(97.6到100),而实际SWE范围却是11到20。
便宜的评估轴无法区分它们。
pi-tune甚至是该组中质量最低的,但实际解决能力却是最好的。真实能力反映了训练数据,而非智能体编码标签:真实轨迹提升了它,合成蒸馏却局限了它。
只有现实锚点才能看出差异。
> **通义实验室(@Ali_TongyiLab):**
> 我们很高兴推出一款优秀的社区模型,来自开发者:Qwen3.6-27B-MTP-pi-reasoning-GGUF。
>
> 该版本基于我们的Qwen3.6-27B基础模型,专注于优化本地编码智能体的自动编程和调试工作流程。
>
> 如果您正在探索本地
相似文章
好的,我们有了Qwen3.8-27B。现在轮到社区来让它变得更好更快。
社区关于Qwen3.8-27B发布的讨论,重点关注与Qwen3.6-27B和Qwen3.5-27B等前版本的性能比较、内存使用和创意写作能力。
@malikwas1f: 首次对 @Alibaba_Qwen qwen 3.6 27b 进行微调以提升其质量。@migtissera https://github.com/noonghunn…
宣布首次微调阿里巴巴 Qwen 3.6 27B 以提升其质量,并附有一个 GitHub 仓库(club-3090),提供在 RTX 3090 上本地运行大型语言模型的指南。
在Mac Studio 96GB上运行Qwen3.5-122B:修复了3个使长上下文推理变得可用的bug
修复了qMLX分支中运行Qwen3.5-122B的三个bug,将长上下文推理的预填充时间从几分钟降低到亚秒级;开源了该分支和基准测试脚本。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。
Qwen3.8-27B 与 Qwen3.6-27B 完全相同!
Qwen3.8-27B 在架构上与 Qwen3.6-27B 完全相同,所有能力提升都归功于训练改进。