Qwen 3.6 27B 在 DeepSWE 上的表现
摘要
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。
概览:
* 得分 2%(1.79% 向上取整)
* 排名 18/20,高于 Haiku 4.5 和 Minimax M2.7
* 整个基准测试耗时 70 小时
* 每项任务平均耗时 32 分钟
* 每项任务平均输出 token 数:44k
观点:
* 其得分与 3.6 Plus 惊人地相似,这让我很好奇 3.6 Plus 与 27B 的架构有何不同。
* Qwen 3.6 27B 在社区中因冗长而名声不佳。但令人惊讶的是,其输出 token 数量与同类模型相当或更少。
方法:
* Qwen 3.6 27B FP8,搭配 BF16 KV 缓存,启用推理模式,上下文窗口为 262k,运行在 VLLM 上。
* 模型在 RunPod 上的 1 块 RTX6000 pro Blackwell 上运行。
* 使用 mini-swe 智能体框架在 Modal 沙箱中运行。
* 每项任务仅运行 1 次 rollout(官方为 4 次)以节省时间,因此图片未显示分数范围。
* 成本根据 RunPod 按小时费率计算已完成的任务。
* 使用 Codex 5.5xhigh 来编排和监控整个基准测试运行。 [来源](https://xcancel.com/Youssofal_/status/2063672976982069413)
最佳开源模型 Kimi-k2.6 与前沿模型的性能相差甚远。大多数人甚至无法在本地运行 Kimi,而像 Qwen 3.6 27B 这样的模型只是本地版的“穷人的 SOTA”。看来要达到前沿性能需要巨大的模型规模。开始具备竞争力的模型往往会很快闭源。感觉本地模型并不会获胜。更像是一场“本地模型会输得多惨”的游戏。
相似文章
Qwen 3.7 Max 在 SWE-Bench Pro 上取得了 60.6% 的得分
Qwen 3.7 Max 在 SWE-Bench Pro 上取得了 60.6% 的得分,展现了在软件工程任务上的竞争力。
Qwen3.7 Max在Artificial Analysis评测中得分,27B/35B等待室
Qwen3.7 Max在Artificial Analysis基准测试中排名第五,与GPT-5.4持平,并超越了刚发布的Gemini 3.5 Flash,而Qwen3.6 27B则明显落后。
Qwen 3.8 27B 在 Artificial Analysis Intelligence Index 上获得 52 分
在 Simon Willison 的博客文章中强调,Qwen 3.8 27B AI 模型在 Artificial Analysis Intelligence Index 上取得了 52 分。
Qwen 3.8 27B Aider 得分
用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。
Qwen 3.8 27b 即使在 Q3_xxs 下也很强大
用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。