Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA 新闻

摘要

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。

概览: * 得分 2%(1.79% 向上取整) * 排名 18/20,高于 Haiku 4.5 和 Minimax M2.7 * 整个基准测试耗时 70 小时 * 每项任务平均耗时 32 分钟 * 每项任务平均输出 token 数:44k 观点: * 其得分与 3.6 Plus 惊人地相似,这让我很好奇 3.6 Plus 与 27B 的架构有何不同。 * Qwen 3.6 27B 在社区中因冗长而名声不佳。但令人惊讶的是,其输出 token 数量与同类模型相当或更少。 方法: * Qwen 3.6 27B FP8,搭配 BF16 KV 缓存,启用推理模式,上下文窗口为 262k,运行在 VLLM 上。 * 模型在 RunPod 上的 1 块 RTX6000 pro Blackwell 上运行。 * 使用 mini-swe 智能体框架在 Modal 沙箱中运行。 * 每项任务仅运行 1 次 rollout(官方为 4 次)以节省时间,因此图片未显示分数范围。 * 成本根据 RunPod 按小时费率计算已完成的任务。 * 使用 Codex 5.5xhigh 来编排和监控整个基准测试运行。 [来源](https://xcancel.com/Youssofal_/status/2063672976982069413) 最佳开源模型 Kimi-k2.6 与前沿模型的性能相差甚远。大多数人甚至无法在本地运行 Kimi,而像 Qwen 3.6 27B 这样的模型只是本地版的“穷人的 SOTA”。看来要达到前沿性能需要巨大的模型规模。开始具备竞争力的模型往往会很快闭源。感觉本地模型并不会获胜。更像是一场“本地模型会输得多惨”的游戏。
查看原文

相似文章

Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。

Qwen 3.8 27b 即使在 Q3_xxs 下也很强大

Reddit r/LocalLLaMA

用户发现 Qwen 3.8 27b 在 Q3 量化下对编码任务非常高效,推理速度快,超越了之前的模型,尽管在日常对话中存在一些小问题。