Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!
摘要
Qwen3.6-35B-A3B 和 Qwen3.5-9B 模型已正式登上 Terminal-Bench 2.0 排行榜,其中 little-coder 在 35B 变体上取得 24.6% 的成绩,超越了 Gemini 2.5 Pro 和 Qwen3-Coder-480B;而 9B 模型则表明,10B 以下的本地模型能够与高难度代理基准竞争。
Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!little-coder × Qwen3.6-35B-A3B 达到了 24.6%(±3.2),**目前位列 Gemini 2.5 Pro 在 Gemini CLI 上的成绩(19.6%)** 以及 Qwen3-Coder-480B 在 Terminus 2 上的成绩(23.9%)之上。我没想到来自 Polyglot 的脚手架-模型差距会在如此困难的基准测试中依然成立,但它确实做到了!little-coder × Qwen3.5-9B 取得了 9.2% 的成绩,这个数字比较谦虚。然而,这也再次表明 **10B 以下的本地模型现在可以在高难度代理基准上进行评估**,而不被认为不值得一个位置。我只是觉得按照您的要求在这里跟进是正确的,并真诚感谢这个社区。它确实是当前推动创新、减少计算资源的社区,而这次运行之所以存在,正是因为有你们的推动。现在是时候冲向排行榜顶端了 👀 让我们一起开源吧!https://github.com/itayinbarr/little-coder
相似文章
Qwen 3.6 35B A3B 的热度绝非虚名!
作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。
Qwen 3.8 27B Aider 得分
用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。
Qwen3.7 Max在Artificial Analysis评测中得分,27B/35B等待室
Qwen3.7 Max在Artificial Analysis基准测试中排名第五,与GPT-5.4持平,并超越了刚发布的Gemini 3.5 Flash,而Qwen3.6 27B则明显落后。
Qwen 3.6 27B 在 DeepSWE 上的表现
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。
gemma-4-12b-it vs Qwen3.5-9B 在共同基准测试中的对比:Qwen 在 5/8 项基准测试中击败 gemma,虽体积更小但总体胜出
Qwen3.5-9B 在 8 项基准测试中的 5 项中优于 gemma-4-12b-it,尽管模型体积更小。gemma 仅在编程能力上略胜一筹。