Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!

Reddit r/LocalLLaMA 模型

摘要

Qwen3.6-35B-A3B 和 Qwen3.5-9B 模型已正式登上 Terminal-Bench 2.0 排行榜,其中 little-coder 在 35B 变体上取得 24.6% 的成绩,超越了 Gemini 2.5 Pro 和 Qwen3-Coder-480B;而 9B 模型则表明,10B 以下的本地模型能够与高难度代理基准竞争。

Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!little-coder × Qwen3.6-35B-A3B 达到了 24.6%(±3.2),**目前位列 Gemini 2.5 Pro 在 Gemini CLI 上的成绩(19.6%)** 以及 Qwen3-Coder-480B 在 Terminus 2 上的成绩(23.9%)之上。我没想到来自 Polyglot 的脚手架-模型差距会在如此困难的基准测试中依然成立,但它确实做到了!little-coder × Qwen3.5-9B 取得了 9.2% 的成绩,这个数字比较谦虚。然而,这也再次表明 **10B 以下的本地模型现在可以在高难度代理基准上进行评估**,而不被认为不值得一个位置。我只是觉得按照您的要求在这里跟进是正确的,并真诚感谢这个社区。它确实是当前推动创新、减少计算资源的社区,而这次运行之所以存在,正是因为有你们的推动。现在是时候冲向排行榜顶端了 👀 让我们一起开源吧!https://github.com/itayinbarr/little-coder
查看原文

相似文章

Qwen 3.6 35B A3B 的热度绝非虚名!

Reddit r/LocalLLaMA

作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。

Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。