Qwen 3.8 27B Aider 得分

Reddit r/LocalLLaMA 新闻

摘要

用户使用 Aider 对 Qwen 3.8 27B 进行基准测试,发现其得分为 72.9,与 Gemini 2.5 Pro 相当,并通过 vLLM 在 MacBook 上进行本地推理,优于其他最先进模型。

我使用 vLLM 对 Qwen 3.8 27B FP8 进行了 Aider 基准测试,使用了 FP8 KV cache 和 256K 上下文。得分:72.9 这与 2025-04-12 的 Gemini 2.5 Pro 相当,后者同样得分为 72.9。超越了 2025-05-25 的 Claude Opus 4,后者得分为 72.0。DeepSeek R1 2025-06-06 得分为 71.4。这可能只是一个随机的基准测试,而且还是旧的,但我的 MacBook 现在能够与这些仅一年多前的最先进模型相匹配,这仍然令人惊叹。在实际性能上,它也大幅超越了它们,因为测试工具得到了改进。我一直在使用 DeepSeek Harness,它显然能解决大部分甚至全部 Aider 测试,尽管会使用超过 2 轮对话。
查看原文

相似文章

Qwen 3.6 27B 太牛了

Reddit r/LocalLLaMA

一位用户分享了在本地使用 Qwen 3.6 27B 进行复杂研究和编程的积极体验,发现它在职业建议和移民研究方面优于 Gemini Pro,同时也提到 Gemma 4 31B 存在性能问题。

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。

Qwen 3.6 35B A3B 的热度绝非虚名!

Reddit r/LocalLLaMA

作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。