@MiaAI_lab: 如果你主要使用本地大模型进行Hermes风格的智能体循环,这可能会让你惊讶:Qwen 3.6 35B 实际上 *击败* 了 Dee…
摘要
根据MiaAI Lab的基准测试,Qwen 3.6 35B 在工具密集型和编码相关工作流上优于DeepSeek v4 Flash。
查看缓存全文
缓存时间: 2026/06/30 07:37
如果你主要使用本地大语言模型来运行 Hermes 风格的智能体循环,以下结果可能会让你感到意外:
Qwen 3.6 35B 实际上超越了 DeepSeek v4 Flash ——尤其在工具密集型及编码相关工作流上。
你并没有错过什么。
完整结果
https://github.com/MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench…
MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench
来源:https://github.com/MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench
Qwen3.6-35B vs DSF4 工具评估基准测试
此评估基准测试对比了 Qwen3.6-35B(具体使用 Qwen3.6-35B-A3B-UD-Q8_K_XL GGUF 量化版本)与 DeepSeek-V4-Flash-DSpark 在工具调用和函数调用任务上的表现。
测试设置
所有基准测试均使用以下命令运行,并启用思考模式:
tool-eval-bench --seed 42 --trials 8 --hardmode --base-url http://localhost:8888
内容
| 文件 | 描述 |
|---|---|
Qwen3.6-35B-A3B-UD-Q8_K_XL.html | Qwen3.6-35B 模型的工具评估结果 |
DeepSeek-V4-Flash-DSpark.html | DeepSeek V4 Flash DSpark 模型的工具评估结果 |
DeepSeek-V4-vs-Qwen3.6-35B_comparison.html | 两个模型在所有基准维度上的并排对比 |
如何查看
在浏览器中打开任意 .html 文件,即可查看完整的基准测试结果,包含交互式表格和可视化图表。
许可证
MIT
相似文章
Qwen 3.8 27b 对比 Deepseek Flash
这篇文章对比了开源AI模型Qwen 3.8 (27B) 和 Deepseek Flash,讨论了基准测试,并寻求用户经验以评估它们的性能。
DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
Qwen3.6 是当前本地代理使用的最佳模型吗?
有用户报告称,Qwen3.6 35B A3B 在代理任务上优于 Gemma4 和 GLM 4.7 Flash REAP 等其他本地模型,不过偶尔仍会出现循环。
Qwen 3.6 27B 在 DeepSWE 上的表现
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。
Qwen 3.6 35B A3B 的热度绝非虚名!
作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。