@MiaAI_lab: 如果你主要使用本地大模型进行Hermes风格的智能体循环,这可能会让你惊讶:Qwen 3.6 35B 实际上 *击败* 了 Dee…

X AI KOLs Timeline 新闻

摘要

根据MiaAI Lab的基准测试,Qwen 3.6 35B 在工具密集型和编码相关工作流上优于DeepSeek v4 Flash。

如果你主要使用本地大模型进行Hermes风格的智能体循环,这可能会让你惊讶: Qwen 3.6 35B 实际上 *击败* 了 DeepSeek v4 Flash — 尤其是在工具密集型和编码相关工作流上。 你没有错过什么。 完整结果 https://github.com/MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench…
查看原文
查看缓存全文

缓存时间: 2026/06/30 07:37

如果你主要使用本地大语言模型来运行 Hermes 风格的智能体循环,以下结果可能会让你感到意外:

Qwen 3.6 35B 实际上超越了 DeepSeek v4 Flash ——尤其在工具密集型及编码相关工作流上。

你并没有错过什么。

完整结果

https://github.com/MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench…


MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench

来源:https://github.com/MiaAI-Lab/Qwen3.6-35b-vs-DSF4-tool-eval-bench

Qwen3.6-35B vs DSF4 工具评估基准测试

此评估基准测试对比了 Qwen3.6-35B(具体使用 Qwen3.6-35B-A3B-UD-Q8_K_XL GGUF 量化版本)与 DeepSeek-V4-Flash-DSpark 在工具调用和函数调用任务上的表现。

测试设置

所有基准测试均使用以下命令运行,并启用思考模式:

tool-eval-bench --seed 42 --trials 8 --hardmode --base-url http://localhost:8888

内容

文件描述
Qwen3.6-35B-A3B-UD-Q8_K_XL.htmlQwen3.6-35B 模型的工具评估结果
DeepSeek-V4-Flash-DSpark.htmlDeepSeek V4 Flash DSpark 模型的工具评估结果
DeepSeek-V4-vs-Qwen3.6-35B_comparison.html两个模型在所有基准维度上的并排对比

如何查看

在浏览器中打开任意 .html 文件,即可查看完整的基准测试结果,包含交互式表格和可视化图表。

许可证

MIT

相似文章

Qwen 3.8 27b 对比 Deepseek Flash

Reddit r/LocalLLaMA

这篇文章对比了开源AI模型Qwen 3.8 (27B) 和 Deepseek Flash,讨论了基准测试,并寻求用户经验以评估它们的性能。

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。

Qwen 3.6 35B A3B 的热度绝非虚名!

Reddit r/LocalLLaMA

作者对小型本地 LLM 进行了基准测试,重点突出了 Qwen 3.6 35B A3B,其将学术代码与研究论文进行映射的能力优于 Gemma 4 和 Nemotron 3 Nano 等模型。