Qwen 3.6 Q2-FP8 终端基准2和GPQA得分
摘要
本文报告了Qwen 3.6模型的基准测试结果,显示量化对知识基准(GPQA)影响很小,但会显著降低智能体性能(Terminal-Bench 2),并进一步讨论了超时设置和运行差异。
TL;DR:量化对智能体性能有显著影响,但对知识影响很小。我在一所大学管理一个小型HPC集群,最近开始运行常见基准测试,以帮助用户了解量化的影响。我们刚刚完成了Qwen 3.6量化模型的运行,并将结果发布在网站上:https://scrp.econ.cuhk.edu.hk/llm-benchmark 结果与大多数人的预期一致:通过GPQA Diamond衡量的知识在不同量化程度下变化很小。GPQA图 通过Terminal‑Bench 2衡量的智能体使用方面,低精度量化出现了显著的性能退化。Terminal-Bench 2图 我们还观察到相比Qwen官方FP8得分有明显的下降。我们认为这是由于超时设置——我们使用Harbor的默认设置,根据任务不同从10分钟到1小时不等,而Qwen官方数据使用的是固定的3小时超时。在网站上你还可以看到多次运行的得分范围。不同运行之间存在相当大的差异;高精度量化的差运行可能轻易比低精度量化的好运行更差。我们目前正在对GLM‑5.2量化模型进行基准测试,但如预期那样,过程非常缓慢。
相似文章
Qwen 3.6 35B A3B 与 Qwen 3.5 122B A10B 对比
用户反馈,尽管基准测试表现亮眼,Qwen 3.5 122B 在多步任务上大幅领先 Qwen 3.6 35B,怀疑是量化或部署配置问题。
Qwen3.6-35B-A3B 和 9B 已正式登上公开的 Terminal-Bench 2.0 排行榜!
Qwen3.6-35B-A3B 和 Qwen3.5-9B 模型已正式登上 Terminal-Bench 2.0 排行榜,其中 little-coder 在 35B 变体上取得 24.6% 的成绩,超越了 Gemini 2.5 Pro 和 Qwen3-Coder-480B;而 9B 模型则表明,10B 以下的本地模型能够与高难度代理基准竞争。
一些测试不同Gemma和Qwen量化版本准确性的对比实验
一位用户分享了针对不同量化版本的Gemma和Qwen模型在算术、总统出生日期和注意力测试中的准确率对比基准结果,强调了模型规模与量化级别之间的权衡。
Qwen 3.7 Max 在 SWE-Bench Pro 上取得了 60.6% 的得分
Qwen 3.7 Max 在 SWE-Bench Pro 上取得了 60.6% 的得分,展现了在软件工程任务上的竞争力。
Qwen3.7:智能代理前沿(15分钟阅读)
阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。