Qwen 3.6 Q2-FP8 终端基准2和GPQA得分

Reddit r/LocalLLaMA 新闻

摘要

本文报告了Qwen 3.6模型的基准测试结果,显示量化对知识基准(GPQA)影响很小,但会显著降低智能体性能(Terminal-Bench 2),并进一步讨论了超时设置和运行差异。

TL;DR:量化对智能体性能有显著影响,但对知识影响很小。我在一所大学管理一个小型HPC集群,最近开始运行常见基准测试,以帮助用户了解量化的影响。我们刚刚完成了Qwen 3.6量化模型的运行,并将结果发布在网站上:https://scrp.econ.cuhk.edu.hk/llm-benchmark 结果与大多数人的预期一致:通过GPQA Diamond衡量的知识在不同量化程度下变化很小。GPQA图 通过Terminal‑Bench 2衡量的智能体使用方面,低精度量化出现了显著的性能退化。Terminal-Bench 2图 我们还观察到相比Qwen官方FP8得分有明显的下降。我们认为这是由于超时设置——我们使用Harbor的默认设置,根据任务不同从10分钟到1小时不等,而Qwen官方数据使用的是固定的3小时超时。在网站上你还可以看到多次运行的得分范围。不同运行之间存在相当大的差异;高精度量化的差运行可能轻易比低精度量化的好运行更差。我们目前正在对GLM‑5.2量化模型进行基准测试,但如预期那样,过程非常缓慢。
查看原文

相似文章

Qwen3.7:智能代理前沿(15分钟阅读)

TLDR AI

阿里巴巴Qwen团队发布了Qwen3.7-Max,这是一款专有智能代理基础模型,在Terminal-Bench 2.0、SWE-Pro、GPQA Diamond等多个基准测试中取得最高分,并在多种代码环境中表现一致。