Qwen3.6-27B 量化基准测试

Reddit r/LocalLLaMA 新闻

摘要

本文使用 KLD 和 Same Top P 指标,对多种 Qwen3.6-27B 量化版本(Q8 至 Q2)进行基准测试,对比了 Unsloth 和 mradermacher 等提供者的量化结果,并给出了质量与大小权衡的建议。

大家好!这是我尝试对 HuggingFace 上一些知名的 Qwen3.6 27B 量化版本(unsloth、mradermacher、cHunter789 和 Ununnilium 的 IQ4\_XS)进行基准测试和质量对比,范围从 Q8 一直往下到 Q2。 # 测量方法 我使用 llama.cpp 的 `llama-perplexity` 来测量量化模型与基础模型(BF16 版本)之间的 **平均 KLD** 和 **Same Top P 百分比**。所有运行均使用相同的上下文长度 8192 个 token,KV 缓存量化为 q8\_0,以确保整个模型能放入 GPU。 # 理解 KLD 和 Same Top P 要理解测试结果,有必要了解我使用的这两个指标之间的区别。当 LLM 预测给定 prompt 的下一个词时,例如 **"Today I will do my"**,它会查看其整个词汇表,并为每个 token 分配置信度分数。然后根据给定的 temperature 采样 top tokens 并选择最终的一个。 * **KL 散度 (KLD)** 衡量量化模型的置信度分布相对于基础模型的偏移程度。在这个例子中,基础模型可能对 "homework" 赋予 90% 的置信度,对 "bike" 赋予 5%,对 "banana" 赋予 1%。但量化效果差的模型可能对 "homework" 赋予 50%,对 "bike" 赋予 30%,对 "banana" 赋予 20%。 * **Same Top P** 跟踪量化模型选择与基础模型相同 token 的频率。在这个例子中,模型可能会仅为 prompt 选择 "homework" 作为下一个 token。因此,虽然量化模型可能获得不错的 token 选择(**Same Top P** 较高),但查看 **平均 KLD** 以了解模型内部概率的稳定性也很重要,该值越低越好。 # 基准测试结果 ## Unsloth 的量化 https://preview.redd.it/awcfprb5744h1.png?width=3600&format=png&auto=webp&s=3ac8937eeac49b6b4d3920cd2b4b52e99a25e269 没什么特别的,高位量化优于低位量化。Q6 到 Q8 几乎无损。你可以看到 Q8\_0 具有更高的 **Same Top P**,但底层 **平均 KLD** 告诉我们 UD-Q8\_K\_XL 更好。Q4 以下的量化只适合像 5060ti 16GB 俱乐部那样迫不得已的情况。 4 位量化簇更有趣一些。不同的人可能有不同的看法,但对我来说,如果 VRAM 够用,Q4\_K\_XL 是一个很好的质量折衷。如果 VRAM 紧张,IQ4\_XS 可能表现不错,IQ4\_NL 差别不大。在这种情况下,没有必要勉强使用 Q4\_K\_M。你可以跳过 Q4\_K\_S。 从 Q3\_K\_XL 开始,质量下降更加明显。KLD 全部超过 0.1,匹配 token 选择下降到 90-85%,这充分说明了不稳定性。 ## mradermacher 和其他量化版本 我看到过有人提到 mradermacher 的 i1 量化版本,以及 cHunter789 和 Ununnilium 的 IQ4\_XS 量化版本。我个人使用 Ununnilium 的 IQ4\_XS 已经有一段时间了。所以我想把它们放在同一张表里,看看它们的表现如何。但一张图不够,因此我将它们分成 4 组:Q8-Q6、Q5、Q4 和 Q3 以下。 ## 8 位和 6 位量化 https://preview.redd.it/6om7k1x6744h1.png?width=1600&format=png&auto=webp&s=28c6b79b867976de16a01b39b5dd20d422d77762 在这里,mradermacher 的 Q6\_K 似乎明显优于 Unsloth 的 Q6\_K。平均 KLD 接近完美(0.027352),并且 token 选择匹配率为 97.011%。 ## 5 位量化 https://preview.redd.it/j7cs0cs7744h1.png?width=1600&format=png&auto=webp&s=8a8ba0e99a2c275034de0d7ebb357c1adfbed7cd 在这一组中,Unsloth 是赢家。大小相差约 300-500MB,你可以跳过 Q5\_K\_S 直接选择 Q5\_K\_M。Unsloth 的 Q5\_K\_M 在匹配 token 选择率和 KLD 方面都明显更好。 ## 4 位量化 https://preview.redd.it/ywleki49744h1.png?width=3300&format=png&auto=webp&s=5db6b1d3899171afad5093557f849539332ea33d Unsloth 在这里击败了所有 4 位量化版本。但如果你正在寻找一些替代量化以节省 VRAM,例如 16GB 版本,请注意 IQ4\_XS(它会有所帮助,但当然,你将无法获得超过 65k 的上下文窗口)。mradermacher 的 IQ4\_XS 在所有其他 IQ4\_XS 量化版本中明显胜出,但大小为 15.1 GB,可能有点紧张。cHunter 的 IQ4\_XS 大小为 14.7 GB,也非常好。 ## 3 位及以下 https://preview.redd.it/fgjixv7a744h1.png?width=3300&format=png&auto=webp&s=45d85e85e57cfb7da11fbff2b5f4172634e20a1e 同样,mradermacher 的量化版本填补了 Unsloth 量化版本之间的空白,因此你有更多选择,但老实说,在这个范围内,你最好使用 Unsloth 的 Q3\_K\_XL 或至少 Q3\_K\_M。我非常好奇 IQ3\_S、IQ3\_M 等新量化版本的表现,但它们的结果有点令人失望。 # 原始基准测试数据 如果你感兴趣,以下是所有运行后的原始基准测试数据表。 |量化版本|平均 PPL(Q)|平均 KLD|RMS Δp (%)|Same top p (%)| |:-|:-|:-|:-|:-| |UD-Q8\_K\_XL|6.569706|0.015495|2.448|97.407| |Q8\_0|6.567807|0.020497|2.701|97.753| |UD-Q6\_K\_XL|6.541421|0.023398|2.903|97.436| |mradermacher/Q6\_K|6.541627|0.027352|3.045|97.011| |Q6\_K|6.566514|0.027766|3.014|97.112| |UD-Q5\_K\_XL|6.625155|0.045526|4.021|96.187| |Q5\_K\_M|6.658295|0.05277|4.26|95.864| |mradermacher/Q5\_K\_M|6.630279|0.053246|4.372|95.664| |mradermacher/Q5\_K\_S|6.613859|0.055034|4.476|95.505| |Q5\_K\_S|6.652629|0.055888|4.414|95.674| |UD-Q4\_K\_XL|6.647006|0.06656|5.023|94.621| |Q4\_K\_M|6.672841|0.070345|5.334|94.228| |IQ4\_NL|6.619131|0.071724|5.497|94.106| |IQ4\_XS|6.61994|0.072223|5.481|94.016| |mradermacher/IQ4\_XS|6.611545|0.073705|5.648|93.852| |mradermacher/Q4\_K\_M|6.685347|0.074124|5.507|94.08| |cHunter/IQ4\_XS-i1|6.656157|0.075933|5.645|93.77| |Q4\_K\_S|6.690623|0.078947|5.72|93.833| |mradermacher/Q4\_K\_S|6.642023|0.080407|5.825|93.657| |Ununnilium/IQ4\_XS-pure|6.765894|0.084115|6.127|92.407| |UD-Q3\_K\_XL|6.620281|0.105386|7.077|91.837| |Q3\_K\_M|6.453757|0.129404|7.893|90.437| |mradermacher/Q3\_K\_L|6.482496|0.136127|8.116|90.213| |mradermacher/Q3\_K\_M|6.481299|0.140487|8.424|89.934| |mradermacher/IQ3\_XS|6.981601|0.161364|9.182|88.767| |UD-IQ3\_XXS|6.994512|0.176688|9.626|87.953| |mradermacher/IQ3\_S|7.405328|0.176782|9.637|88.689| |Q3\_K\_S|7.068685|0.178631|9.61|87.681| |mradermacher/IQ3\_M|7.454224|0.180647|9.824|88.603| |mradermacher/Q3\_K\_S|6.910989|0.181172|9.82|87.422| |UD-Q2\_K\_XL|7.316461|0.229068|11.399|85.95| |UD-IQ2\_M|7.468708|0.241252|11.91|85.319| |UD-IQ2\_XXS|8.507239|0.40986|16.708|78.483| HuggingFace 上还有更多 Qwen3.6 27B 量化版本,例如 bartowski、huihui 等的版本。由于我的时间预算有限(不是金钱预算,因为我基本上使用的是 modal.com 的免费月度额度 :P),我无法全部进行基准测试。如果你有兴趣自己进行基准测试,我也在我的原始博客文章中附上了脚本,这样你就可以自己运行。在这里查看:https://www.huy.rocks/everyday/05-29-2026-ai-qwen3-6-27b-quantization-benchmark 如果你们中有人决定自己运行并分享结果,我会非常期待看到。感谢阅读至此!
查看原文

相似文章

Qwen 27B 3.8 量化:极限在哪里?

Reddit r/LocalLLaMA

一位用户分享了在 Mac mini M4 上使用 Unsloth 的 Q3 XXS 量化版本运行 Qwen 27B 3.8 的积极体验,并询问他人对低于 Q3 量化版本的使用感受。

# Qwen 3.6 27B - VLLM 性能基准测试结果(BF16、FP8、NVFP4)

Reddit r/LocalLLaMA

使用 VLLM 对 Qwen 3.6 27B 在 BF16、FP8 和 NVFP4 三种量化方式下的详细基准测试显示:NVFP4 在 token 生成方面最快,但 FP8 在提示处理方面表现最佳。本文还提供了针对编码任务选择合适量化的实用建议。