量化对知识的损害是非线性的 - Qwen3.6 27B 案例研究
摘要
关于量化如何影响 Qwen3.6 27B 中事实知识的案例研究,表明知识损失呈非线性扩展,且与基准分数不同,在低比特宽度下,冷门事实的退化最为严重。
暂无内容
查看缓存全文
缓存时间: 2026/08/03 15:43
# 量化对知识的损害是非线性的 —— Qwen3.6 27B 案例研究
来源:https://quesma.com/blog/quantization-hurts-knowledge/
Piotr Migdał (https://p.migdal.pl/)2026 年 8 月 3 日
在之前的博客文章中,我既对 Qwen3.6 27B (https://quesma.com/blog/qwen-36-is-awesome/) 赞不绝口,也研究了量化如何影响其绘制鹈鹕的能力和基准分数 (https://quesma.com/blog/qwen-quantization-quality/)。在 4 位或更高精度下,骑自行车的鹈鹕 SVG 不受任何影响;即使是 3 位和一些 2 位模型,质量差异也很小,只有在多个样本上取平均时才可见。同样,基准测试结果的差异也小得惊人。
那么,为什么日常经验告诉我们较小的模型“更差”呢?虽然智能可能并不那么占用空间,**但事实性知识是不可压缩的** —— 无论你多么努力,你都无法把整个互联网塞进几个 GB 里。不可压缩知识探针 (https://01.me/research/ikp/)(IKP)是 Bojie Li 提出的一个包含 1,400 道琐事题的基准测试。正如我们所见,IKP 准确率与参数数量的对数之间存在很强的线性相关性:
0%20%40%60%80%100M1B10B100B1000B模型参数(对数刻度)IKP 准确率smollm2-135mkimi-k2Qwen3.6 27B (BF16)
其他模型Qwen3.6 27B虚线:对数线性拟合,每增大 10× 参数提升 +16 个百分点
如果你对涵盖 7 个晦涩等级 (https://01.me/research/ikp/#/tiers) 的问题感到好奇,这里有几个例子:
- **T1**:“哪个海峡将西西里岛与意大利本土分开?”—— 墨西拿海峡
- **T2**:“土星第二大卫星是什么?”—— 瑞亚(土卫五)
- **T3**:“谁创作了歌剧《伊戈尔王子》?”—— 亚历山大·鲍罗丁
- **T4**:“大洋洲最高的山峰是什么?”—— 查亚峰
- **T5**:“挪威奥林匹克博物馆是哪一年成立的?”—— 1997 年
- **T6**:“在计算机科学中,Myung Hoon Sunwoo 的研究子领域是什么?”—— 计算机体系结构
- **T7**:“西班牙 El Brull 的 Pont 1(sot de les Mines)是哪一年开放的?”—— 1901 年
作为参考,原始模型的分数如下:
T1T2T3T4T5T6T7Qwen3.6 27B99.5%97.5%78.5%38%10%3%4%
让我们看看 55 种量化如何影响分数:包括 Hugging Face 上由 Unsloth (https://huggingface.co/unsloth/Qwen3.6-27B-MTP-GGUF) 和 Bartowski (https://huggingface.co/bartowski/Qwen_Qwen3.6-27B-GGUF) 提供的量化版本,以及由 llama.cpp (https://github.com/ggml-org/llama.cpp) 通过 `llama-quantize` 生成的量化版本。我们使用 llama.cpp 来运行这些模型,本地在我的 MacBook M5 上,以及在 Modal (https://modal.com/) 上。首先,让我们按等级分解:
0%25%50%75%100%1015203050 GB磁盘上的模型大小,对数刻度(按大小区间取平均)回答正确T1T2T3T4T5T6T7
所以一切都随模型大小而变化,最晦涩的知识最先丢失。
让我们绘制 IKP 准确率与模型大小对数的关系图。
35%40%45%50%1015203050 GB磁盘上的模型大小(对数刻度)IKP 准确率UD-IQ2_XXSIQ2_XXSUD-Q2_K_XLQ4_K_MBF16
UnslothBartowskillama.cppBF16 参考
20 GB 以上(5 位或更高)的量化显示与原始模型相同的质量。在 3 位模型中有所下降,在 2 位范围内下降得更厉害。
然而,与主图表不同,这种关系不是线性的。我不得不再次检查,这不是使用不同变量或缩放比例的问题。那么,让我们把它叠加到完整的图表上。
0%20%40%60%80%1101001000 GB磁盘上的模型大小(对数刻度)IKP 准确率UD-IQ2_XXSQ4_K_MQwen3.6 27B (BF16)
UnslothBartowskillama.cpp其他模型
这里变得有趣了。我们得到了一条弧线。虽然 Qwen3.6 27B 已经有“超越其体量”的口号,但其精简的 4 位变体让这个说法更加……有冲击力(请原谅我,我实在忍不住了)。
## 大小很重要,但散度更重要https://quesma.com/blog/quantization-hurts-knowledge/#size-matters-but-divergence-even-more
这可能看起来令人费解。在跨模型比较中,IKP 准确率随大小的对数线性增长。在单个模型的量化内部,曲线先急剧上升,然后趋于平缓。当压缩一个模型时(**量化是一种有损压缩**),重要的不是大小本身,而是生成 token 的统计分布。因此,另一张图表可能更有说服力 —— 与原始浮点 BF16 模型的 Kullback–Leibler 散度 (https://en.wikipedia.org/wiki/Kullback%E2%80%93Leibler_divergence):
35%40%45%50%00.050.10.150.20.250.3与 BF16 的平均 KL 散度IKP 准确率r = -0.981UD-Q2_K_XLIQ3_SQ4_K_MQ8_0
UnslothBartowskillama.cpp
这里我们看到一个漂亮的线性相关性。
我的解释如下 —— 当稍微压缩模型时,我们不会损失任何东西,只是去除了一些不必要的噪声。所以我们节省了空间,而无需付出任何代价。
但在某个时刻,分布开始崩溃,质量下降得比单纯训练一个更小的模型更快。因为如果我们训练一个更小的模型,我们仍然会针对训练数据进行优化。**量化是盲目的。**即使是 Unsloth 和 Bartowski 的量化,优化的也是与原始分布的接近程度,而不是微调数据。
## 启示https://quesma.com/blog/quantization-hurts-knowledge/#consequences
这有两个启示。首先,量化是可行之道 —— 你只需要知道你能推到什么程度,而不会出现明显的质量损失。通常,你会希望使用能装进 GPU 显存并留出足够上下文空间的最大模型。除非你需要你的 GPU 显存(如果是 Apple Silicon,则是共享内存)用于其他用途,否则使用更便宜的模型没有好处,通常也没有速度上的好处 (https://quesma.com/blog/qwen-quantization-quality/#and-how-about-speed)。
虽然一般来说“越大越好”,但在某个时刻收益会递减。就 Qwen3.6 27B 而言,8 位量化(例如来自 Unsloth 的 `Q8_0`)是安全的选择。如果你使用一个好的 4 位量化(例如来自 Bartowski 的 `Q4_K_M`),你很可能也没问题。正如我们已经看到的,鹈鹕生成模式 (https://quesma.com/blog/qwen-quantization-quality/#pelican) 与事实性知识不同。对于你的特定问题,可能会出现不同的临界点。
其次,重要的不仅仅是智能。一个聪明的模型如果没有足够的知识,就会有所欠缺。
如果你使用模型来编写 Python 代码,你可能并不关心它是否知道最简单的 *Tier 1* 事实,比如关于墨西拿海峡的那个。与此同时,关于 Python 包生态系统的琐碎知识有数百万条 —— 每个包都有其 API、模式和依赖版本的怪癖。所有这些都很重要。大多数是无法推导出来的。所以要么你有一个擅长搜索文档、代码示例和 bug 报告的模型(并且你给它足够的时间),否则它就会失败。
在你使用的模型中,你是否注意到了模型量化的临界点?
敬请关注后续的文章和发布。
相似文章
有没有人测试过量化对不同能力的影响?我的结果令人惊讶。
作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。
Qwen 3.6 27B 的量化是否会破坏 pelican?
本文评估了 Qwen3.6-27B 模型的不同量化方式对输出质量的影响,使用了 KL 散度和 top-1 token 准确率,以及 SVG 绘图等可视化示例。
K-Quantization 及其对输出性能的影响
本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。
Qwen3.8 27B 模型量化基准测试:4位量化保持性能,1位量化严重退化
基准测试表明,4位量化的Qwen3.8 27B在Terminal-Bench 2.1等基准测试中保持性能,且适配24GB显卡,但1位量化导致严重性能下降。
Qwen3.8-27B 在*知识*方面相比 3.6 遭受重创
作者基于个人基准测试和离线测试发现,Qwen3.8-27B 的知识回忆能力弱于 Qwen3.6,表明它可能不适合用于离线知识检索。