有没有人测试过量化对不同能力的影响?我的结果令人惊讶。
摘要
作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。
我对我的一些模型进行了系统测试,比较了FP16与各种GGUF量化级别,我没有只看一个总体的基准分数,而是按能力进行了细分:数学(GSM8K)、代码(HumanEval)、推理(ARC-Challenge)和知识回忆(MMLU-Pro)。结果远比“Q4损失X%质量”要微妙得多。例如,在一个27B模型上,Q4_K_M在对话/知识任务上几乎没有变化(退化不到2%),但与FP16相比,多步数学准确度下降了近9%。Q5_K_M基本上消除了数学差距。因此,“正确”的量化级别完全取决于你使用模型的用途。我还一直好奇的另一件事是上下文衰减。是否有系统的测试表明量化模型在上下文窗口填满时是否比FP16模型更快地丢失上下文检索准确度?例如,Q4模型是否会在8K上下文中开始产生幻觉,而FP16版本则稳定到12K?我看到过零星的轶事,但没有严格的、对不同量化级别进行受控的针堆测试的数据。感觉社区有大量关于“哪个模型最好”的数据,但几乎没有关于“这个特定模型的最佳量化级别对我的用例和硬件来说是什么”的数据。我漏掉了什么,还是这确实是一个空白?
相似文章
K-Quantization 及其对输出性能的影响
本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。
一些测试不同Gemma和Qwen量化版本准确性的对比实验
一位用户分享了针对不同量化版本的Gemma和Qwen模型在算术、总统出生日期和注意力测试中的准确率对比基准结果,强调了模型规模与量化级别之间的权衡。
量化在智能体使用与本地LLM中的影响?
作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。
量化对知识的损害是非线性的 - Qwen3.6 27B 案例研究
关于量化如何影响 Qwen3.6 27B 中事实知识的案例研究,表明知识损失呈非线性扩展,且与基准分数不同,在低比特宽度下,冷门事实的退化最为严重。
这是我的KV缓存量化基准测试:TurboQuant被高估但被TCQ拯救,q5值得更多关注,对称q8可能浪费显存
一项详细的基准测试,使用PPL和KLD指标在Qwen 3.6 27B上比较KV缓存量化方法(TurboQuant、TCQ、q4、q5、q8),发现TCQ改进了低位量化,不对称KV在相同大小下优于对称KV,且q8通常过于夸张。包含分析和数据,见链接文章。