有没有人测试过量化对不同能力的影响?我的结果令人惊讶。

Reddit r/LocalLLaMA 新闻

摘要

作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。

我对我的一些模型进行了系统测试,比较了FP16与各种GGUF量化级别,我没有只看一个总体的基准分数,而是按能力进行了细分:数学(GSM8K)、代码(HumanEval)、推理(ARC-Challenge)和知识回忆(MMLU-Pro)。结果远比“Q4损失X%质量”要微妙得多。例如,在一个27B模型上,Q4_K_M在对话/知识任务上几乎没有变化(退化不到2%),但与FP16相比,多步数学准确度下降了近9%。Q5_K_M基本上消除了数学差距。因此,“正确”的量化级别完全取决于你使用模型的用途。我还一直好奇的另一件事是上下文衰减。是否有系统的测试表明量化模型在上下文窗口填满时是否比FP16模型更快地丢失上下文检索准确度?例如,Q4模型是否会在8K上下文中开始产生幻觉,而FP16版本则稳定到12K?我看到过零星的轶事,但没有严格的、对不同量化级别进行受控的针堆测试的数据。感觉社区有大量关于“哪个模型最好”的数据,但几乎没有关于“这个特定模型的最佳量化级别对我的用例和硬件来说是什么”的数据。我漏掉了什么,还是这确实是一个空白?
查看原文

相似文章

K-Quantization 及其对输出性能的影响

arXiv cs.CL

本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。

量化在智能体使用与本地LLM中的影响?

Reddit r/AI_Agents

作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。