量化在智能体使用与本地LLM中的影响?
摘要
作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。
过去两周,我一直在5080上全天候运行测试,以更好地理解量化对本地模型在智能体使用中的影响。在此过程中,我遇到了一些意想不到的惊喜。最重要的是?许多量化版本在统计上彼此无法区分。MoE模型受量化影响远小于密集模型。在此测试中,直到低于Q4量化,模型通常不会受到太大影响。然而,此测试非常具体,通常相当于2-4轮会话以验证量化本身未损害底层模型。会话将消耗大量计算来测量一个根本受损的模型,这几乎不会构成有趣的故事。未来的文章将基于本文识别的候选项编写,专注于智能体使用(DevOps、编码和长时间会话)。一如既往,我的基准测试、数据集和结果都是开源的。检查我的数据并告诉我我错了(这不是第一次!)或者自己运行基准测试。
相似文章
有没有人测试过量化对不同能力的影响?我的结果令人惊讶。
作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。
分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害
本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。
量化破坏对齐:压缩大语言模型中偏见在不同模型与精度下的涌现
本文研究了训练后量化如何在指令调优的大语言模型中引入新偏见,发现3位精度导致6-21%之前无偏见的项目发展出刻板印象,而像困惑度这样的标准指标未能检测到这种退化。
K-Quantization 及其对输出性能的影响
本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。
压缩与遗忘:bitsandbytes量化放大LLMs中的前瞻干扰
论文发现,bitsandbytes INT4量化显著放大了LLMs中的前瞻干扰,在重复覆盖的上下文中降低了准确性,并突显了语义密集型应用中的部署风险。