量化在智能体使用与本地LLM中的影响?

Reddit r/AI_Agents 新闻

摘要

作者分享了测试量化对本地LLM在智能体使用中的影响的结果,发现许多量化版本在统计上无法区分,MoE模型受量化影响小于密集模型,而在Q4量化以下会出现显著性能下降。

过去两周,我一直在5080上全天候运行测试,以更好地理解量化对本地模型在智能体使用中的影响。在此过程中,我遇到了一些意想不到的惊喜。最重要的是?许多量化版本在统计上彼此无法区分。MoE模型受量化影响远小于密集模型。在此测试中,直到低于Q4量化,模型通常不会受到太大影响。然而,此测试非常具体,通常相当于2-4轮会话以验证量化本身未损害底层模型。会话将消耗大量计算来测量一个根本受损的模型,这几乎不会构成有趣的故事。未来的文章将基于本文识别的候选项编写,专注于智能体使用(DevOps、编码和长时间会话)。一如既往,我的基准测试、数据集和结果都是开源的。检查我的数据并告诉我我错了(这不是第一次!)或者自己运行基准测试。
查看原文

相似文章

分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。

K-Quantization 及其对输出性能的影响

arXiv cs.CL

本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。