为什么我们在量化模型时用困惑度和散文质量作为基准,却从不考虑工具调用有效性?
摘要
这篇文章质疑为什么量化基准测试只关注困惑度和散文质量,而不考虑工具调用有效性,认为结构化输出由于有效token延续更少而更早退化,这可能会误导从业者对可用于智能体场景的量化级别的判断。
最近关于混合精度量化的讨论中,那些关注MoE、将共享专家和边缘层保持在更高精度的做法很好,但几乎所有评估都基于困惑度和通用输出质量。我从未见到对结构化输出的评估。工具调用JSON、函数模式、约束格式。我的直觉(而且我希望是错的)是,这些比散文退化得更早。一个Q4\_K\_M的模型仍然能写出完全可读的段落,同时悄悄生成少一个花括号或幻觉字段名的JSON。散文在每个token有大量有效延续,而模式只有很少。因此,在文本中不可见的相同量化错误在工具调用中可能是致命的。如果这是真的,那么对于智能体使用场景,实际可接受的量化级别低于困惑度图表所暗示的,很多人选错了量化指标。有没有人针对同一个模型,在不同量化级别上测试过有效工具调用的接受率?不是困惑度,只是JSON解析是否通过。
相似文章
我们基准测试的是无人实际运行的模型
文章批评了AI模型在不同量化格式下缺乏系统性基准测试,突出了基准测试结果与实际使用之间的差异,并呼吁进行更彻底的评估。
有没有人测试过量化对不同能力的影响?我的结果令人惊讶。
作者分享了对不同量化级别(如Q4_K_M、Q5_K_M)如何分别影响模型能力的系统测试的惊人结果,显示数学准确度下降幅度大于知识类任务,并呼吁对不同量化级别的上下文衰减进行更严格的测试。
分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害
本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。
K-Quantization 及其对输出性能的影响
本文研究了不同量化级别(2位到8位)对八个大型语言模型在推理、代码理解和阅读理解任务上的性能影响,发现虽然更高精度通常带来更好的性能,但激进量化通常能保持可接受的准确率,且更大的模型展现出更强的韧性。
量化ASR模型中的基准优化
本文通过行为探测方法,量化了高性能ASR模型如何通过非真实反映转录能力的方式优化基准测试以提升分数,揭示了基准条件下的模型行为。