分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG 论文

摘要

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。

arXiv:2607.27275v1 公告类型:新 摘要:训练后量化到4位权重被广泛报道为几乎无损。我们在多轮工具调用智能体上检验了这一说法,而这正是当下最为重要的场景。在$\tau^2$-bench上,跨两个开放权重模型系列(稠密型和MoE变体)以及两个领域(八个单元格,每格456个回合,分别使用16位、8位和4位权重),量化在标准指标上看起来确实是免费的。没有一个单元格的分数变化能通过多重比较校正,并且在过程损害最大的单元格中,等价性检验将变化限制在$\pm$7.5分以内。过程则讲述了不同的故事。量化放大了模型在全精度下已经表现出的失败(电信领域的工具名称幻觉,零售实体错误也呈现相同的方向性趋势),其数量最多扩大2.5$\times$(每个任务+17.6分),同时基本上没有产生新的失败。失败集合在每种精度下都相同(秩相关$\geq$ 0.94,0.18%的新事件)。分数保持持平是因为基准的十个错误预算吸收了额外的失败。将预算缩小到两个错误后,分数差距重新暴露为17分,并且仅在量化增加错误数量的那个单元格中出现,这与掩盖机制的预测完全一致。针对性的错误修复提示在五种电信模型的所有精度下运行,恰好并且仅在有损害的地方消除了损害。这两种诊断方法——每通道错误率和缩小预算下的成功率——都来自基准测试已有的日志;我们建议在任务奖励之外一并报告这些指标。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:01

# 分数持平,失败放大:误差预算如何掩盖量化 LLM 智能体的损伤

来源:https://arxiv.org/html/2607.27275

## 分数持平,失败放大:误差预算如何掩盖量化 LLM 智能体的损伤

Jiwon Jang¹,²*, Kisu Yang¹,³*, Heuiseok Lim³†, Hyunwoo Park²†

*同等贡献,†通讯作者

###### 摘要

将权重后训练量化为 4 位通常被认为几乎无损。我们在多轮工具调用智能体上检验了这一说法,而这正是当前最为关键的场景。在 τ²-bench 上,覆盖两个开放权重模型系列(dense 和 MoE 变体)和两个领域(八个单元,每单元 456 个 episode,权重分别为 16 位、8 位和 4 位),量化在标准指标上看起来确实没有代价。没有任何一个单元的分数变化能通过多重比较校正;而在承载最大过程损伤的单元中,等价性检验将变化界限限定在 ±7.5 分以内。过程则讲述了一个不同的故事。量化将模型在全精度下已经表现出的失败(电信领域的工具名幻觉,零售领域实体错误也呈现相同方向趋势)在数量上放大了至多 2.5 倍(每任务 +17.6 分),同时几乎不产生新的失败。失败集合在各精度下完全相同(秩相关 ≥0.94,0.18% 的新事件)。分数保持持平,是因为基准测试的十个错误预算吸收了额外失败。将预算缩小到两个错误会重新暴露 17 分的分数差距,而且恰好只出现在量化增加错误数量的那个单元中,这与掩盖假说的预测完全一致。一个针对性的错误修复提示,在每种精度下对五个电信模型运行,精确地并且仅在损伤所在之处消除了损伤。这两种诊断——每通道错误率和预算缩减下的成功率——都来自基准测试已经收集的日志;我们建议将其与任务奖励一同报告。

## 引言

参见图 1 标题:分数持平,失败放大。

我们使用 BF16 智能体及其 AWQ-INT4 量化版本运行同一个智能体基准测试 τ²-bench 电信领域,共 456 个 episode。所示单元为 Gemma-4-31B。

(a) 在基准测试的主要指标(最终任务分数)上,两个智能体在统计上等价。量化看起来没有代价。

(b) 在表面之下,智能体调用其工具列表之外工具的工具调用占比翻倍,从 19.5% 增加到 38.3%。

(c) 这些不是新的失败。每个点代表一个幻觉工具名。BF16 智能体已经发明过的每个工具,在量化后被调用的频率约为原来的 2.5 倍,而且 INT4 智能体的幻觉调用中只有 0.18% 调用了 BF16 原版从未使用过的工具。

(d) 最终分数保持持平,是因为基准测试每个 episode 容忍十次失败调用,且智能体能够在失败之间恢复。在更严格的容错 K 下重新计算成功率,会重新暴露隐藏的差距,在 K=2 时该差距比默认 K=10 时宽 13 倍。没有既有失败倾向的模型根本不会被放大,如表 1(https://arxiv.org/html/2607.27275#Sx3.T1)所示。

权重量化是规模化服务大语言模型(LLM)的默认机制。将权重从 16 位减少到 4 位可将内存和延迟降低数倍,而系统性评估报告 4 位量化几乎无损,标准基准准确率仅下降一两分(Frantar et al. 2023(https://arxiv.org/html/2607.27275#bib.bib1);Lin et al. 2024(https://arxiv.org/html/2607.27275#bib.bib2);Li et al. 2024b(https://arxiv.org/html/2607.27275#bib.bib5);Jin et al. 2024(https://arxiv.org/html/2607.27275#bib.bib6))。然而,这一结论几乎完全基于*单轮*评估,而部署中的 LLM 越来越多地扮演*智能体*角色,即多轮工具调用控制器,与环境交互、观察反馈并从自身错误中恢复。

RQ1:“几乎无损”是否能经受住向多轮工具调用智能体的转变,基准测试的最终分数能否告诉我们答案?

自然的提问方式实际上是误导性的。最明显的实验是在智能体基准上运行量化和全精度智能体并比较任务成功率。我们在 τ²-bench(Barr et al. 2026(https://arxiv.org/html/2607.27275#bib.bib17))上正是这样做的。这是一个带模拟用户的工具调用基准,覆盖两个开放权重模型系列 × {dense, MoE} × 两个领域(完整八单元网格,每臂 456 次模拟),外加电信领域的两个早期 Qwen-3.5 检查点。结果是一条平线(图 1a(https://arxiv.org/html/2607.27275#Sx1.F1))。没有任何分数变化能通过多重比较校正,最大的配对下降为 2.0 分,处于运行间噪声底线的 1.3 倍以内。从表面价值看,量化在智能体场景中也是免费的。此前对智能体的压缩研究都止步于这种聚合结论(Dong et al. 2025(https://arxiv.org/html/2607.27275#bib.bib19));本文其余部分则追问这一结论掩盖了什么。

我们认为这一结论是*任务奖励所度量内容的*产物。任务奖励是一个二值的、轨迹结束时的结果。它被任务难度方差淹没,更重要的是,智能体循环在错误到达结果之前就主动*修复*了量化引入的错误。将轨迹分解到单个工具调用层面,则会揭示一个包含两部分的巨大效应。第一,普遍地,*量化并不改变模型出错的内容*。在电信领域,错误通道是工具名幻觉(调用智能体工具列表之外的工具,几乎总是双控制接口中*用户*一侧的真实工具),BF16 和 INT4 在幻觉名称上的分布几乎相同,且这一不变性在 8 位下也成立。失败集合是*模型*的属性,而不是任何精度的属性。第二,以单元相关的方式,*量化决定了该集合触发的频率*。在放大最严重的单元(Gemma-4 dense,电信)中,4 位权重产生的列表外调用增加了 2.5 倍(649→1,646);在全部单元中,乘数范围从 ≈1× 到 4.6×,而在零售领域,移动的通道是实体/参数错误(Gemma-4 MoE 为 1.45×,趋势未达显著)。量化重新缩放模型已有的错误集合;比例因子是单元的属性。

RQ2:为什么最终分数保持持平,而智能体的每步失败却在成倍增加?

因为循环隐藏了损伤。τ²-bench 与其他智能体基准一样,每个 episode 允许十次失败工具调用,而每次错误后的恢复在两种精度下同样可靠,因此预算吸收了量化产生的额外失败。将容错从十个错误收紧到两个,会重新暴露赤字,INT4 分数差距从 1.3 分扩大到 16.7 分,而且只在量化增加错误数量的那个单元中重新暴露损伤(那里为 15.4 分,其他单元至多 0.2 分)。分数持平是因为环境宽容,而不是因为模型毫发无损。同样的定位也预测了解药:一个反射式的错误修复提示确实在所有运行处收缩了该通道,但只在受损单元中改变了分数。

RQ3:为什么有些模型被量化损伤,而另一些则不受影响?

不是规模或 dense 与 MoE 的架构差异,而是模型的*全精度失败倾向*。一个在 16 位下很少产生工具幻觉的模型(Qwen-3.6)没有可放大的东西;一个有固有倾向的模型(Gemma-4)其倾向被放大;而一个门控略微打开的早期 Qwen-3.5 检查点则被轻微但显著地放大。开放的门控是必要而非充分条件,因为一个门控同样开放的单元(Gemma-4 MoE 电信,19.3%)只放大了 1.05 倍。logit 边际的解释与这一模式一致。量化噪声只会翻转薄边际的 argmax 决策,而这些恰好是

相似文章