量化LLM推理中的无声失败:基于分类法的空洞收敛与失败模式转变分析

arXiv cs.CL 论文

摘要

本文通过一个基于分类法的分析,对多个模型和基准测试中的30,000个思维链输出进行研究,证明了训练后量化可以无声地改变大语言模型的推理方式,即使任务准确性保持不变。

arXiv:2607.09999v1 Announce Type: new Abstract: 我们表明,即使任务准确性保持不变,训练后量化也能无声地改变大语言模型的推理方式。使用一个由两位独立人类标注者验证的六类失败分类法(Cohen's $\kappa$ = 0.906),我们对来自五个指令微调LLM(3B--14B参数)在三种量化精度(FP32、FP16、NF4)和四个推理基准测试中的30,000个思维链输出进行了分类。我们发现,虽然精度在不同精度下保持稳健(最大下降3.1个百分点),但空洞收敛(通过不完整或不可验证的推理达到正确答案)在NF4下显示出显著的规模相关变化,对于测试的两个最小模型急剧下降,但对于12B参数及以上的模型保持不变。这种效应也是基准特定的:GSM8K完全免疫,而LogiQA和ARC-Challenge显示出最大的变化。此外,在NF4下,LLaMA 3.2-3B中的捷径崩溃从错误答案失败的44%上升到78%,而信心滚雪球从15.8%下降到接近零,这是一种准确性指标无法察觉的定性转变。最后,我们证明空洞收敛无法从表面级别的文本特征中可靠检测(最佳F1 = 0.53),从而将其确立为标准评估流程无法捕捉的部署相关失败模式。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:21

# 量化大模型推理中的静默失败:基于分类法的空心收敛与失败模式迁移分析
来源:https://arxiv.org/abs/2607.09999
查看PDF (https://arxiv.org/pdf/2607.09999)

> 摘要:我们证明,后训练量化可以在保持任务准确率不变的情况下,潜移默化地改变大语言模型的推理方式。基于一个由两位独立人工标注者验证的六类别失败分类体系(Cohen's κ = 0.906),我们对五个指令微调大模型(3B–14B参数)在三种量化精度(FP32、FP16、NF4)下,在四个推理基准上的30,000条思维链输出进行了分类。我们发现,尽管不同精度下的准确率保持稳健(最大下降3.1个百分点),但“空心收敛”(即通过不完整或不可验证的推理得到正确答案)在NF4下呈现出显著的与模型大小相关的迁移:在两个最小的被测模型上急剧下降,而在12B参数及以上的模型上保持不变。此外,该效应也具有基准特异性:GSM8K完全免疫,而LogiQA和ARC-Challenge则显示出最大的变化。更进一步,在NF4下,LLaMA 3.2–3B的错误答案失败中,“捷径崩溃”从44%上升到78%,而“置信滚雪球”则从15.8%几乎归零——这是一种准确率指标无法捕捉的定性迁移。最后,我们证明,仅凭表面文本特征无法可靠检测“空心收敛”(最佳F1 = 0.53),从而将其确立为一种与部署相关的、标准评估流水线无法捕获的失败模式。

## 提交历史

来自:Renuka Oladri [查看电子邮件 (https://arxiv.org/show-email/8aee97f3/2607.09999)] **[v1]** 2026年7月10日星期五 21:55:05 UTC (467 KB)

相似文章

量化推理模型自以为需要更长的思考,实则不然

arXiv cs.LG

本文揭示,对推理模型进行激进的训练后量化会导致过度思考错误增加,即模型在中间步骤得出正确答案却未能作为最终答案输出。对过度思考标记施加简单的logit惩罚,可将思维链长度减少12-23%,同时提升准确率,尤其对量化模型效果显著。

脆弱的思考:大型语言模型如何处理思维链扰动

arXiv cs.CL

本论文对大型语言模型在思维链推理步骤中处理损坏情况的能力进行了全面的实证评估,在数学推理任务上针对13个模型和5种扰动类型(数学错误、单位转换、盲从、跳过步骤、额外步骤)进行了测试。研究结果揭示了异质性的漏洞模式,对在多阶段推理管道中部署LLM具有重要意义。