别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响
摘要
本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。
查看缓存全文
缓存时间: 2026/06/25 05:08
# 别毁了我的LLM:剪枝注意力层对解释忠实度和置信度校准的影响 来源:https://arxiv.org/abs/2606.24970 查看PDF (https://arxiv.org/pdf/2606.24970) > 摘要:剪枝大型语言模型(LLMs)通过移除网络的部分组件来减少内存和推理成本,从而产生保留大部分准确性的更小模型。由于注意力层是LLM中最耗费资源的部件,剪枝它们是一种有前景的压缩策略。先前的研究表明,最多可以剪枝33%的注意力层而几乎不损失准确性。然而,注意力剪枝对模型可解释性(特别是忠实度和置信度校准)的影响仍未得到研究。为填补这一空白,我们研究了在五个LLM和八个数据集上剪枝注意力层对解释忠实度和置信度校准的影响。虽然剪枝后的模型通常保持高准确性,但我们发现它们的忠实度和校准能力往往会下降。值得注意的是,即使准确性保持稳定,忠实度和校准也可能显著波动,凸显了模型置信度、可解释性和准确性之间的失调。我们的研究结果表明,层剪枝可能以准确性和效率指标无法捕捉的方式影响LLM的可解释性和可靠性。我们建议在评估剪枝模型时纳入可解释性和校准指标。 ## 提交历史 来自:Pietro Tropeano [查看邮件 (https://arxiv.org/show-email/87a97d7a/2606.24970)] **[v1]**2026年6月23日星期二 11:07:59 UTC (2,526 KB)
相似文章
LLM预测模型知道但不说的话:探测内部表征以实现校准和忠实性
本文探测LLM预测模型的内部表征,以改进校准并评估思维链推理的忠实性。研究发现,探针能够实现更好的校准,并充当谎言检测器。
校准过度自信而不牺牲置信度:面向LLMs的探针条件化头部干预
本文介绍了一种推理时方法——探针条件化头部干预(PCHI),该方法通过在模型可能错误但保持高置信度时条件性地重新缩放注意力头输出,有选择地减少对错误答案的过度自信,同时不会显著降低对正确答案的置信度。
通过决策表征转变理解层剪枝大型语言模型中的性能崩溃
本文通过引入决策表征指标,分析了层剪枝 LLM 中的性能崩溃现象,并确定了维持模型完整性所关键的“沉默期”。
当正确信念崩溃时:临床压力下LLMs的认知韧性
本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。
When Compression Scores Cannot Decide: Information Boundaries for Group-Robust LLM Pruning
This paper analyzes why compression statistics for LLM pruning can be reproducible yet select suboptimal endpoints, introducing information boundaries and observation fibers to model the gap. It proposes group-resolved and model-specific mask selection methods that improve worst-group perplexity across dense LLMs and OLMoE.