别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响

arXiv cs.LG 论文

摘要

本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。

arXiv:2606.24970v1 公告类型:新 摘要:大型语言模型(LLM)剪枝通过移除网络部分来减少内存和推理成本,生成保留大部分准确率的更小模型。由于注意力层是LLM中最耗费资源的部分,对其进行剪枝是一种有前景的压缩策略。先前研究表明,最多可剪枝33%的注意力层而准确率损失极小。然而,注意力剪枝对模型可解释性(特别是忠实性和置信度校准)的影响仍未被研究。为填补这一空白,我们研究了在五个LLM和八个数据集上剪枝注意力层如何影响解释忠实性和置信度校准。虽然剪枝后的模型通常能维持高准确率,但我们发现其忠实性和校准常常下降。值得注意的是,即使准确率保持稳定,忠实性和校准也可能发生显著波动,凸显了模型置信度、可解释性和准确率之间的失调。我们的发现表明,层剪枝对LLM可解释性和可靠性的影响无法仅通过准确率和效率指标捕捉。我们建议在评估剪枝模型时纳入可解释性和校准指标。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:08

# 别毁了我的LLM:剪枝注意力层对解释忠实度和置信度校准的影响
来源:https://arxiv.org/abs/2606.24970
查看PDF (https://arxiv.org/pdf/2606.24970)

> 摘要:剪枝大型语言模型(LLMs)通过移除网络的部分组件来减少内存和推理成本,从而产生保留大部分准确性的更小模型。由于注意力层是LLM中最耗费资源的部件,剪枝它们是一种有前景的压缩策略。先前的研究表明,最多可以剪枝33%的注意力层而几乎不损失准确性。然而,注意力剪枝对模型可解释性(特别是忠实度和置信度校准)的影响仍未得到研究。为填补这一空白,我们研究了在五个LLM和八个数据集上剪枝注意力层对解释忠实度和置信度校准的影响。虽然剪枝后的模型通常保持高准确性,但我们发现它们的忠实度和校准能力往往会下降。值得注意的是,即使准确性保持稳定,忠实度和校准也可能显著波动,凸显了模型置信度、可解释性和准确性之间的失调。我们的研究结果表明,层剪枝可能以准确性和效率指标无法捕捉的方式影响LLM的可解释性和可靠性。我们建议在评估剪枝模型时纳入可解释性和校准指标。

## 提交历史

来自:Pietro Tropeano [查看邮件 (https://arxiv.org/show-email/87a97d7a/2606.24970)] **[v1]**2026年6月23日星期二 11:07:59 UTC (2,526 KB)

相似文章

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。