应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL 论文

摘要

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。

arXiv:2604.15371v1 公告类型:新投稿 摘要:大语言模型(LLMs)在许多自然语言处理任务中表现出色,但其决策过程仍然难以解释。这种缺乏透明度的问题为信任、调试和在实际系统中的部署带来了挑战。 本文对三种可解释性技术进行了应用对比研究:Integrated Gradients、Attention Rollout 和 SHAP,均应用于在 SST-2 情感分类任务上微调的 DistilBERT 模型。本研究的重点不在于提出新方法,而是在一致且可复现的设置下评估现有方法的实际表现。 研究结果表明,基于梯度的归因方法提供更稳定和直观的解释,而基于注意力的方法计算效率高但与预测相关特征的对齐度较低。模型无关的方法提供了灵活性,但引入了更高的计算成本和变异性。 本研究突出了不同可解释性方法之间的关键权衡,并强调了它们作为诊断工具而非确定解释的作用。这些发现为从事基于 Transformer 的自然语言处理系统研究和工程的人员提供了实用的见解。 这是一份预印本,尚未经过同行评审。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:27

# 大型语言模型应用可解释性:比较研究
来源:https://arxiv.org/abs/2604.15371
查看 PDF (https://arxiv.org/pdf/2604.15371)

> 摘要:大型语言模型(LLM)在许多自然语言处理任务中表现出色,但其决策过程仍然难以解释。这种缺乏透明度的问题为信任、调试和实际系统部署带来了挑战。本文对三种可解释性技术进行了应用比较研究:集成梯度、注意力汇总和 SHAP,应用于在 SST-2 情感分类任务上微调的 DistilBERT 模型。本研究的重点不在于提出新方法,而是在一致且可重复的设置下评估现有方法的实际行为。结果表明,基于梯度的归因方法提供更稳定和直观的解释,而基于注意力的方法计算效率高但与预测相关特征的对齐度较低。与模型无关的方法提供了灵活性,但引入了更高的计算成本和可变性。本研究强调了可解释性方法之间的关键权衡,并强调它们作为诊断工具而非最终解释的作用。研究结果为从事基于 Transformer 的 NLP 系统工作的研究人员和工程师提供了实用见解。这是预印本,尚未经过同行评审。

## 提交历史

来自:Venkata Abhinandan Kancharla \[查看邮箱 (https://arxiv.org/show-email/cc8515f3/2604.15371)\] **\[v1\]** 2026 年 4 月 15 日星期三 13:07:29 UTC (353 KB)

相似文章

论大语言模型的固有可解释性:设计原则和架构调查

arXiv cs.CL

一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。