应用于大语言模型的可解释性研究:对比分析
摘要
一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。
arXiv:2604.15371v1 公告类型:新投稿
摘要:大语言模型(LLMs)在许多自然语言处理任务中表现出色,但其决策过程仍然难以解释。这种缺乏透明度的问题为信任、调试和在实际系统中的部署带来了挑战。
本文对三种可解释性技术进行了应用对比研究:Integrated Gradients、Attention Rollout 和 SHAP,均应用于在 SST-2 情感分类任务上微调的 DistilBERT 模型。本研究的重点不在于提出新方法,而是在一致且可复现的设置下评估现有方法的实际表现。
研究结果表明,基于梯度的归因方法提供更稳定和直观的解释,而基于注意力的方法计算效率高但与预测相关特征的对齐度较低。模型无关的方法提供了灵活性,但引入了更高的计算成本和变异性。
本研究突出了不同可解释性方法之间的关键权衡,并强调了它们作为诊断工具而非确定解释的作用。这些发现为从事基于 Transformer 的自然语言处理系统研究和工程的人员提供了实用的见解。
这是一份预印本,尚未经过同行评审。
查看缓存全文
缓存时间: 2026/04/20 08:27
# 大型语言模型应用可解释性:比较研究 来源:https://arxiv.org/abs/2604.15371 查看 PDF (https://arxiv.org/pdf/2604.15371) > 摘要:大型语言模型(LLM)在许多自然语言处理任务中表现出色,但其决策过程仍然难以解释。这种缺乏透明度的问题为信任、调试和实际系统部署带来了挑战。本文对三种可解释性技术进行了应用比较研究:集成梯度、注意力汇总和 SHAP,应用于在 SST-2 情感分类任务上微调的 DistilBERT 模型。本研究的重点不在于提出新方法,而是在一致且可重复的设置下评估现有方法的实际行为。结果表明,基于梯度的归因方法提供更稳定和直观的解释,而基于注意力的方法计算效率高但与预测相关特征的对齐度较低。与模型无关的方法提供了灵活性,但引入了更高的计算成本和可变性。本研究强调了可解释性方法之间的关键权衡,并强调它们作为诊断工具而非最终解释的作用。研究结果为从事基于 Transformer 的 NLP 系统工作的研究人员和工程师提供了实用见解。这是预印本,尚未经过同行评审。 ## 提交历史 来自:Venkata Abhinandan Kancharla \[查看邮箱 (https://arxiv.org/show-email/cc8515f3/2604.15371)\] **\[v1\]** 2026 年 4 月 15 日星期三 13:07:29 UTC (353 KB)
相似文章
论大语言模型的固有可解释性:设计原则和架构调查
一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。
Virgil: 基于Transformer的语言模型可解释性导航
Virgil是一个交互式系统,旨在通过精选知识库和统一界面,帮助用户发现和比较用于基于Transformer的语言模型的可解释性工具。
可解释人工智能(XAI):从固有可解释性到大型语言模型
本文探讨了从人工智能中的固有可解释性到为大型语言模型开发和应用可解释方法的进展。
大型语言模型中的解释公平性:关于LLM在不同人口群体中如何证明决策的实证分析
本文提出了“解释公平性分类法”(Explanation Fairness Taxonomy, EFT),以分析大型语言模型(LLM)在不同人口群体中证明决策时的差异,研究发现尽管决策本身保持平衡,但在解释的质量和语调上仍存在显著偏差。
策略梯度在LLMs中的视觉化解释(8分钟阅读)
这篇博客文章视觉化地解释了大型语言模型中的策略梯度,通过一个数学问题的例子从头开始推导概念,以说明强化学习如何提升模型性能。