从权重扰动到特征归因:解释全连接神经网络
摘要
提出一种基于权重扰动的特征归因方法(XWP和XWPc),用于全连接神经网络,在标准基线指标上取得了有竞争力的性能。
arXiv:2605.15328v1 公告类型:新
摘要:全连接神经网络(FCNN)通常被视为简单直观的架构,但它们却是更复杂模型的基础。然而,在其可解释性方面缺乏共识仍然构成挑战,这凸显了即使对于最先进的神经架构,基于归因的简单方法持续具有相关性。在这方面,我们探索了一种估计特征归因的新思路,即对特征所关联的权重而非特征值本身施加扰动。该方法提供了一个新视角,旨在缓解遮挡技术中的常见局限,如附加偏差和分布外数据。应用这一规则产生了一对新的归因方法,我们称之为XWP和XWP_c。基于简单规则,我们的方法在识别简单DNN的图像信号方面取得了有竞争力的性能,在标准基线指标上与最成熟的归因方法相抗衡。因此,我们的工作通过引入一个稳健的框架,为解决这些长期存在的脆弱性铺平道路,从而促进了可解释性领域的发展,并带来了更可靠和可解释的模型解释。
查看缓存全文
缓存时间: 2026/05/18 06:39
# 从权重扰动到特征归因:解释全连接神经网络
来源:https://arxiv.org/html/2605.15328
\(2026\)
###### 摘要
全连接神经网络(FCNN)通常被视为简单直观的架构,然而它们却是更复杂模型的基础。尽管如此,关于其可解释性仍缺乏共识,这构成了持续的挑战,也凸显了即便对于最先进的神经架构,基于归因的简单方法依然具有持久的相关性。为此,我们探索了一种估计特征归因的新思路:对特征所附着的权重施加扰动,而非扰动特征值本身。该方法提供了一个全新视角,旨在缓解遮挡技术中常见的局限性,如“附加偏置”和“分布外数据”问题。应用这一规则,我们形成了一对新颖的归因方法,称为 XWP 和 XWPc。基于简单规则,我们的方法在识别简单 DNN 的图像信号方面取得了有竞争力的性能,与最成熟的归因方法在标准基线指标上不相上下。因此,我们的工作为可解释性领域引入了一个稳健框架,为解决这些长期存在的脆弱性问题铺平了道路,从而促成更可靠、更可解释的模型解释。
可解释人工智能,可解释性,归因方法,遮挡技术
††版权:无 ††期刊年份:2026 ††DOI:XXXXXXX.XXXXXXX ††会议:;稿件正在审稿中;††CCS:计算方法 特征选择 ††CCS:计算方法 机器学习
请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题 请参阅标题
图 1. 我们提出的方法通过权重扰动估计特征归因所产生的归因图。
## 1. 引言
现代深度学习模型在从图像识别到自然语言处理的广泛任务中取得了显著性能。然而,这种成功是有代价的:随着模型规模和复杂性的增长,其内部决策过程变得越来越不透明,实际上成为了黑箱。这种不透明性在医学和自主系统等高风险领域带来了重大挑战,在这些领域中,理解和信任模型预测与预测本身同等重要。可解释人工智能(XAI)领域(Barredo Arrieta 等,2020 (https://arxiv.org/html/2605.15328#bib.bib4))正是为了弥合这一差距而出现的,旨在提供对人类可理解的模型行为洞察(Linardatos 等,2020 (https://arxiv.org/html/2605.15328#bib.bib17))。
归因方法是 XAI 中最早且最广泛采用的方法家族之一,旨在量化每个输入特征对模型输出的贡献(Zeiler and Fergus, 2014 (https://arxiv.org/html/2605.15328#bib.bib32))。其核心直觉是生成一个显著性图——为每个输入维度分配一个分数——反映其对给定预测的相对重要性。随着时间的推移,人们开发了一系列方法来估计这些分数。基于梯度的方法,如原始梯度(Vanilla Gradients)(Simonyan 等,2013 (https://arxiv.org/html/2605.15328#bib.bib25))和积分梯度(Integrated Gradients)(Sundararajan 等,2017 (https://arxiv.org/html/2605.15328#bib.bib27)),直接从模型相对于输入的梯度中推导出这些分数。基于反向传播的方法,如逐层相关性传播(LRP)(Binder 等,2016a (https://arxiv.org/html/2605.15328#bib.bib6))和 DeepLIFT(Shrikumar 等,2017 (https://arxiv.org/html/2605.15328#bib.bib24)),则将输出信号通过网络反向传播,根据定义的传播规则在层间重新分配相关性。基于扰动的方法,如 LIME(Ribeiro 等,2016 (https://arxiv.org/html/2605.15328#bib.bib22))和 SHAP(Lundberg and Lee, 2017 (https://arxiv.org/html/2605.15328#bib.bib18)),通过观察输出如何随输入的部分被系统性地掩蔽或改变而变化来局部近似模型。总的来说,这些方法构成了解释模型决策的稳健框架。
在另一项工作(Olah 等,2020 (https://arxiv.org/html/2605.15328#bib.bib20))中,作者引入了一个互补视角,应用成熟的技术——权重可视化和神经元优化——来直接探测模型的内部表示。然而,现代架构的规模和复杂性使得对单个组件的手动检查变得不可行,从而推动了机械可解释性(MI)(Bereska and Gavves, 2024 (https://arxiv.org/html/2605.15328#bib.bib5))的发展——这是一个系统性的框架,通过识别负责特定计算的电路和组件来逆向工程模型的决策过程。随着该领域的成熟,注意力转向了更复杂的架构(Elhage 等,2021 (https://arxiv.org/html/2605.15328#bib.bib10)),并且 MI 与因果性领域建立了天然联系(Kaddour 等,2022 (https://arxiv.org/html/2605.15328#bib.bib16); Geiger 等,2025 (https://arxiv.org/html/2605.15328#bib.bib13)):这两个学科都致力于干预推理,不仅寻求将输入与输出相关起来,更致力于识别支配模型行为的潜在机制。这种融合产生了揭示模型组件间因果关系的结构化方法,为理解神经网络如何编码和处理信息提供了基础性见解(Bereska and Gavves, 2024 (https://arxiv.org/html/2605.15328#bib.bib5); Geiger 等,2025 (https://arxiv.org/html/2605.15328#bib.bib13))。
尽管 MI 在解释模型内部过程的不同方面取得了近期成功,但即使在最简单的复杂架构——全连接神经网络(FCNN)(Elhage 等,2021 (https://arxiv.org/html/2605.15328#bib.bib10))上,关于模型可解释性也至今未达成明确共识。这构成了一个关键挑战,因为 FCNN 是 Transformer(Vaswani 等,2017 (https://arxiv.org/html/2605.15328#bib.bib28))的核心组成部分。在这项工作中,我们通过权重扰动的视角重新审视模型计算的基本原理,从而偏离了传统的遮挡方法。采用这一视角,我们制定了一个新颖的归因估计框架,避免了现有方法中输入扰动的常见陷阱,例如分布外数据问题。在这个框架内,我们引入了两种变体——XWP 和 XWPc——旨在以更高的准确性评估归因分数。我们在 FCNN 上验证了它们的有效性,为 Typeface MNIST 和 Fashion MNIST 数据集生成的 heatmap(图 1 (https://arxiv.org/html/2605.15328#S0.F1))显示了干净、与输入对齐的模式,没有先前工作中普遍存在的伪影。这两种变体共同提供了一种协同的方法来解释模型的决策过程,建立了一种基于扰动的可解释性的新范式。
## 2. 相关工作
**遮挡方法。** 它们是归因方法中的一个重要家族,依赖于对输入数据的遮挡和扰动来量化单个特征或区域对模型预测的贡献。最早的方法之一,遮挡敏感性(Occlusion Sensitivity)(Zeiler and Fergus, 2014 (https://arxiv.org/html/2605.15328#bib.bib32)),将一个掩蔽块滑过输入图像,观察输出置信度的相应变化,生成反映每个区域重要性的显著性图。基于这一原理,LIME(局部可解释模型无关解释)(Ribeiro 等,2016 (https://arxiv.org/html/2605.15328#bib.bib22))在给定输入周围生成扰动样本,根据它们与原始输入的接近程度进行加权,并拟合一个稀疏线性模型来近似任何黑箱分类器的局部决策边界。类似地,SHAP(Shapley 加性解释)(Lundberg and Lee, 2017 (https://arxiv.org/html/2605.15328#bib.bib18))将特征归因基于合作博弈论,计算 Shapley 值,通过在所有可能的特征子集上平均特征的边际贡献,公平地将预测输出分配给所有输入特征——这个过程本质上基于系统性的特征包含和排除。
后续工作已在多个方向上扩展和完善了基于扰动的归因。KernelSHAP(Lundberg and Lee, 2017 (https://arxiv.org/html/2605.15328#bib.bib18))和 SampleSHAP(Aydoğan and Aytekin, 2025 (https://arxiv.org/html/2605.15328#bib.bib3))提供了 Shapley 值的计算高效近似,因为其精确估计在计算上是难以处理的。有意义的扰动(Meaningful Perturbations)(Fong and Vedaldi, 2017 (https://arxiv.org/html/2605.15328#bib.bib12))将解释性掩蔽的搜索形式化为一个连续优化问题,惩罚那些最小程度改变输入但最大程度降低模型置信度的扰动。更近期,RISE(用于解释的随机输入采样)(Petsiuk 等,2018 (https://arxiv.org/html/2605.15328#bib.bib21))通过将数千个随机掩蔽版本的图像输入网络,并计算掩蔽的加权平均值(按相应输出分数缩放)来估计重要性图。然而,总的来说,这些方法存在严重的理论局限性,特别是在选择旨在表示信息缺失的基准值的过程中。具体而言,附加偏置问题(Sturmfels 等,2020 (https://arxiv.org/html/2605.15328#bib.bib26); Hsieh 等,2021 (https://arxiv.org/html/2605.15328#bib.bib15); Fel 等,2023 (https://arxiv.org/html/2605.15328#bib.bib11))通常会导致相对于模型固有偏置和图像特征的信息添加,而分布外问题(Gomez 等,2022 (https://arxiv.org/html/2605.15328#bib.bib14))则强调,由此产生的扰动样本可能位于训练数据分布边界之外,使得模型对此类输入的响应作为归因的基础不可靠。
**权重贡献。** 另一类方法则关注权重在模型决策过程中的关键作用。**权重扰动**基于改变模型参数的技术,用于改进模型的学习过程(Nowak and Lelowicz, 2021 (https://arxiv.org/html/2605.15328#bib.bib19))、对对抗样本的鲁棒性(Wu 等,2020 (https://arxiv.org/html/2605.15328#bib.bib30))以及数据重建(Samad 等,2021 (https://arxiv.org/html/2605.15328#bib.bib23))。在可解释性背景下,(Olah 等,2020 (https://arxiv.org/html/2605.15328#bib.bib20))的作者发现了权重与最优神经元激活之间的匹配对,用于解释单个神经元。(Arya 等,2024 (https://arxiv.org/html/2605.15328#bib.bib2))的作者将深度网络中的标准线性变换替换为一种新的 B-cos 操作,该操作在训练过程中强制模型权重与任务相关的输入模式对齐。这种**事前**方法能够有效地将模型行为总结为单一且高度可解释的线性映射。在另一项工作中,**嵌入式方法**(Chan and Veas, 2024 (https://arxiv.org/html/2605.15328#bib.bib8))在输入与第一个隐藏层之间引入了一个人工层,用于跟踪训练统计量(最常见的是权重和梯度)的演变,然后使用不同技术针对收集到的梯度或权重剖面来推断特征重要性。然而,对这些统计量的解释仍然难以捉摸。
## 3. 方法
请参阅标题
图 2. 在 TMNIST 上训练的 FCNN 第一层权重的可视化,展示了第一层特定神经元的情况。可以识别出与数字 0-9 对应的不同模式(前两行),以及其他更抽象的模式(第三行)。也存在模式缺失的情况(最后两张图),表示功能不明确的中性神经元。
### 3.1. 数学符号
考虑一个任意的全连接神经网络(FCNN)\(f = f^{L} \circ f^{L-1} \circ ... \circ f^{0}\),接收来自输入空间的输入 \(x \in \mathcal{X}\)。令 \(l\) 表示网络的任意内部层,由 \(n_l\) 个神经元组成,权重为 \(W^{l} \in \mathbb{R}^{n_{l-1} \times n_l}\),偏置为 \(b \in \mathbb{R}^{l}\)。该层的操作通过将非线性激活函数应用于输入 \(x_j^{l}\) 而得到的输出 \(z^{l}\) 来描述。因此,对于层 \(l-1\) 中的神经元 \(i\) 和层 \(l\) 中的神经元 \(j\),以下成立:
(1)
\[
x_j^{l} = \sum_{i \in [n_{l-1}]} z_i^{l-1} * w_{ij}^{l} + b_j^{l},
\]
(2)
\[
z_j^{l} = \sigma(x_j^{l}).
\]
\(\sigma\) 是 ReLU 激活函数,应用于所有中间层(最后一层使用 Softmax 除外)。对于输入层中的一个神经元 \(i\),我们采用符号 \(W_i = \{ w_{ij} | j \in l^1 \}\) 来表示其附属于第一层的权重集合,这将是我们研究的主要焦点。
### 3.2. 模型参数与模式形成
我们的方法将深度模型视为一个计算图——一个涉及神经元激活和模型参数的结构化操作序列。在这个框架中,参数充当控制机制,塑造有意义表示的形成,以最小化损失并实现准确决策。因此,它们在协调机器与人类目标方面起着关键作用,构成了我们研究解释由此产生的模式和表示过程的起点。
在 FCNN 的背景下,将输入特征与第一层特定神经元 \(W_j^T = \{ w_{ij} | i \in [n^0] \}\) 连接的权重视觉化揭示了可解释的模式(如图 2 (https://arxiv.org/html/2605.15328#S3.F2) 所示),并且可以很好地理解:它们展示了模型增强或抑制神经元激活的基序。这种双重行为反映了神经元的多语义性质(Olah 等,2020 (https://arxiv.org/html/2605.15328#bib.bib20)),其中单个单元整合了多个特征检测器。在 FCNN 的第一层,这种功能表现为对特定模式的强烈激活和对其他模式的抑制。
可视化权重 \(W_j^T\) 的主要贡献在于揭示了输入特征之间的空间结构。这是将在我们工作中被利用的一个关键观察。然而,对单个权重的解释并不能直接转化为估计输入神经元的贡献,因为输入神经元共同影响编码在权重中的所有模式。在这方面,(Olah 等,2020 (https://arxiv.org/html/2605.15328#bib.bib20))的作者通过构建最优输入信号推进了我们的理解:最大化特定内部神经元的激活,并将其模式与神经元权重的模式相匹配。尽管这种方法能够解释内部神经元并引入了新的 i相似文章
AGOP 作为解释:从特征学习到图像分类器中的逐样本归因
本文介绍了 AGOP-Weighted,这是一种事后归因方法,它将每个样本的梯度乘以训练分布先验,以抑制噪声并突出重要像素,并在合成和逼真的基准测试中展示了相较于现有方法的显著改进。
CAWI:面向随机神经网络的Copula对齐权重初始化方法
介绍CAWI,一种基于Copula的随机神经网络权重初始化方法,该方法建模特征间依赖关系,在83个分类基准上提升了预测性能。
@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…
NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。
从神经网络中定向恢复权重空间机制
本文提出Targeted Parameter Decomposition (tPD)方法,可针对特定输入选择性地从神经网络中恢复可解释的权重空间机制,相比全分解大幅降低计算需求。通过在玩具模型和Transformer语言模型上的验证,tPD能够忠实地恢复电路并进行手术级消融,且副作用极小。
权重反馈在现代深度网络中局部计算Jacobian转置
本文证明现代深度网络中预测编码(PC)使用的Jacobian转置乘积可以分解为局部可用的项,从而消除了自动求导反向传播的需要。提出的WF-Act-PC方法在CIFAR-10/100和Tiny-ImageNet上匹配甚至超越经过调优的反向传播基线,且性能随深度增加而提升。