通过归因可分离性衡量解释器稳定性

arXiv cs.LG 论文

摘要

本文引入了一个基于分布的框架,通过量化特征排名的可分离性并识别在随机运行中保持可靠的最大top-k排名,来衡量归因方法(解释器)的稳定性。

arXiv:2608.02697v1 公告类型:新 摘要:归因方法(AMs)为每个特征分配重要性分数,并广泛用于解释黑盒模型。然而,由于定义中的随机成分,大多数方法可能产生可变的归因分数。在本文中,我们提出了一个基于分布的框架来捕捉归因分数的稳定性。具体而言,我们的方法能够理解排序归因向量中的可分离程度,并获取特征排名保持可靠的最大索引。我们进一步扩展该框架,以基于排名在数据集上的稳健性来比较归因方法。通过实验,我们展示了如何应用我们的方法来评估解释器的稳定性。总体而言,我们的方法为评估归因方法的稳定性提供了一个补充标准。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:41

# 通过归因可分性度量解释器稳定性

来源:https://arxiv.org/html/2608.02697
11institutetext:巴塞罗那超级计算中心,西班牙巴塞罗那11email:econti@bsc\.es11email:parafita\.alvaro@gmail\.com11email:axelbrando@gmail\.com###### 摘要

归因方法(AMs)为每个特征分配重要性分数,并被广泛用于解释黑盒模型。然而,由于定义中的随机成分,大多数方法可能产生可变的归因分数。在本文中,我们提出了一个基于分布的框架来捕获归因分数的稳定性。具体而言,我们的方法能够理解排序后的归因向量中的可分程度,并获得特征排序保持可靠的最大索引。我们进一步扩展该框架,以基于排序在整个数据集上的鲁棒性来比较不同的归因方法。通过实验,我们展示了如何应用我们的方法来评估解释器的稳定性。总体而言,我们的方法为评估归因方法的稳定性提供了一个补充标准。

## 1 引言

可解释人工智能(XAI)旨在使模型的决策过程对人类可理解。近年来,在高风险场景中采用复杂架构引发了研究人员对其潜在伦理和社会影响的担忧,例如不公平对待、偏见放大或歧视\[公平性\]、\[人工智能伦理\]。因此,理解这些模型如何推理并生成预测至关重要。

归因方法或解释器\[内在_事后\]旨在检测哪些特征对生成模型输出最相关(特征归因)。形式上,我们考虑一个将输入数据映射到输出变量的模型,f:X→Yf:\\mathcal\{X\}\\to Y,其中 f(x)f\(x\) 是给定实例 x∈X⊆Rnx\\in\\mathcal\{X\}\\subseteq\\mathbb\{R\}^\{n\} 的预测。一般而言,YY 可能表示离散类别或连续值域;本文中,我们关注常见的二分类设置,即 Y=\{0,1\}Y=\\\{0,1\\\}。那么,归因方法是一个函数 αf:Rn→Rn\\alpha\_\{f\}\\colon\\mathbb\{R\}^\{n\}\\to\\mathbb\{R\}^\{n\},为简洁记为 α\\alpha,其中对于 α\(x\)=\(α1,...,αn\)\\alpha\(x\)=\(\\alpha\_\{1\},\\ldots,\\alpha\_\{n\}\),αi\\alpha\_\{i\} 表示特征 xix\_\{i\} 对模型决策过程的重要性。文献中我们称之为局部解释,因为它们分析数据集中的特定实例。

在过去十年中,XAI 社区开发了广泛的归因方法\[Molnar,方法\_概述\],以及若干评估方案\[kadir2023评估,agarwal2022openxai\]。尽管方法论丰富,解释仍存在各种关键问题,包括可变性、不一致性和不真实性\[同意/不同意,ju2022逻辑\]。

在这项工作中,我们解决了 XAI 中的一个基本挑战:许多归因方法包含随机成分——例如 SHAP\[SHAP\] 和 LIME\[LIME\] 中的蒙特卡洛采样,或 DiCE\[dice\] 中的随机扰动——这可能导致解释在不同运行之间显著变化。这种不稳定性已被多项研究\[首次\_稳定性,Slack2019愚弄LA,dombrowski2019解释\]所证实,引发了关于可复现性和可靠性的担忧。正如 Pawlicki\[pawlicki2023走向\] 所强调的,稳定性是用户信任以及从解释中获得的见解具有泛化性的先决条件。

在这项工作中,我们聚焦于具有随机成分的解释器,并提出一种新颖的基于分布的策略来量化特征排序的稳定性。具体而言,我们提出一个度量,用于捕获在归因方法多次执行中前 kk 排序保持鲁棒的最大 kk。通过这一提议,我们可以衡量解释稳定性的一个特定方面,即归因向量中特征重要性值之间的可分程度。我们的贡献如下:

- •我们引入了一种新颖的方法,基于分布分析来量化归因方法排序的稳定性。我们的方法具有数学基础,能够评估排序在多大程度上是显著的。
- •我们从形式上证明——并通过实验验证——特征重要性的分离如何影响归因方法的整体稳定性。
- •我们进行了实验,展示了如何应用我们的度量来分析和比较不同模型和数据集上的归因方法。

## 2 相关工作

解释稳定性的问题已在文献中被深入研究。第一类方法与 Carvalho 等人\[carvalho2019机器学习\] 和 Gawantka 等人\[Gawantka2024\] 提出的分类法一致,他们分别将稳定性定义为“相似实例的解释有多相似”(Alvarez\-Melis\[alvarez2018走向\] 也支持这一观点)或“当解释随数据实例中不重要特征的微小变化而发生的改变最小时,观察到高稳定性”。与此定义一致,已有若干度量在输入层面建模扰动。Alvarez\-Melis 等人\[首次\_稳定性\] 形式化了局部解释方法的第一个稳定性度量,认为解释应对输入的局部扰动具有鲁棒性。Agarwal 等人\[重新思考\_稳定性\] 认为 Alvarez\-Melis 等人\[首次\_稳定性\] 的方法没有利用可能有意义的信息——例如模型的内部表示——来评估稳定性,并且隐含假设 ff 在接近的输入 xx 和 x′x^\{\\prime\} 上表现相似。因此,作者提出了几个相对稳定性度量:相对输入稳定性(衡量解释之间的相对距离与输入之间距离的关系);相对表示稳定性(改用 xx 和 x′x^\{\\prime\} 的内部表示);以及相对输出稳定性(用它们的 logits 输出替换 xx 和 x′x^\{\\prime\} 来计算相对距离)。类似地,Butt 等人\[稳定性\_扰动\] 关注给定实例 xx 的扰动输入上特征重要性值的一致性:他们生成一组扰动,并聚合这些扰动上特征重要性的变化。

从不同角度但仍处于输入层面,Pawlicki\[pawlicki2023走向\] 研究了 SHAP 在三种输入扰动下的稳定性:随机打乱值、随机插入中位数以及添加高斯噪声,以考察归因值如何受到影响。作者得出结论:打乱特征对 SHAP 稳定性的影响更显著,并且解释的稳定性在不同数据集之间存在差异,这可能归因于复杂性和特征的差异——正如 Butt 等人\[稳定性\_扰动\] 也观察到的那样。

一种不同的方法\[多重\_平滑\] 提出了解释稳定性的概念,考虑直接对 α\\alpha 进行扰动。概括其思想,他们考虑 αi∈\{0,1\}\\alpha\_\{i\}\\in\\\{0,1\\\}(即特征要么相关,要么不相关),稳定性意味着即使将更多解释性特征添加到 α\(x\)\\alpha\(x\) 中,预测也不会改变。为了考虑小扰动,作者考虑修改 α\\alpha 的少数条目。因此,通过分析特征选择中的微小修改是否影响模型预测来研究解释的鲁棒性。

在这种背景下,据我们所知,我们引入了一种不依赖于对解释器进行扰动或修改的新方法。相反,我们通过分布分析来研究归因方法的稳定性。具体来说,我们估计每次运行中每个特征重要性分数的分布,并使用一种度量来量化这些分布之间的重叠。重叠越低,表明特征排序越清晰,因此越可靠。这使我们能够评估所得排序是否显著以及显著程度,同时还能比较不同的归因方法。

## 3 问题定义

我们现在形式化我们的稳定性概念。具体而言,我们寻求回答以下问题:

研究问题:给定归因方法产生的有序特征重要性向量,我们能在多大程度上信任所得排序?更具体地说,我们有多大信心认为第一个特征确实比第二个特征更重要,第二个比第三个更重要,依此类推?

为了解决这个问题,我们将每个特征归因建模为一个分布,而不是一个确定性的单一值。给定归因向量 α\(x\)=\(α1\(x\),...,αn\(x\)\)\\alpha\(x\)=\(\\alpha\_\{1\}\(x\),\\dots,\\alpha\_\{n\}\(x\)\) 及其相关的逐维度分布 p1,...,pnp\_\{1\},\\ldots,p\_\{n\},我们将诱导排序 r\(x\)r\(x\) 定义为根据预期归因值排序的特征排列:

α~i=Eαi∼pi\[αi\]⇒r\(x\)=argsort\(α~\(x\)\)\.\\tilde\{\\alpha\}\_\{i\}=\\mathbb\{E\}\_\{\\alpha\_\{i\}\\sim p\_\{i\}\}\[\\alpha\_\{i\}\]\\quad\\Rightarrow\\quad r\(x\)=\\mathrm\{argsort\}\(\\tilde\{\\alpha\}\(x\)\)\.\(1\)

关键问题在于,由 r\(x\)r\(x\) 诱导的排序是否可靠。特别地,我们寻求量化排序中连续特征之间的可区分程度,从而确定对其相对位置可以赋予多少置信度。为此,我们对与 r\(x\)r\(x\) 中每对特征相关联的分布 pip\_\{i\} 和 pjp\_\{j\} 进行成对比较。对于每一对,我们计算一个距离 d\(pi,pj\)d\(p\_\{i\},p\_\{j\}\),其中 dd 是一个取值在有界区间(例如,\[0,1\]\[0,1\])内的度量,衡量两个分布之间的分离程度。

我们的归因可分性概念提供了一种灵活的方式,从多个角度分析稳定性的关键组成部分。在这个通用框架内,我们关注两个主要方面:\(i\) 归因向量上可分性的演变,以及 \(ii\) 所谓 k\\boldsymbol\{k\} \-稳定性的概念,它识别排名靠前特征的最大前缀,这些特征的排序可以被认为是可靠的。在附录A.1 (https://arxiv.org/html/2608.02697#S1.SS1) 中,我们展示了该框架如何自然地扩展到二元解释或基于组的解释(即,α∈\[0,1\]n\\alpha\\in\[0,1\]^\{n\})。

最后,我们强调该框架使用局部独立性的假设,即模型使用的特征在待解释样本的邻域内可以被视为独立的。这一假设在归因方法文献中很常见:参见\[SHAP,LIME,vstrumbelj2014解释,samiei2021解决,goldwasser2024统计,leemann2023事后\]。

### 3\.1 距离度量的选择

尽管该框架可以使用任何度量,但在本文中我们使用以下由 Conti 等人\[conti2026cid\] 引入的度量来量化两个分布之间的距离:

d\(p,q\)=1−∫supp\(p\)∩supp\(q\)min⁡\(p\(x\),q\(x\)\)dx∫supp\(p\)∪supp\(q\)max⁡\(p\(x\),q\(x\)\)dx\.d\(p,q\)=1\-\\frac\{\\int\_\{\\text\{supp\}\(p\)\\cap\\text\{supp\}\(q\)\}\\min\(p\(x\),q\(x\)\)dx\}\{\\int\_\{\\text\{supp\}\(p\)\\cup\\text\{supp\}\(q\)\}\\max\(p\(x\),q\(x\)\)dx\}\.\(2\)

该度量是 Jaccard 距离的连续推广,Jaccard 距离是广泛用于衡量集合之间重叠的度量。我们使用这个 dd,因为它被证明是一个度量,取值在 \[0,1\]\[0,1\] 内,并且特别适合捕获分布差异。

为了验证我们的框架,我们证明了以下命题。

###### 命题1(理想情况下的适定性)

设 x∈Rnx\\in\\mathbb\{R\}^\{n\} 为待解释的点,其真实重要性为 f1\>⋯\>fnf\_\{1\}\\>\\cdots\\>f\_\{n\}。考虑一个具有随机成分的归因方法 α\\alpha,在每次运行 s=1,...,ms=1,\\ldots,m 时产生一个归因向量 α\(s\)=\{α1\(s\),...,αn\(s\)\}\\alpha^\{\(s\)\}=\\\{\\alpha\_\{1\}^\{\(s\)\},\\ldots,\\alpha\_\{n\}^\{\(s\)\}\\\}。记 pi,mp\_\{i,m\} 为与值 \{αi\(s\)\}s=1m\\\{\\alpha\_\{i\}^\{\(s\)\}\\\}\_\{s=1\}^\{m\} 关联的经验概率密度函数。

假设对于每个 ii,当 m→∞m\\to\\infty 时,pi,mp\_\{i,m\} 依分布收敛到狄拉克测度 δfi\\delta\_\{f\_\{i\}\}。那么,对于在 (3 (https://arxiv.org/html/2608.02697#S1.E3)) 中定义的距离度量 d\(⋅,⋅\)d\(\\cdot,\\cdot\),我们有

d\(pi,m,pi\+1,m\)→1 当 m→∞,∀i∈\{1,...,n−1\}\.d\(p\_\{i,m\},p\_\{i\+1,m\}\)\\to 1\\quad\\text\{当 \}m\\to\\infty,\\quad\\forall i\\in\\\{1,\\ldots,n\-1\\\}。

这一结果在附录A\.4 (https://arxiv.org/html/2608.02697#S1.SS4) 中证明,确认了该度量在以下意义上是适定的:如果归因方法完全忠实并且其随机性渐近消失,那么它将达到最大可能的稳定性。

### 3\.2 kk\-稳定性

虽然可以通过跟踪 d\(pi,pj\)d\(p\_\{i\},p\_\{j\}\) 的值在归因向量上的变化来直接分析可分性的演变,但 kk\-稳定性的概念需要形式化定义。在许多应用中,归因方法被用来通过突出最相关的特征来解释预测;因此,我们特别关注评估排序顶部部分的可靠性。这促成了以下定义:

###### 定义1

给定阈值 l∈\[0,1\]l\\in\[0,1\] 和实例 xx,我们说归因方法 α\(x\)\\alpha\(x\) 是 *kk\-稳定的*,其中

k:=argmaxs∈\[n\] 使得 d\(pi,pj\)≥l ∀i,j∈As\(r\(x\)\),k:=\\operatorname\*\{arg\\,max\}\_\{s\\in\[n\]\}\\quad\\text\{使得 \}d\(p\_\{i\},p\_\{j\}\)\\geq l\\quad\\forall\\,i,j\\in\\mathcal\{A\}\_\{s\}\(r\(x\)\),这里 As\(r\(x\)\)\\mathcal\{A\}\_\{s\}\(r\(x\)\) 表示排序列表 r\(x\)r\(x\) 中前 ss 个索引的集合。

简单来说,kk 表示排序 r\(x\)r\(x\) 的最大前缀,其中所有连续排序的对 \(pi,pj\)\(p\_\{i\},p\_\{j\}\) 的距离 d\(pi,pj\)d\(p\_\{i\},p\_\{j\}\) 都超过阈值 ll。这一表述使我们能够评估归因排序中排名靠前特征之间的可分程度。虽然排序中较低的特征(即“尾部”)也可能在 dd 意义上被很好地区分,但我们的重点是确保顶部位置确实可区分,因为我们期望这些特征更相关。

k\-稳定性的概念在实例 xx 上的归因方法集合 Ax:=\{α\(x\):α是归因方法\}\\mathbb\{A\}\_\{x\}:=\\\{\\alpha\(x\):\\text\{$\\alpha$ 是归因方法\}\\\} 上诱导了一个全序关系。

###### 定义2

设 α1\(x\),α2\(x\)∈Ax\\alpha\_\{1\}\(x\),\\alpha\_\{2\}\(x\)\\in\\mathbb\{A\}\_\{x\} 是同一实例 xx 的两个归因映射,其对应的稳定性水平为 k1k\_\{1\} 和 k2k\_\{2\}。给定固定阈值 l∈\[0,1\]l\\in\[0,1\],我们说 α1\(x\)\\alpha\_\{1\}\(x\) 比 α2\(x\)\\alpha\_\{2\}\(x\) 更稳定,如果 k1≥k2k\_\{1\}\\geq k\_\{2\}。

结合定义1 (https://arxiv.org/html/2608.02697#Thmdefinition1) 和定义2 (https://arxiv.org/html/2608.02697#Thmdefinition2),两个归因方法通过 X\\mathcal\{X\} 中一个方法表现出更高 k\-稳定性的实例比例进行比较;在大多数实例上占优的归因方法被认为在平均意义上更稳定。

## 4 对所提稳定性度量的验证

在转向实验之前,我们需要澄清所采用的策略与研究问题直接一致。具体而言,我们想要表明所提出的度量——以及由此得到的 k\-稳定性值——对特征重要性值之间的可分程度敏感,而这种可分程度反过来又反映了诱导排序的可靠性。

为支持这一直觉,

相似文章

大规模语言模型的概率归因

arXiv cs.CL

本文提出了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,捕捉模型对令牌序列的内部表示,并通过熵分析提高可解释性。