P$^2$CE: 模型无关的合理帕累托最优反事实解释
摘要
介绍P²CE,一种模型无关的算法,用于生成合理的帕累托最优反事实解释,该算法使用孤立森林异常检测器和SHAP值平衡了可行性、合理性和计算效率。
arXiv:2606.18418v1 公告类型:新
摘要:机器学习算法在社会应用中的日益普及引发了对公平性和透明度的担忧,从而推动了反事实解释的发展。这些解释通过提供可操作的输入特征变更,帮助个体理解并可能改变贷款申请、工作选择等领域的负面决策,从而获得期望的结果。现有方法往往难以平衡可行性、合理性和计算效率。为此,我们提出了P$^2$CE,一种用于生成合理的帕累托最优反事实解释的算法,为用户提供一组在可行性不同概念之间的最优权衡。P$^2$CE采用辅助孤立森林异常检测器来确保解释符合数据分布,并利用SHAP值在较短时间内获得最优结果,且不受底层模型影响。我们在三个数据集上对该算法进行了实证评估,结果表明,相较于相关技术,该算法在解质量和计算效率方面均表现出优越性能。
查看缓存全文
缓存时间: 2026/06/18 05:42
# P2CE:模型无关的可行帕累托最优反事实解释
来源:https://arxiv.org/html/2606.18418
\\equalcont
这些作者对本文贡献相同。
\[1\]\\fnmGiovani\\surValdrighi\\equalcont这些作者对本文贡献相同。
1\]\\orgdiv计算研究所,\\orgname坎皮纳斯州立大学,\\orgaddress\\street阿尔伯特·爱因斯坦大道,\\city坎皮纳斯,\\postcode13083-889,\\state圣保罗,\\country巴西
###### 摘要
机器学习算法在社会应用中的日益普及引发了对公平性和透明度的担忧,从而推动了反事实解释的发展。这些解释通过提供可操作的输入特征变更,帮助个体理解并可能改变贷款申请、工作选拔等领域的不利决策,从而获得期望结果。现有方法通常难以平衡可行性、合理性和计算效率。为此,我们提出了P2CE,一种生成可行帕累托最优反事实解释的算法,为用户提供一组关于不同可行性概念的最优权衡方案。P2CE 利用辅助孤立森林异常检测器确保解释符合数据分布,并借助 SHAP 值在较短时间内获得最优结果,且不依赖于底层模型。我们在三个数据集上进行了实证评估,结果表明,与相关技术相比,P2CE 在解质量和计算效率方面均表现出色。
###### 关键词:
反事实解释,多目标,异常检测
††footnotetext:本文为同行评审前预印本版本。
## 1 引言
参照图注图 1:一个包含两个特征的数据集示例。左图中,我们使用 KDE 估计了数据分布。右图中,两种算法为黑色参考点生成了一个反事实解释。三角形解释虽距离近,但位于数据分布之外;方形点是数据分布内的最近点,既可行又合理。
机器学习算法如今已悄然渗透到个体日常生活的诸多细微决策中。然而,这些算法也被用于对个体产生重大影响的决策,例如信用评分、选拔流程、健康诊断等。在这些情境下,支持个体获得期望的预测结果至关重要:“我的申请被拒绝了;我该怎么做才能让贷款获批?”此外,多国法规已要求对预测结果进行解释,例如欧盟《通用数据保护条例》(GDPR)。反事实解释正是为了回应此类关切而提出的 [wachter2017counterfactual],其定义为获取期望预测结果所需的特征值变更。此类解释的主要目标是忠实于模型的决策过程,并且具有可操作性 [karimi2021algorithmic]。反事实解释应具备可行性——即所建议的变更对于特定个体而言是可以实现的——并且应具备合理性——即这些变更在数据分布中是可能出现的观测结果。
给定一个观测值 xx,反事实解释可以表示为一个向量 x+ax+a,其中 aa 代表对每个特征所建议的变更。此前的研究已针对此背景展开,并讨论了衡量所建议变更 aa 可行性的不同方法 [verma2024counterfactual]。首先,建议的变更应较小,因为特征上的大幅变更对于个体而言可能无法实现(例如,建议收入增加十倍并不是一个有用的反事实解释)。其次,变更应稀疏,即只建议修改部分特征。这是因为大量的小变更可能不如对少量特征进行适度变更来得有效。此外,由于个体的主观偏好不同,没有单一的可行性度量能适用于所有场景。通过提供多种多样的解,可以支持不同的个人偏好。此前的研究通过定义加权损失 [mothilal2020explaining] 或采用多目标优化来获取帕累托最优解集 [raimundo2022mining],从而处理多目标问题。
然而,在最大化可行性时,算法可能会提出并非基于数据分布的解决方案。在图1中,我们展示了一个包含两个特征并使用欧几里得距离作为可行性度量的反事实解释示例。在此示例中,尽管三角形解在欧几里得距离上更接近参考样本(黑点),但它并不在数据分布之内。另一方面,正方形解可能离参考样本更远,但它确保了合理性。在这个简单的例子中,三角形解由 MAPOCAM [raimundo2022mining] 获得,而三角形算法是我们的解决方案。此前已有算法提出以确保反事实解释的合理性 [kanamori2021dace, poyiadzi2020face],但它们并未考虑多目标下的最优性重要性。
反事实解释算法也严重依赖于所考虑的模型。根据模型的复杂性,获得最优的反事实解释可能颇具挑战性。早期的工作针对可微分和线性模型提出了解决方案,而最近的方法则是模型无关的,即将模型视为一个只知道其预测结果的黑盒。尽管这些方法在计算成本上可能无法在所有模型上达到最优效率,但它们易于集成到实际应用中。
我们提出了 P2CE,一种旨在生成**可行**、**帕累托最优**反事实解释的算法。P2CE 借鉴了先前的工作 MAPOCAM,但进一步改进了算法以确保反事实解释的合理性。该算法还解决了先前研究的局限性,能够生成适用于任何模型的反事实解释。我们的方法基于在可能反事实解释的网格中进行分支定界搜索,但利用异常点检测和 SHAP 值来避免搜索无有用解的区域。该过程可以考虑反事实解释中常见的多个目标。P2CE 获得帕累托最优解;因此,在反事实解释空间中,没有任何其他解在所有目标上的成本都会更低或相等。总之,我们的贡献如下:
- • P2CE:一种新颖的模型无关算法,用于在多目标下生成最优的反事实解释,并确保解释位于数据分布之内。
- • 探索了 SHAP 的一个未被发掘的性质,该性质使我们能够预判一组变量是否能够实现反事实,从而扩展了反事实解释的模型无关能力。
- • 使用多个数据集和分类器对所提算法进行了广泛评估,并与相关技术进行了比较。评估考虑了多目标值、计算时间以及解的异常程度。
- •
## 2 背景与相关工作
我们现在对生成反事实解释的问题进行形式化描述,并介绍相关的重要工作。在本节及本文其余部分,我们假设可以访问一个从分布 PP 中采样的数据集 D=(X,Y); X∈Rn×d; Y∈{0,1}nD=(X,Y); X∈R^{n×d}; Y∈{0,1}^n。我们将 (xi,yix_i,y_i) 记为 DD 的第 ii 个样本,将 x(i)x(i) 记为向量 xx 的第 ii 个坐标。我们还拥有一个已拟合的分类器 f:Rd→[0,1]f:R^d→[0,1],它近似概率 f(x)≈P(Y=1∣X=x)f(x)≈P(Y=1∣X=x)。该分类器伴随一个阈值 τ∈[0,1]τ∈[0,1],当 f(xi)≥τf(x_i)≥τ 时,做出正向决策 y^i=1ŷ _i=1。
### 2.1 解释
随着复杂模型在深刻影响个体生活的应用中被广泛使用,可解释性已成为机器学习中一个非常重要的研究领域。“解释”以不同的形式呈现,但一般来说,它们试图回答“输入的哪些特征决定了模型的输出?”这个问题。这些解释可以是“全局的”,即对任何输入都有关于相关特征的一般性描述 [friedman2001greedy, goldstein2015peeking],或者是“局部的”,即对于特定的观测值 xx,我们希望获得相关特征集。LIME [ribeiro2016should] 和 SHAP [lundberg2017unified] 是最广泛使用的局部解释方法之一,它们提出了一个类似的概念:研究每个特征的微小扰动如何影响模型预测。对于给定的观测值 xx 和模型 ff,返回一个向量 φ∈Rdφ∈R^d,其中 φ(i)φ(i) 表示“特征 ii 在此预测中的重要性”。特别地,SHAP 具有性质 f(x)=E[f(x)]+∑i=1dφ(i)f(x)=E[f(x)]+∑_{i=1}^d φ(i),并且每个 φ(i)φ(i) 可以被视为特征 ii 对总预测 f(x)f(x) 的“贡献”。
### 2.2 反事实解释
与一般解释的概念(其目标是理解复杂模型预测背后的推理过程)不同,反事实解释旨在为个体提供**可操作**的可能性 [wachter2017counterfactual],这通常也被称为**可操作追索权** [ustun2019actionable, karimi2021algorithmic]。molnar2018guide 阐明,反事实解释是一种阐释“假设”情景的直观方法:“如果我年收入增加10%,信用评分的模型预测会是什么?”这些“假设”情景应考虑尽可能接近现实的世界,因为考虑荒谬的情景既不包含关于模型的相关信息,也不是一个**可操作**的解释。wachter2017counterfactual 将生成反事实解释的问题形式化如下:
argminx′maxλ λ(f(x′)−y′)2+c(x,x′)\operatorname*{arg\,min}_{x'} \max_{\lambda} \lambda(f(x')-y')^2 + c(x,x') (1)
此公式搜索一个预测 f(x′)f(x') 等于期望结果 y′y' 的值 x′x'。函数 cc 是 xx 与 x′x' 之间的距离,体现了“最接近现实世界”的概念。这个距离函数 cc 应该能够表示从 xx 到达 x′x' 在现实世界中的难易程度,即 x′x' 对于具有属性 xx 的个体而言是否是一个**可行**的情景。先前关于反事实解释的工作设计了算法来获得可行的反事实解释 [mothilal2020explaining, raimundo2022mining],并考虑了不同的度量 cc [verma2024counterfactual, guidotti2024counterfactual]。另一个关注点是解决方案应该是**合理**的,即建议的特征画像 x′x' 在现实数据中应该是可能出现的 [kanamori2021dace, poyiadzi2020face]。例如,观察到一个年轻人拥有高额投资的情况并不常见,反事实解释不应要求这一点。最后,为了满足个体偏好,提供多个且**多样**的反事实解释非常重要 [mothilal2020explaining, russell2019efficient]。
最近的研究也探讨了如何解决公式1中的优化问题及其类似形式。现有的一些解决方案仅限于特定模型,如线性模型 [ustun2019actionable, russell2019efficient]、树集成模型 [dutta2022robust, lucic2022focus, parmentier2021optimal]、图像模型 [augustin2022diffusion] 或可微分模型 [mothilal2020explaining]。模型无关算法 [karimi2020model, mothilal2020explaining, raimundo2022mining, brughmans2024nice, guidotti2024stable] 已被提出,它们因其能够在不施加限制的情况下应用于各种模型类型而具有显著优势。
### 2.3 帕累托最优反事实解释
在分类问题中,我们关注的是满足 f(x′)≥τf(x')≥τ 而 f(x)<τf(x)<τ 的反事实解释 x′=x+ax'=x+a。向量 aa 可称为一个**行动**,并且具有有用的解释:坐标 a(i)a(i) 表示第 ii 个特征需要增加/减少的量;如果 a(i)=0a(i)=0,则无需改变。文献中通过不同方式衡量可行性,这促使我们使用多目标距离函数 c:Rd×Rd:Rmc:R^d×R^d:R^m,其中我们有 mm 个目标。假设 N\mathcal{N} 是数值特征索引的集合,我们可以计算特征值变化的平均“长度”。我们称此度量为**平均连续距离**:
c1(x,w)=1#N∑i∈N|x(i)−w(i)|r(i)c_1(x,w)=\dfrac{1}{\#\mathcal{N}}\sum_{i\in\mathcal{N}}\dfrac{|x(i)-w(i)|}{r(i)} (2)
其中 r(i)r(i) 是特征 ii 的标准差。类似地,反事实解释的成本可以用变化的最大长度来表示。我们定义**最大连续距离**为:
c2(x,w)=maxi∈N|x(i)−w(i)|c_2(x,w)=\max_{i\in\mathcal{N}}|x(i)-w(i)| (3)
在处理分类特征时,我们无法直接衡量建议变更的长度。为了考虑这种变量类型,文献中的一种方法是衡量建议变更的数量,即取值不同的特征数量。这个度量也源于稀疏性的概念,认为对少量特征进行适度变更可能比对大量特征进行微小变更更可行。这可以在所有特征上计算,而不仅仅是数值特征。我们称之为**变更数量距离**:
c3(x,w)=∑i=1dI[x(i)≠w(i)]c_3(x,w)=\sum_{i=1}^d \mathbb{I}_{[x(i) \neq w(i)]} (4)
算法 1 MAPOCAM
1: procedure MAPOCAM(
ff,
xx,
A ̄\overline{\mathcal{A}},
cc,
kk)
2:
Q←{(0,0)}Q\leftarrow\{(\bm{0},0)\}
3: while
Q≠{}Q\neq\{\} do
4:
a,i←Q.pop()a,i\leftarrow Q.pop()
5: if
f(x+a)≥τf(x+a)\geq\tau then
6:
S←S∪{x+a}S\leftarrow S\cup\{x+a\}
7: continue
8: if PRUNE(
ff,
xx,
cc,
aa,
SS,
kk) then continue
9: for
v∈A ̄(i)v\in\overline{\mathcal{A}}(i) do
10:
a(i)←va(i)\leftarrow v
11:
Q←Q∪{(a,i+1)}Q\leftarrow Q\cup\{(a,i+1)\}
12: return
SS
13: procedure PRUNE(
ff,
xx,
cc,
aa,
SS,
kk)
14: for
z∈Sz\in S do
15: if
c(x,z)⪯c(x,x+a)c(x,z)\preceq c(x,x+a) then return true
16: if
∑j=1dI[a(j)≠0]\>k\sum_{j=1}^d \mathbb{I}_{[a(j)\neq 0]}\>k then return true
17:
f ̄a←\overline{f}_a\leftarrow maximum prediction
18: if
f ̄a<τ\overline{f}_a<\tau then return true
19: return false
当涉及多目标时,比较两个解 ww 和 zz 的偏好必须考虑所有目标。如果一个解在所有目标上都不被另一个解严格优于,则该解可以被视为非支配解。相似文章
PACE: 一种用于生成合理且可操作的反事实解释的神经符号框架
本文介绍了PACE,这是一个模块化的神经符号框架,结合了神经预测模型和符号推理,以生成符合领域特定可行性约束的反事实解释。在Adult Income数据集上的案例研究表明,结合符号规则能够产生更合理且可操作的解释。
A Generalized-Bayes Perspective on Counterfactual Explanations: Posterior-Based Decision-Making and Evaluation
This paper connects counterfactual explanations to generalized Bayes inference, showing that distance-minimization CEs are MAP estimates of a Gibbs posterior, and introduces new decision rules and evaluation metrics.
公平模型是否进行公平推理?信用决策中程序公平的反事实解释一致性
本文引入了反事实解释一致性(CEC)框架,通过对齐个体与其反事实对应物之间的特征归因,检测并缓解结果公平模型中的隐藏程序偏差,并在信用和收入数据集上进行了实验。
基于概念的扩散模型反事实视觉解释
介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。
CEL:全面的反事实解释库与基准测试
介绍CEL,一个统一的反事实解释库和基准测试,提供了18个数据集上14种方法的标准化实现,以实现在可解释AI中的公平比较。