通过它们诱导的预测器评估解释方法

arXiv cs.LG 论文

摘要

论文提出了一种新的机器学习解释评估方法,通过将解释转换为预测器并测试其重现模型预测的能力。研究表明,像SHAP和PDP这样的解释方法的有效性取决于数据中特征的独立性。

arXiv:2609.20058v1 公告类型:新 摘要:机器学习模型的解释通常通过难以比较的标准来评判。我们提出了一种更简单的测试:如果一个解释真正描述了模型如何使用其特征,那么应该能够从它重建模型的预测。我们通过读取每个特征的效果并将其相加,将每个解释转换为预测器,并测量该预测器在未见数据上重现模型的效果。没有进行拟合,因此得分反映了解释本身。该测试适用于任何可以写成特征函数的解释;我们在部分依赖图(PDP)、累积局部效应(ALE)、SHAP和LIME上进行了演示。我们证明,当特征独立时,求和部分依赖曲线给出了模型的最佳可加摘要,而当特征依赖时则失败。在13个真实数据集、9个合成设计和四个模型族上,哪种方法得分最好完全取决于特征依赖:在特征独立的情况下,SHAP略逊于PDP,这与理论预测完全一致;在依赖的真实数据上,SHAP领先。一些广泛使用的质量指标甚至更倾向于受损的解释而非完整的解释。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:15

# 通过解释所诱导的预测器来评估解释方法  
来源:https://arxiv.org/html/2609.20058  
Jacob Selbæk, Hugo L. Hammer†  
†通讯作者:[email protected]  
所属机构:挪威奥斯陆大都会大学计算机科学系,挪威奥斯陆  
所属机构:SimulaMet整体系统系,挪威奥斯陆  
所属机构:奥斯陆大学医院整形与重建外科,挪威奥斯陆  

###### 摘要  
机器学习模型的解释通常依据难以比较的标准进行评估。我们提出一种更简单的测试:如果解释真正描述了模型如何使用其特征,那么应该能够根据该解释重建模型的预测。我们通过读取每个特征的影响并将其相加,将每个解释转化为一个预测器,并衡量该预测器在未见数据上重现模型预测的效果。该过程无需拟合任何参数,因此分数反映的是解释本身。该测试适用于任何可以写成特征函数的解释;我们在部分依赖图(PDP)、累积局部效应(ALE)、SHAP和LIME上进行了演示。我们证明,当特征独立时,累加部分依赖曲线可给出模型最佳的加性摘要;当特征相关时则失败。在13个真实数据集、9种合成设计和4个模型族中,哪种方法得分最佳完全取决于特征依赖性:在特征独立时SHAP略逊于PDP,这与理论预测一致;在依赖性真实数据上SHAP领先。一些广泛使用的质量指标甚至更倾向于受损的解释而非完好的解释。  

关键词:可解释人工智能⋅解释质量指标⋅解释预测  

## 1 引言  
事后解释方法现已成为黑盒模型的常规辅助工具,但如何区分好解释与坏解释的问题仍未解决。主流的评估标准(忠实性、鲁棒性、复杂性)各自捕捉了真实特性,但它们通过间接代理来评估解释:扰动引起的模型输出变化、对输入偏移的敏感性或归因质量的集中度。不同的解释方法通常对哪些特征驱动特定预测意见不一[1],且一些广泛使用的保真度指标即使在具有已知基准事实的透明模型上也无法恢复正确的保真度分数,因此无法给出可靠的排名[2]。  

本文从另一个角度出发。声称描述特征如何驱动模型预测的解释,隐含地提出了一个可证伪的主张:应能*利用*该描述进行预测。特征j的*部分依赖曲线*报告了当该特征被设置为值v而其余特征保持数据中的取值时,模型将做出的平均预测;因此它边际地描述了每个特征值的效果。一组Shapley值则说明了每个特征对某一特定预测的贡献程度。在两种情况下,这些内容都可以组装成一个函数,并在解释从未见过的点上进行评估。该诱导预测器在留出数据上的表现,直接量化了解释所携带的预测信息量。这是*可模拟性*的自动化类比,该标准要求人类受试者根据解释预测模型行为[3,4,5]。  

用固定、无参数的构造替代人类主体,代价是测量范围更窄:关注特定函数形式能提取的信息,而非人类能理解的内容。我们认为这笔交易是值得的,并在整个过程中明确说明其得失。  

##### 贡献。  
1. 1. 一个统一框架(第2.1节)将曲线值解释(即部分依赖图(PDP)[6]和累积局部效应(ALE)[7])和归因值解释(即SHapley加性解释(SHAP)[8]和局部可解释模型无关解释(LIME)[9])通过单一共享构造转化为预测器,使得它们之间的比较不受聚合机制差异的干扰。  
2. 2. 一个明确的可加性参考(第2.2节)。我们明确了一个已知的泛函方差分析等价关系(在特征独立性下,单位系数PDP代理是黑盒在加性函数上的L²投影),并得出两个文献中未提及的结论:系数重拟合在总体上无效,因此重拟合增益是特征*依赖性*的样本外信号;以及该投影再现模型方差的可加性份额(我们记为R²_add,并在公式15中正式定义)仅在相同的独立性条件下才是可加性解释的上界,我们随后实证表明该条件在真实数据上失效。  
3. 3. 构造本身的阴性对照(第3.3节)。将SHAP和LIME转化为曲线需要平滑步骤,而PDP和ALE不需要,因此方法间的差异可能源于平滑器而非解释本身。因此,我们将相同的平滑器应用于黑盒自身的预测(完全不涉及解释)。该平滑器表现逊于所有解释方法,这证实了我们报告的差异是解释质量的差异,而非归因聚合为全局曲线的方式的差异。  
4. 4. 解释质量指标本身的直接测试(第3.6节)。每个解释质量指标都断言了解释的排序,该断言是可检验的:按已知程度降级解释,然后观察哪个指标能察觉。对六个指标的测试发现,两个既定指标失败:不忠实性(Infidelity)被排列的解释击败,复杂性和稀疏性(Sparseness)更倾向于受损的解释而非完好的解释。  
5. 5. 一项受控研究(第2.3节和第3节),涵盖13个真实数据集、9种合成设计、4个模型族和2000个评估单元,包含空解释对照、分级损坏扫描以及与五个既定指标的对比。  

### 1.1 相关工作与定位  
##### 通过预测增益评估解释。  
最接近的概念先例是Pruthi等[10],他们通过“学生”模型在训练时使用教师解释(测试时不可用)所获得的准确率来量化解释价值。我们的框架共享“有用解释应赋予预测能力”的直觉,但在测量内容上有所不同:我们的核心构造是*无参数*的。训练过的学生本身是一个灵活的学习器,其增益混淆了解释的内容与学生的能力,足够强大的学生可以提取解释并未真正传达的信号。第2.2节的单位系数代理完全没有拟合参数(除偏移外);其效果完全可归因于解释。我们报告重拟合变体正是为了清晰展示这一区别。  

人类主体的可模拟性[5]用人类而非函数形式测量同一事物,具有互补性:它是衡量解释是否*可理解*的合适工具,而我们的是衡量是否*有信息量*的工具。  

##### 交互强度与泛函分解。  
Molnar等[11]定义了一个交互强度指标IAS,作为一阶ALE分解相对于黑盒的缩放近似误差,并明确指出在L²损失下IAS = 1 - R²,其中目标是模型自身的预测。因此我们的R²_add是*相同的量*(仅选择ALE还是PDP主效应(在独立性下重合)以及样本外而非样本内计算的区别)。我们未声称该统计量的创新性。我们的贡献是:(i)投影定理,精确说明该量何时是可达上界、何时不是;(ii)将其用作解释衍生预测器评分的归一化参考,而非模型选择的模型复杂性指标;(iii)实证证明在依赖性下它根本不是上界:在真实数据的每个(数据集,模型,方法)单元中,将每个解释达到的保真度与R²_add比较,48%的非PDP单元超过它。Molnar等使用该指标在模型间选择,其确切的边界状态对此用途无关紧要;我们将其用作评判解释的参考,为此必须说明其作为边界的条件。问题在于特征依赖性,而非计算该量的数据划分:依赖性在样本内和样本外都会破坏边界。底层分解来自Hoeffding[12],由Sobol[13]用于敏感性分析,并由Hooker[14]扩展到*依赖*输入,其广义泛函方差分析的存在正是因为当特征相关时边际分解失去了最优性。这种失效模式对我们来说并非不便;这正是我们的推论2转化为测量的内容。  

##### 蒸馏代理。  
拟合可解释的全局代理来模仿黑盒是既定做法;蒸馏-比较[15]是最接近的实例,将其蒸馏为GAM。区别在于方向:蒸馏的代理被*拟合*以尽可能好地模仿模型,而我们的代理是从已有解释*构造*的,不允许拟合任何东西。蒸馏结果告诉你加性模型能做什么;我们的则告诉你给定解释方法实际提供了其中多少。正是为此,我们包含直接拟合的样条GAM作为基线。  

##### 解释质量指标。  
忠实性通常通过根据解释扰动输入并检查模型是否如预测般响应来衡量[16,17];鲁棒性通过解释对小输入变化的敏感性衡量[18];复杂性通过归因质量的离散度(熵)衡量[17],稀疏性通过其基尼指数衡量[19]。ROAR[20]通过在特征消融数据上重新训练来评估归因,这也是拟合而非构造的比较。像Quantus[21]这样的工具包列举了数十个此类指标。大量文献是为图像分类的像素归因开发的,表格型、模型无关的场景相对探索不足。我们在相同的解释和划分上计算了其中五个指标(第3.5节),并报告我们的指标在何处与其一致、何处不一致,包括一处一致性高到值得自我警示的案例。一个更久远的相关方法是特征选择的包装方法[22],它通过在该特征子集上训练模型的性能来评判子集。我们的框架共享“通过预测评估”的逻辑,但不将解释简化为子集或排序:它消耗完整输出(每条曲线的形状、每个归因的值),这使得PDP和ALE能够被区分,因为它们在特征重要性上可能完全一致,但在曲线上存在差异。关于所评估方法的一般背景见[23];排列重要性[24,25]和针对树模型的SHAP估计器[26]在实现中使用。  

## 2 方法  
### 2.1 框架  
##### 符号。  
设X = (X₁, ..., Xₚ)为特征随机向量,取值于𝒳 ⊆ ℝᵖ,联合分布为P_X;X₋ⱼ表示移除第j个坐标的向量。小写x = (x₁, ..., xₚ)表示𝒳中的一个泛点,函数在该点求值,xⱼ为其第j个坐标。括号中的上标索引样本:x⁽ⁱ⁾ = (x₁⁽ⁱ⁾, ..., xₚ⁽ⁱ⁾)是第i个观测,xⱼ⁽ⁱ⁾为其第j个坐标;x⁽⁰⁾保留为测试点,预测器在该点求值。我们用P_{Xⱼ}表示Xⱼ的边际分布,用L²(P)表示关于P平方可积的函数空间,即满足∫h² dP < ∞的函数h,配备内积⟨h₁, h₂⟩ = ℰ[h₁(X)h₂(X)]。最后,L₀²(P_{Xⱼ})表示中心化子空间{h ∈ L²(P_{Xⱼ}) : ℰ[h(Xⱼ)] = 0}。  

设f̂: 𝒳 → ℝ为拟合的黑盒预测模型,其中对于回归,f̂是预测值;对于分类,它是标量分数。应用于训练样本上f̂的解释方法产生某种输出E:一组曲线、一个归因矩阵、一组局部模型。这些对象彼此不可比较,且都不是数字,因此都无法直接评分。在本文中,我们提出一个使我们能够评估和比较它们的框架。每个输出E被映射到一个函数g_E: 𝒳 → ℝ,一个仅由解释构建的预测器,可以在解释从未见过的点上求值。E的质量则*定义*为g_E的样本外准确率:  

Q(E) = R²(g_E, t) 在留出划分上,(1)  

其中目标t轮流取为  

- 原始结果y,解释保留了多少*任务*;  
- 黑盒自身的分数f̂(x),一个全局...

相似文章

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。

有效的解释支持不确定性下的规划

arXiv cs.CL

本研究论文提出了一种计算模型,通过模拟过程性解释在不确定性下如何指导行动规划来评估其有效性。通过四项实验,作者表明,被该模型赋予更高分数的解释被认为更有用,并能带来更好的导航表现。