通过Weight of Evidence评估特征重要性解释的对齐与稳定性

arXiv cs.LG 论文

摘要

本文提出了一种使用Weight of Evidence评估可解释AI中特征重要性方法的新框架,增强了其与先验知识的对齐和稳定性评估。

arXiv:2609.00090v1 公告类型:新 摘要:特征重要性方法(FIMs)在可解释AI中广泛用于解释模型预测,但仅凭归因分数往往对底层推理过程提供的洞察有限。在这项工作中,我们通过将FIMs嵌入基于Weight of Evidence(WoE)的假设检验框架中,引入了一个新颖的视角。我们量化了观察到的证据对特征重要性的任何给定假设的支持强度。参考假设可以来自领域知识、真实情况或从FIM本身推导得出。这种公式化使得对FIMs的原理解评估成为可能,捕捉了它们与先验知识的对齐及其变异性。我们进一步提供了将WoE与归因方差联系起来的理论结果。实证结果表明了我们的策略在分析LIME和SHAP解释时,适用于不同参考假设的设置中的适用性和灵活性。总体而言,我们的框架通过对比性的、基于证据的视角,提供了一个评估FIMs的补充工具。
查看原文
查看缓存全文

缓存时间: 2026/09/02 06:09

# 通过证据权重评估特征重要性解释的对齐性与稳定性
来源:https://arxiv.org/html/2609.00090  
作者:Claudio Daka²·⁴, Álvaro Parafita¹, Antonio L. Alfeo³, Axel Brando¹, Mario G.C.A. Cimino⁴  
单位与邮箱:  
¹ 巴塞罗那超级计算中心(Barcelona Supercomputing Center),西班牙巴塞罗那 · 邮箱:[[email protected]](mailto:[email protected]) · 邮箱:[[email protected]](mailto:[email protected])  
² SMARTEST研究中心,eCampus大学,意大利诺维德拉特 · 邮箱:[[email protected]](mailto:[email protected])  
³ 佛罗伦萨大学(University of Florence),意大利佛罗伦萨 · 邮箱:[[email protected]](mailto:[email protected])  
⁴ 信息工程系,比萨大学(University of Pisa),意大利比萨 · 邮箱:[[email protected]](mailto:[email protected])  

###### 摘要  
特征重要性方法(FIMs)在可解释人工智能(XAI)中被广泛用于解释模型预测,但仅凭归因分数通常难以深入理解模型的底层推理过程。本文通过将FIMs嵌入基于**证据权重(WoE)** 的假设检验框架,提出了一种新视角。我们量化了观测证据对任何关于特征重要性的假设的支持强度。参考假设可以源自领域知识、真实标签或FIM本身。这一表述使得对FIMs的评估更加原则化,既能捕捉其与先验知识的**对齐性**,也能反映其**变异性**。我们进一步提供了WoE与归因方差之间的理论联系。实证结果展示了本方法在不同参考假设设置下分析LIME和SHAP解释的适用性与灵活性。总体而言,本框架提供了一种互补工具,通过对比性、基于证据的视角评估FIMs。  

###### 关键词:  
可解释性;证据权重;特征重要性方法  

## 1 引言  
正如艾萨克·阿西莫夫所言,“……科学积累知识的速度远超社会积累智慧的速度”,机器学习的快速发展催生了日益复杂的模型,而我们对这些模型内部机制的理解却往往未能同步跟进。可解释人工智能(XAI)旨在解决这一问题,因为它能揭示信息如何在AI黑箱模型中被处理、预测如何被生成。在高风险领域,这种可解释性对于确保**信任、问责制和透明度**至关重要[8, 4]。在此背景下,已有多种解释技术被提出,包括特征重要性方法、反事实解释、原型和基于规则的方法[12, 7, 17]。然而,现有文献中,实证研究往往依赖于研究者关于何为“良好解释”的隐含假设,因为诸如“可解释性”或“可解释”等概念本身定义不一致,且缺乏普遍接受的评估标准(例如,如何确保透明度)[18]。正如Miller[22]指出的,这造成了解释的设计方式与其认知感知方式之间的张力。  

为弥合这一差距,近期研究借鉴认知科学与社会科学,使XAI与人类推理方式对齐[13, 2, 3]。这些研究表明,解释本质上是**对比性的**(人类通过相对于某个“替代方案”来解释),并且是**选择性的**(聚焦于少数显著因素)。在XAI中,这通常通过**稀疏性**或**简洁性**来形式化,即将解释限制在少量特征上[15],从而促进知识迁移。本文基于此视角,采用**证据权重(WoE)框架**[29]——一种用于比较替代假设的、具有原则性的统计工具。我们将特征重要性(无论来自领域知识、模型的内在机制还是FIM本身)重新解释为可检验的假设,并使用WoE量化随机性FIM对这些假设的支持强度。  

本研究的贡献总结如下:  
- • 提出一种将WoE适配于检验FIM假设的正式策略。根据参考假设的不同,本框架可以:  
  - – 测试局部与全局解释之间的**对齐性**。  
  - – 度量**忠实性**与**真实标签对齐性**。  
  - – 捕捉随机性FIM的**稳定性**。  
- • 证明当参考假设由FIM的平均归因生成时,低FIM变异性会导致WOE趋近于+∞。  

本文结构如下:第2节回顾相关工作;第3节介绍WoE框架及其对随机性FIM的适配;第4节建立归因变异性与WOE正向发散之间的理论联系;第5节展示在三种互补设置下的实验评估;第6节讨论本方法的局限性;第7节总结并展望未来方向。  

## 2 相关工作  
在XAI文献中,已有多种指标被提出用于衡量FIM的不同属性[15, 1]。然而,在功能性评估方面,目前尚缺乏衡量FIM与参考假设对齐程度的度量。为回答这一问题,我们采用**证据权重(WoE)框架**。据我们所知,在XAI中应用WoE的工作尚不多。其中,Melis等人[21]通过计算逐渐精炼的嵌套假设上的WoE值,序列化地生成解释。给定实例x和预测y*,作者构建了一个假设序列{y*} ⊆ U_T ⊆ ... ⊆ U_0 = Y,其中Y表示完整的输出空间(例如所有可能的类别)。通过评估每次精炼步骤关联的WoE,他们量化了可用证据(即实例x)如何逐步支持更具体的假设。  

另一方面,Alshehri等人[3]将WoE应用于**目标识别(GR)** 领域,其目标是从一系列观测动作中推断智能体的预期目标。在此场景中,部分轨迹作为证据,WOE量化了观测到的动作(即智能体所做的步骤)对某个候选目标相对于竞争替代方案的支持强度。该框架自然契合此场景,因为它明确形式化了替代假设之间的比较。Le等人[16]将基于概念的解释与WoE相结合。他们通过监督与无监督方法提取可解释概念,并计算这些概念相对于目标假设h(对应于特定预测)的WoE。由于概念提取天然适用于图像,本工作将WoE从表格数据扩展到了图像。类似的方法见于[24],作者使用自定义度量量化解释中概念的存在与否,并在图像分类设置中,计算其相对于定义为目标预测集的假设的WOE。  

与以往利用WOE生成或结构化解释的工作不同,我们采用了不同的方法。我们不是将WOE作为一种解释机制,而是将解释(无论来自FIM本身还是领域知识)视为关于特征相关性的可检验假设。在此视角下,解释指明了哪些特征被认为对模型决策负责、哪些不是,而WOE则用于量化通过分析FIM在多次运行中的行为能在多大程度上支持这一主张。  

## 3 证据权重  
**证据权重(WOE)** 是信息论中的一个统计概念[29],指证据e在支持假设h相对于替代假设h'时的强度。形式化地,该关系通过对数几率表示为:  
woe(h:e) = log [O(h|e) / O(h)],  O(h|e) = p(h|e)/p(¬h|e),  O(h) = p(h)/p(¬h)。 (1)  

利用贝叶斯定理,公式(1)可简化为所谓的证据似然形式:  
woe(h:e) = log [p(e|h) / p(e|h')]。 (2)  

如果 woe > 0,证据e支持h而非其替代假设h'。结合公式(1)和(2),通过贝叶斯定理可得到一个后续有用的恒等式:  
log [p(e|h)/p(e|h')] = log [p(h|e)/p(h'|e)] + log [p(h')/p(h)]。 (3)  

公式(3)将WOE与先验和后验对数几率联系起来。换句话说,可以将WOE视为在考虑证据e后,对先验对数几率的更新程度。为简化概率计算,本文假设 h' = ¬h 是互补解释,但该框架同样适用于任何替代假设h'。  

### 3.1 用于解释评估的证据权重  
我们将WOE框架应用于FIM在固定实例x上的N次运行。令 α⁽ʲ⁾ = (α₁⁽ʲ⁾,...,α_d⁽ʲ⁾) ∈ ℝᵈ 表示在第j次运行(j=1,...,N)中产生的归因向量。这组运行提供了FIM对该实例解释行为的经验证据。受基于规则的表述[26, 9]启发,每个归因向量可推导出一个关于哪些特征相关的二元假设。具体而言,我们考虑相关特征集和非相关特征集:  

R_x = {i : 特征i 相关},  N_x ⊆ {1,...,d} \ R_x。  

遵循**稀疏性**原则,我们仅关注相关集,并将假设写为:  
h = ∧_{i∈R_x} (i 相关)。 (4)  

将连续归因向量α映射到集合R_x(从而映射到假设)的具体过程将在3.3节详述。  

重要的是,参考假设(即我们希望检验FIM是否支持的假设)h* 有两个来源。首先,它可以源自证据本身,通过对经验平均归因 ᾱ = (1/N) Σⱼα⁽ʲ⁾ 应用选择程序得到;在此情况下,WOE捕捉的是**解释器的稳定性**²。其次,它可以反映外部信息,如真实的相关特征或领域知识;在此情况下,WOE衡量的是FIM与参考解释的**对齐性**†,同时考虑了FIM内在的变异性。  

### 3.2 量化随机性FIM的证据权重  
在此框架下,WOE衡量经验证据对假设h相对于替代假设的支持强度,从而为解释评估提供了对比性、定量化的标准。使用公式(3),量化WOE归结为衡量先验和后验对数几率。当使用随机性FIM(例如LIME[25]、SHAP[19])解释黑箱模型时,解释可视为由FIM随机性诱导的随机变量α。  

##### 先验概率。  
在没有先验信息的情况下,我们假设所有2ᵈ个可能的二元相关性赋值对d个特征服从均匀分布。公式(4)中的假设h是**部分性的**:它断言R_x中的特征是相关的,但不对剩余的 d - |R_x| 个特征做任何声明。因此,与h兼容的二元向量数量为 2^{d-|R_x|},得到:  
p(h) = 2^{d-|R_x|} / 2ᵈ = 1 / 2^{|R_x|}。  

直观上,指定了较少特征相关的假设被赋予更高的先验概率,反映了更大的保守性。重要的是,这不是唯一可接受的先验。我们定义的策略可以容纳来自不同假设或知识的任何先验。  

##### 后验概率。  
为估计p(h|e),我们利用FIM的随机性。在相同实例x上运行N次得到归因向量α⁽¹⁾,...,α⁽ᴺ⁾,每个向量通过选择程序推导出假设h⁽ʲ⁾。后验概率通过经验比例估计,即重现h的运行次数:  
̂p(h|e) = (1/N) Σⱼ 𝟙{h⁽ʲ⁾=h}。 (5)  

此蒙特卡洛估计允许我们计算后验对数几率,并进而计算WOE。  

### 3.3 特征选择与假设定义  
本节解释从FIM生成假设的一些可能方法。这些选择是常见策略,其他方法可根据具体情境和分析类型考虑。为简化,令 α ∈ ℝᵈ 表示FIM的一次运行结果,使得 αᵢ ≥ 0(例如通过取绝对值)。令π

相似文章

通过归因可分离性衡量解释器稳定性

arXiv cs.LG

本文引入了一个基于分布的框架,通过量化特征排名的可分离性并识别在随机运行中保持可靠的最大top-k排名,来衡量归因方法(解释器)的稳定性。