通过Weight of Evidence评估特征重要性解释的对齐与稳定性
摘要
本文提出了一种使用Weight of Evidence评估可解释AI中特征重要性方法的新框架,增强了其与先验知识的对齐和稳定性评估。
arXiv:2609.00090v1 公告类型:新
摘要:特征重要性方法(FIMs)在可解释AI中广泛用于解释模型预测,但仅凭归因分数往往对底层推理过程提供的洞察有限。在这项工作中,我们通过将FIMs嵌入基于Weight of Evidence(WoE)的假设检验框架中,引入了一个新颖的视角。我们量化了观察到的证据对特征重要性的任何给定假设的支持强度。参考假设可以来自领域知识、真实情况或从FIM本身推导得出。这种公式化使得对FIMs的原理解评估成为可能,捕捉了它们与先验知识的对齐及其变异性。我们进一步提供了将WoE与归因方差联系起来的理论结果。实证结果表明了我们的策略在分析LIME和SHAP解释时,适用于不同参考假设的设置中的适用性和灵活性。总体而言,我们的框架通过对比性的、基于证据的视角,提供了一个评估FIMs的补充工具。
查看缓存全文
缓存时间: 2026/09/02 06:09
# 通过证据权重评估特征重要性解释的对齐性与稳定性 来源:https://arxiv.org/html/2609.00090 作者:Claudio Daka²·⁴, Álvaro Parafita¹, Antonio L. Alfeo³, Axel Brando¹, Mario G.C.A. Cimino⁴ 单位与邮箱: ¹ 巴塞罗那超级计算中心(Barcelona Supercomputing Center),西班牙巴塞罗那 · 邮箱:[[email protected]](mailto:[email protected]) · 邮箱:[[email protected]](mailto:[email protected]) ² SMARTEST研究中心,eCampus大学,意大利诺维德拉特 · 邮箱:[[email protected]](mailto:[email protected]) ³ 佛罗伦萨大学(University of Florence),意大利佛罗伦萨 · 邮箱:[[email protected]](mailto:[email protected]) ⁴ 信息工程系,比萨大学(University of Pisa),意大利比萨 · 邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 特征重要性方法(FIMs)在可解释人工智能(XAI)中被广泛用于解释模型预测,但仅凭归因分数通常难以深入理解模型的底层推理过程。本文通过将FIMs嵌入基于**证据权重(WoE)** 的假设检验框架,提出了一种新视角。我们量化了观测证据对任何关于特征重要性的假设的支持强度。参考假设可以源自领域知识、真实标签或FIM本身。这一表述使得对FIMs的评估更加原则化,既能捕捉其与先验知识的**对齐性**,也能反映其**变异性**。我们进一步提供了WoE与归因方差之间的理论联系。实证结果展示了本方法在不同参考假设设置下分析LIME和SHAP解释的适用性与灵活性。总体而言,本框架提供了一种互补工具,通过对比性、基于证据的视角评估FIMs。 ###### 关键词: 可解释性;证据权重;特征重要性方法 ## 1 引言 正如艾萨克·阿西莫夫所言,“……科学积累知识的速度远超社会积累智慧的速度”,机器学习的快速发展催生了日益复杂的模型,而我们对这些模型内部机制的理解却往往未能同步跟进。可解释人工智能(XAI)旨在解决这一问题,因为它能揭示信息如何在AI黑箱模型中被处理、预测如何被生成。在高风险领域,这种可解释性对于确保**信任、问责制和透明度**至关重要[8, 4]。在此背景下,已有多种解释技术被提出,包括特征重要性方法、反事实解释、原型和基于规则的方法[12, 7, 17]。然而,现有文献中,实证研究往往依赖于研究者关于何为“良好解释”的隐含假设,因为诸如“可解释性”或“可解释”等概念本身定义不一致,且缺乏普遍接受的评估标准(例如,如何确保透明度)[18]。正如Miller[22]指出的,这造成了解释的设计方式与其认知感知方式之间的张力。 为弥合这一差距,近期研究借鉴认知科学与社会科学,使XAI与人类推理方式对齐[13, 2, 3]。这些研究表明,解释本质上是**对比性的**(人类通过相对于某个“替代方案”来解释),并且是**选择性的**(聚焦于少数显著因素)。在XAI中,这通常通过**稀疏性**或**简洁性**来形式化,即将解释限制在少量特征上[15],从而促进知识迁移。本文基于此视角,采用**证据权重(WoE)框架**[29]——一种用于比较替代假设的、具有原则性的统计工具。我们将特征重要性(无论来自领域知识、模型的内在机制还是FIM本身)重新解释为可检验的假设,并使用WoE量化随机性FIM对这些假设的支持强度。 本研究的贡献总结如下: - • 提出一种将WoE适配于检验FIM假设的正式策略。根据参考假设的不同,本框架可以: - – 测试局部与全局解释之间的**对齐性**。 - – 度量**忠实性**与**真实标签对齐性**。 - – 捕捉随机性FIM的**稳定性**。 - • 证明当参考假设由FIM的平均归因生成时,低FIM变异性会导致WOE趋近于+∞。 本文结构如下:第2节回顾相关工作;第3节介绍WoE框架及其对随机性FIM的适配;第4节建立归因变异性与WOE正向发散之间的理论联系;第5节展示在三种互补设置下的实验评估;第6节讨论本方法的局限性;第7节总结并展望未来方向。 ## 2 相关工作 在XAI文献中,已有多种指标被提出用于衡量FIM的不同属性[15, 1]。然而,在功能性评估方面,目前尚缺乏衡量FIM与参考假设对齐程度的度量。为回答这一问题,我们采用**证据权重(WoE)框架**。据我们所知,在XAI中应用WoE的工作尚不多。其中,Melis等人[21]通过计算逐渐精炼的嵌套假设上的WoE值,序列化地生成解释。给定实例x和预测y*,作者构建了一个假设序列{y*} ⊆ U_T ⊆ ... ⊆ U_0 = Y,其中Y表示完整的输出空间(例如所有可能的类别)。通过评估每次精炼步骤关联的WoE,他们量化了可用证据(即实例x)如何逐步支持更具体的假设。 另一方面,Alshehri等人[3]将WoE应用于**目标识别(GR)** 领域,其目标是从一系列观测动作中推断智能体的预期目标。在此场景中,部分轨迹作为证据,WOE量化了观测到的动作(即智能体所做的步骤)对某个候选目标相对于竞争替代方案的支持强度。该框架自然契合此场景,因为它明确形式化了替代假设之间的比较。Le等人[16]将基于概念的解释与WoE相结合。他们通过监督与无监督方法提取可解释概念,并计算这些概念相对于目标假设h(对应于特定预测)的WoE。由于概念提取天然适用于图像,本工作将WoE从表格数据扩展到了图像。类似的方法见于[24],作者使用自定义度量量化解释中概念的存在与否,并在图像分类设置中,计算其相对于定义为目标预测集的假设的WOE。 与以往利用WOE生成或结构化解释的工作不同,我们采用了不同的方法。我们不是将WOE作为一种解释机制,而是将解释(无论来自FIM本身还是领域知识)视为关于特征相关性的可检验假设。在此视角下,解释指明了哪些特征被认为对模型决策负责、哪些不是,而WOE则用于量化通过分析FIM在多次运行中的行为能在多大程度上支持这一主张。 ## 3 证据权重 **证据权重(WOE)** 是信息论中的一个统计概念[29],指证据e在支持假设h相对于替代假设h'时的强度。形式化地,该关系通过对数几率表示为: woe(h:e) = log [O(h|e) / O(h)], O(h|e) = p(h|e)/p(¬h|e), O(h) = p(h)/p(¬h)。 (1) 利用贝叶斯定理,公式(1)可简化为所谓的证据似然形式: woe(h:e) = log [p(e|h) / p(e|h')]。 (2) 如果 woe > 0,证据e支持h而非其替代假设h'。结合公式(1)和(2),通过贝叶斯定理可得到一个后续有用的恒等式: log [p(e|h)/p(e|h')] = log [p(h|e)/p(h'|e)] + log [p(h')/p(h)]。 (3) 公式(3)将WOE与先验和后验对数几率联系起来。换句话说,可以将WOE视为在考虑证据e后,对先验对数几率的更新程度。为简化概率计算,本文假设 h' = ¬h 是互补解释,但该框架同样适用于任何替代假设h'。 ### 3.1 用于解释评估的证据权重 我们将WOE框架应用于FIM在固定实例x上的N次运行。令 α⁽ʲ⁾ = (α₁⁽ʲ⁾,...,α_d⁽ʲ⁾) ∈ ℝᵈ 表示在第j次运行(j=1,...,N)中产生的归因向量。这组运行提供了FIM对该实例解释行为的经验证据。受基于规则的表述[26, 9]启发,每个归因向量可推导出一个关于哪些特征相关的二元假设。具体而言,我们考虑相关特征集和非相关特征集: R_x = {i : 特征i 相关}, N_x ⊆ {1,...,d} \ R_x。 遵循**稀疏性**原则,我们仅关注相关集,并将假设写为: h = ∧_{i∈R_x} (i 相关)。 (4) 将连续归因向量α映射到集合R_x(从而映射到假设)的具体过程将在3.3节详述。 重要的是,参考假设(即我们希望检验FIM是否支持的假设)h* 有两个来源。首先,它可以源自证据本身,通过对经验平均归因 ᾱ = (1/N) Σⱼα⁽ʲ⁾ 应用选择程序得到;在此情况下,WOE捕捉的是**解释器的稳定性**²。其次,它可以反映外部信息,如真实的相关特征或领域知识;在此情况下,WOE衡量的是FIM与参考解释的**对齐性**†,同时考虑了FIM内在的变异性。 ### 3.2 量化随机性FIM的证据权重 在此框架下,WOE衡量经验证据对假设h相对于替代假设的支持强度,从而为解释评估提供了对比性、定量化的标准。使用公式(3),量化WOE归结为衡量先验和后验对数几率。当使用随机性FIM(例如LIME[25]、SHAP[19])解释黑箱模型时,解释可视为由FIM随机性诱导的随机变量α。 ##### 先验概率。 在没有先验信息的情况下,我们假设所有2ᵈ个可能的二元相关性赋值对d个特征服从均匀分布。公式(4)中的假设h是**部分性的**:它断言R_x中的特征是相关的,但不对剩余的 d - |R_x| 个特征做任何声明。因此,与h兼容的二元向量数量为 2^{d-|R_x|},得到: p(h) = 2^{d-|R_x|} / 2ᵈ = 1 / 2^{|R_x|}。 直观上,指定了较少特征相关的假设被赋予更高的先验概率,反映了更大的保守性。重要的是,这不是唯一可接受的先验。我们定义的策略可以容纳来自不同假设或知识的任何先验。 ##### 后验概率。 为估计p(h|e),我们利用FIM的随机性。在相同实例x上运行N次得到归因向量α⁽¹⁾,...,α⁽ᴺ⁾,每个向量通过选择程序推导出假设h⁽ʲ⁾。后验概率通过经验比例估计,即重现h的运行次数: ̂p(h|e) = (1/N) Σⱼ 𝟙{h⁽ʲ⁾=h}。 (5) 此蒙特卡洛估计允许我们计算后验对数几率,并进而计算WOE。 ### 3.3 特征选择与假设定义 本节解释从FIM生成假设的一些可能方法。这些选择是常见策略,其他方法可根据具体情境和分析类型考虑。为简化,令 α ∈ ℝᵈ 表示FIM的一次运行结果,使得 αᵢ ≥ 0(例如通过取绝对值)。令π
相似文章
通过归因可分离性衡量解释器稳定性
本文引入了一个基于分布的框架,通过量化特征排名的可分离性并识别在随机运行中保持可靠的最大top-k排名,来衡量归因方法(解释器)的稳定性。
归因不可能性:共线性下无特征排名可同时保证忠实性、稳定性和完备性
本文证明,在共线性条件下,没有任何特征排名能同时满足忠实性、稳定性和完备性,刻画了完整的归因设计空间,并提供了一个形式化验证的可解释AI不可能性定理。
可解释人工智能中鲁棒性与保真度审计的形式化方法框架:从应用到信任认证
本文介绍了一个用于审计事后可解释人工智能工具(如SHAP和LIME)的鲁棒性与保真度的方法框架,将这些指标结合成一个信任评分。该框架应用于马达加斯加的粮食安全数据集,强调了在敏感领域中审计XAI输出对于可信赖决策的必要性。
从权重扰动到特征归因:解释全连接神经网络
提出一种基于权重扰动的特征归因方法(XWP和XWPc),用于全连接神经网络,在标准基线指标上取得了有竞争力的性能。
时间序列分类中可解释人工智能软件框架的系统综述
本文系统综述了时间序列分类中可解释人工智能的软件框架,并比较了其特性、评估实践和限制。