可解释人工智能中鲁棒性与保真度审计的形式化方法框架:从应用到信任认证
摘要
本文介绍了一个用于审计事后可解释人工智能工具(如SHAP和LIME)的鲁棒性与保真度的方法框架,将这些指标结合成一个信任评分。该框架应用于马达加斯加的粮食安全数据集,强调了在敏感领域中审计XAI输出对于可信赖决策的必要性。
arXiv:2608.23817v1 公告类型:新
摘要:SHAP和LIME是现在解释黑箱预测的标准工具,但当输入被少量噪声扰动时,它们的输出可能会发生显著变化——我们在之前关于马达加斯加粮食安全的工作中亲身观察到了这个问题(Ralinirina等,2025)。这种变异性引发了是否可以信任这些解释的问题。我们通过构建一个审计协议来解决这个问题,该协议测量任何事后解释器的两个属性:鲁棒性(解释在输入扰动下的稳定性)和保真度(被认为重要的特征是否真正驱动模型的预测)。这两个量被结合成一个单一的信任评分。我们在马达加斯加的一个多部门数据集(83个特征,253条记录,4个营养不良类别)上运行该协议,使用三个分类器和两个解释器,以及它们的正则化对应物。结果令人警醒:AUC高于0.99的模型可能产生数值退化或完全无信息的解释,当模型过拟合时,保真度评分失去区分能力。这些发现表明,审计XAI输出不是可选的,而是必要的,特别是当它们在敏感领域中为决策提供信息时。
查看缓存全文
缓存时间: 2026/08/26 09:13
# 可解释AI鲁棒性与保真度审计的形式化方法论框架:从应用到信任认证
来源:https://arxiv.org/html/2608.23817
Rosa Elysabeth Ralinirina隶属单位:马达加斯加菲亚纳兰楚阿大学建模-计算机科学博士学院邮箱:[ralinirinarosa7@gmail\.com](mailto:)Jean Christian RalaivaoNiaiko Michaël Ralaivao隶属单位:马达加斯加菲亚纳兰楚阿大学建模-计算机科学博士学院Alain Josué Ratovondrahona隶属单位:马达加斯加菲亚纳兰楚阿大学建模-计算机科学博士学院Thomas Mahatody隶属单位:马达加斯加菲亚纳兰楚阿大学建模-计算机科学博士学院
###### 摘要
SHAP和LIME现已成为解释黑箱预测的标准工具,但当输入受到微小噪声扰动时,其输出可能存在显著差异——这一问题我们在先前关于马达加斯加粮食安全的研究中已直接观察到(Ralinirina等,2025 (https://arxiv.org/html/2608.23817#bib.bib1))。这种变异性引发了一个疑问:此类解释究竟是否值得信任?我们通过构建一个审计协议来解决此问题,该协议衡量事后解释器的两个属性:鲁棒性(解释在输入扰动下的稳定性)和保真度(被认定为重要的特征是否确实驱动了模型的预测)。这两个量被组合成一个单一的信任分数。我们在马达加斯加的一个多部门数据集(83个特征,253条记录,4个营养不良类别)上运行该协议,使用了三种分类器、两种解释器及其正则化对应版本。结果令人警醒:AUC超过0.99的模型可能产生数值上退化或完全无信息的解释,且当模型过拟合时,保真度分数会失去区分能力。这些发现表明,审计XAI输出不是可选的,而是必要的,尤其是在其为敏感领域的决策提供依据时。
关键词:可解释AI(XAI),鲁棒性,保真度,方法论框架,可信AI,粮食安全。
11脚注文本:本文稿经过同行评审,已被接受出版于会议论文集,并在国际应用信息学会议(ICAI 2026,https://icai.uni-eszterhazy.hu/2026/)上发表。这是修订版。组织者未及时向作者发送修订通知,因此论文未被收录于论文集中。## 1引言
当一个AI模型预测马达加斯加某地区可能发生粮食危机时,预测本身只是故事的一半。另一半——模型是如何得出这一预测的——是决策者、营养官员和现场工作人员信任并依据该输出采取行动所必需的。事后解释器如SHAP(Lundberg和Lee,2017 (https://arxiv.org/html/2608.23817#bib.bib12))和LIME(Ribeiro等,2016 (https://arxiv.org/html/2608.23817#bib.bib13))通过将重要性分数归因于输入特征来扮演这一角色。问题在于,这些归因并不总是可靠。对输入的微小扰动就可能改变它们,有时甚至显著改变,并且没有内置机制来判断解释器所强调的特征是否真正被模型使用。
我们在(Ralinirina等,2025 (https://arxiv.org/html/2608.23817#bib.bib1))中直接遇到了这个问题,当时我们对马达加斯加23个地区的粮食安全指标应用了SHAP和LIME。几乎相同输入的解释常常不同,并且重要特征的排名会因所使用的解释器而异。这并非孤立发现。Slack等人(Slack等,2020 (https://arxiv.org/html/2608.23817#bib.bib7))证明LIME和SHAP可以被有意欺骗;Alvarez-Melis和Jaakkola(Alvarez-Melis和Jaakkola,2018 (https://arxiv.org/html/2608.23817#bib.bib6))证明局部解释通常是不稳定的。Adadi和Berrada(Adadi和Berrada,2018 (https://arxiv.org/html/2608.23817#bib.bib3))以及Guidotti等人(Guidotti等,2018 (https://arxiv.org/html/2608.23817#bib.bib4))的综述警告说,事后方法制造了“透明性的幻觉”,而医疗保健(Stiglic等,2020 (https://arxiv.org/html/2608.23817#bib.bib10))和自然语言处理(Danilevsky等,2020 (https://arxiv.org/html/2608.23817#bib.bib11))领域的特定研究证实,仅凭目视检查显著性图是不够的。我们的研究小组也探索了AI驱动的复杂任务自动化(Ratovondrahona等,2023 (https://arxiv.org/html/2608.23817#bib.bib2)),这一研究方向与当前构建系统化、可验证的XAI审计方法论的目标相平行。
因此,问题不在于解释是否应该被审计——它们必须被审计——而在于如何进行。我们提出一个协议,衡量两件事:*鲁棒性*(在噪声下的稳定性)和*保真度*(对模型的忠实性)。每个都通过单一指标量化,两者组合成一个信任分数。我们在同一个马达加斯加粮食安全数据集上验证该协议,使用三种分类器(随机森林、XGBoost、神经网络)和两种解释器(SHAP、LIME),以及它们的正则化变体。结果证实,近乎完美的AUC并不能使解释免于不稳定或空洞,而信任分数将这些缺陷捕捉在一个单一的数值中。
第2节综述相关工作。第3节描述该框架。第4节呈现案例研究和结果。第5节讨论结果的意义——包括它们揭示的过拟合和数值问题。第6节总结。
## 2相关工作
事后可解释性在DARPA的XAI计划(Gunning和Aha,2019 (https://arxiv.org/html/2608.23817#bib.bib5))之后兴起,Adadi和Berrada(Adadi和Berrada,2018 (https://arxiv.org/html/2608.23817#bib.bib3))以及Guidotti等人(Guidotti等,2018 (https://arxiv.org/html/2608.23817#bib.bib4))的综述现在已编录了数十种方法。大多数是模型无关的:它们将预测器视为黑箱,并通过扰动输入来探测它。LIME(Ribeiro等,2016 (https://arxiv.org/html/2608.23817#bib.bib13))拟合一个局部线性模型;SHAP(Lundberg和Lee,2017 (https://arxiv.org/html/2608.23817#bib.bib12))计算Shapley值。两者都很流行,但两者都很脆弱。Slack等人(Slack等,2020 (https://arxiv.org/html/2608.23817#bib.bib7))展示了对抗性攻击,可欺骗LIME和SHAP产生任意解释。Alvarez-Melis和Jaakkola(Alvarez-Melis和Jaakkola,2018 (https://arxiv.org/html/2608.23817#bib.bib6))表明局部解释对邻域的选择是敏感的。
评估解释是一个独立且研究较少的问题。Samek等人(Samek等,2017 (https://arxiv.org/html/2608.23817#bib.bib14))主张进行定量评估而非目视检查。Holzinger等人(Holzinger等,2019 (https://arxiv.org/html/2608.23817#bib.bib15))提出了“可因果性”作为质量标准。领域特定研究确实存在——Islam等人(Islam等,2024 (https://arxiv.org/html/2608.23817#bib.bib8))针对医疗保健,Linheiro等人(Linheiro等,2023 (https://arxiv.org/html/2608.23817#bib.bib9))针对农业——但它们孤立地评估解释器,缺乏一个可以在同等基础上比较它们的统一协议。
我们的框架不同之处在于,它在一个流水线中将鲁棒性和保真度配对,并生成一个单一的信任分数。其优势不在于单个指标的新颖性——用于鲁棒性的Jensen-Shannon散度和用于保真度的特征消融都是众所周知的——而在于它们是在相同数据、相同模型上并行计算的,从而在解释器-模型对之间产生一个直接可比较的分数。
## 3方法论框架架构
图1(https://arxiv.org/html/2608.23817#S3.F1)展示了该流水线。给定一个训练好的模型 \( f \) 和一个解释器 \( E \),审计器为每个测试实例 \( x \) 计算鲁棒性分数 \( R(x) \) 和保真度分数 \( F(x) \),然后将它们组合成一个信任分数 \( T(x) = \alpha R(x) + \beta F(x) \),其中 \( \alpha + \beta = 1 \)。
参考标题图 1:审计流水线。鲁棒性与保真度被独立衡量,然后进行组合。### 3.1鲁棒性与局部稳定性
鲁棒性量化了当输入受到微小扰动时,解释发生了多大变化。我们从 \( \delta \sim \mathcal{N}(0, \sigma^2 I) \) 中抽取扰动,计算 \( E(x) \) 和 \( E(x+\delta) \),将两个重要性向量归一化为总和为1(记为 \( \tilde{E} \)),并衡量它们的散度:
\[
R(x) = 1 - \frac{1}{N} \sum_{i=1}^{N} D_{JS} \left( \tilde{E}(x) \, \| \, \tilde{E}(x+\delta_{i}) \right)
\]
其中 \( N \) 是扰动试验次数。当解释器对所有特征输出零重要性时,会出现一个实际困难——这发生在某些过拟合模型的TreeSHAP中,使得JSD未定义。我们通过在归一化前为 \( \tilde{E} \) 的每个分量添加 \( \epsilon = 10^{-10} \) 来解决这个问题。这对数值的影响可以忽略不计,但可以防止除以零。鲁棒性分数接近1意味着解释在扰动下几乎没有变化;分数接近0意味着变化很大。
### 3.2通过特征消融衡量保真度
保真度检查解释器称为重要的特征是否确实对模型很重要。对于具有解释 \( E(x) \) 的输入 \( x \),令 \( F_k \) 为前 \( k \) 个重要特征的集合。我们遮蔽它们(用特征均值替换)得到 \( x_{\setminus F_k} \) 并计算:
\[
F_k(x) = 1 - \frac{\| f(x) - f(x_{\setminus F_k}) \|}{\| f(x) \| + \epsilon}
\]
整体保真度是消融水平集合 \( \mathcal{K} \) 上的平均值:
\[
F(x) = \frac{1}{K} \sum_{k \in \mathcal{K}} F_k(x)
\]
保真度接近1意味着消融重要特征显著改变了预测;保真度接近0意味着解释器强调的特征模型实际上并未依赖。一个微妙之处:当模型极其自信时(对所有输入预测接近0或1),即使消融重要特征也几乎不改变输出,使所有 \( F_k \) 接近1。保真度随后变得无信息量——这一点我们将在第4.3.5节(https://arxiv.org/html/2608.23817#S4.SS3.SSS5)回讨论。这种特征重要性度量无信息或误导性的风险与(Hooker等,2021 (https://arxiv.org/html/2608.23817#bib.bib16))一致,他们证明基于置换的重要性可能迫使模型外推到其从未训练过的区域。
### 3.3信任分数
我们将两个指标组合成:
\[
T(x) = \alpha \cdot R(x) + \beta \cdot F(x), \quad \alpha + \beta = 1
\]
并在数据集上聚合:
\[
T(\mathcal{D}) = \frac{1}{\| \mathcal{D} \|} \sum_{x \in \mathcal{D}} T(x)
\]
我们默认设置 \( \alpha = \beta = 0.5 \),给予稳定性和忠实性同等权重。权重可以调整:在解释稳定性至关重要的情况下(例如,与非技术利益相关者沟通),可以设置 \( \alpha > 0.5 \)。
## 4案例研究:马达加斯加的粮食安全
### 4.1数据描述
该数据集汇总了马达加斯加农业部、公共卫生部和国家发展计划的官方报告。涵盖23个地区13年(2010-2023年)的数据,包括:
- •气候:降雨量、气旋事件、温度异常。
- •农业:水稻产量、土壤质量、虫害发生率。
- •社会经济:市场价格、家庭收入、交通质量。
- •营养:IPC营养不良阶段、儿童发育迟缓率、疫苗接种覆盖率。
- •人口统计:人口、识字率、入学率。
经过预处理(移除标识符和日期列,编码分类变量)后,我们得到83个特征和253个实例。目标变量Situation-MC(慢性营养不良)有4个有序类别,被视为多分类:可接受(3个实例)、不稳定(85个)、警报(114个)、危急(51个)。严重的类别不平衡——可接受类别仅有3个实例——限制了每类别AUC估计的可靠性,并使得分层交叉验证折无法包含所有四个类别,这一点我们将在下文回讨论。
### 4.2实验设置
三种分类器在82/18分层训练/测试集分割(208个训练实例,45个测试实例)上进行训练:
- •随机森林:100棵树,最大深度10。
- •XGBoost:200个估计器,学习率0.1,最大深度6。
- •神经网络:3个隐藏层(每层64个单元),ReLU,Adam优化器。
由于可接受类别仅包含3个实例,标准的5折分层交叉验证仅产生3个有效折(其余2折至少缺少一个类别)。在这3折上,宏观平均AUC达到 \( 0.998 \pm 0.002 \)(RF)、\( 0.999 \pm 0.002 \)(XGB)和 \( 0.994 \pm 0.001 \)(NN)。这些高值表明存在真实的类别可分性,尽管极端的不平衡使得每类别估计不可靠。
为评估正则化对解释质量的影响,我们还训练了三种正则化变体:
- •RFreg:最大深度6,每叶最小样本数5,500棵树。
- •XGBreg:最大深度3,学习率0.01,\( \lambda = 2 \)。
- •NNreg:丢弃率0.3,权重衰减 \( 10^{-4} \),早停(耐心值10)。
解释由SHAP(基于树的模型使用TreeSHAP,神经网络使用KernelSHAP)和LIME(默认参数)生成。审计在30个随机抽样的测试实例上运行,设置 \( \sigma = 0.1 \) 和 \( N = 10 \) 次扰动。消融水平为 \( \mathcal{K} = \{3, 5, 10, 41, 82\} \),对应于移除3、5、10、大约一半和几乎全部的83个特征。实现使用了Python 3.9以及scikit-learn、XGBoost、SHAP和LIME。
### 4.3结果
#### 4.3.1预测性能
表1(https://arxiv.org/html/2608.23817#S4.T1)报告了所有六个模型的测试集宏观平均AUC。原始模型的AUC均超过0.99;正则化神经网络降至0.888,表明当训练数据稀缺时,激进的正则化会降低性能。
表 1:每个模型的测试集宏观平均AUC。
#### 4.3.2鲁棒性
图2(https://arxiv.org/html/2608.23817#S4.F2)显示了鲁棒性分数。SHAP在基于树的模型上比LIME更鲁棒(RF:0.902 对比 0.700;XGB:0.978 对比 0.658)。XGBoost+SHAP的0.978鲁棒性分数需要 \( \epsilon \)-平滑:没有它,TreeSHAP对某些模型近乎确定预测的实例返回了零值重要性向量,使得JSD未定义。在神经网络上,SHAP和LIME更接近(0.694 对比 0.738),这可能是因为KernelSHAP引入了自身的采样噪声。
参考标题图 2:所有六个模型-解释器对的鲁棒性分数。XGBoost+SHAP使用了 \( \epsilon \)-平滑计算。正则化提高了SHAP在RF上的鲁棒性(0.923 对比 0.902),对XGBoost几乎没有影响(0.958 对比 0.978),而正则化NN显示出略高的SHAP鲁棒性(0.748 对比 0.694)。LIME的鲁棒性在所有模型中保持在0.66-0.76的范围内。
#### 4.3.3保真度
表2(https://arxiv.org/html/2608.23817#S4.T2)报告了每个消融水平的保真度。最显著的模式是XGBoost的平坦保真度:从 \( F_3 \) 到相似文章
ConceptSMILE:审计基于概念的可解释人工智能的可信度
ConceptSMILE是一个基于扰动的审计框架,用于评估基于概念的可解释人工智能的可靠性,已在视网膜眼底图像上进行了测试。
具有随时有效保证的 AI 系统自适应审计
本文引入了一种统计框架,利用安全随时有效推断(SAVI)技术对 AI 系统进行自适应审计,旨在基于有限数据得出严谨的结论。文章提出了一种“通过赌博进行测试”的方法,以验证模型的鲁棒性,同时在自适应采样过程中控制第一类错误。
评估安全关键型ATR系统中的可解释性:事后方法的局限性与迈向稳健型XAI的路径
本文评估了安全关键型自动目标识别(ATR)系统中的可解释性方法,突出了显著性图和注意力图等事后技术的局限性。提出了一种分类法和评估框架,以解决虚假解释和不稳定性等问题,倡导采用更稳健、基于因果关系的XAI方法。
I-SAFE:用于科学AI模型结构审计的Wasserstein一致性度量
本文介绍了I-SAFE,一个基于Wasserstein一致性度量的科学AI模型事后分布审计框架,它揭示了基于准确率的评估无法捕获的模型输出中的结构差异。在药物-靶点相互作用预测任务上进行了演示,该框架是模型无关的,适用于任何具有结构化输入和外部先验知识的领域。
高验证精度可能隐藏生产风险:使用SHAP在运行时暴露和阻止代理偏差[P]
本文展示了高验证精度如何可能隐藏AI模型中的代理偏差,并使用SHAP进行可解释性分析,以及通过运行时治理包装器执行公平性政策,防止生产环境中的偏差决策。