ConceptSMILE:审计基于概念的可解释人工智能的可信度

arXiv cs.AI 论文

摘要

ConceptSMILE是一个基于扰动的审计框架,用于评估基于概念的可解释人工智能的可靠性,已在视网膜眼底图像上进行了测试。

arXiv:2607.09649v1 公告类型:新 摘要:基于概念的可解释人工智能(AI)能够使模型推理更易于人类理解,但概念层面的输出并非自动可信。我们提出了ConceptSMILE,这是一种模型无关的、基于扰动的审计框架,用于评估基于概念的解释的可靠性。ConceptSMILE并非取代SMILE,而是将其基于扰动的逻辑从特征级或区域级归因扩展到对可理解概念解释的审计。该框架扰动输入区域,衡量概念响应的变化,应用局部加权,并拟合一个XGBoost替代模型以近似局部概念行为。通过归因准确性、替代模型保真度、忠实度、稳定性和一致性来评估可靠性。我们在视网膜眼底图像上,将MedSAM派生的视觉概念与基于VLM的语义概念进行比较,评估了ConceptSMILE。结果表明,不同概念和路径的可靠性存在差异:MedSAM在空间归因方面更强,且替代模型保真度最高($R^2 = 0.8503$,$R_w^2 = 0.8465$),而VLM路径在选定伪影条件下表现出更强的血管忠实度和稳定性。ConceptSMILE为评估基于概念的可解释AI的可信度提供了独立的审计层。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:54

# ConceptSMILE: 审计基于概念的可解释人工智能的可信度 来源: https://arxiv.org/html/2607.09649 Mohadeseh Mollapour 计算机科学学院 赫尔大学 赫尔, 英国 m\.mollapour\-papkyadeh\-2023@hull\.ac\.uk &Koorosh Aslansefat 计算机科学学院 赫尔大学 赫尔, 英国 k\.aslansefat@hull\.ac\.uk &Zeinab Dehghani 博士研究员 (工程), WMG 华威大学 考文垂, 英国 sara\.dehghani@warwick\.ac\.uk &Bhupesh Kumar Mishra 计算机科学学院 赫尔大学 赫尔, 英国 bhupesh\.mishra@hull\.ac\.uk &Tejal Shah 计算学院 纽卡斯尔大学 泰恩河畔纽卡斯尔, 英国 tejal\.shah@ncl\.ac\.uk &Zhibao Mian 计算机科学学院 赫尔大学 赫尔, 英国 z\.mian2@hull\.ac\.uk ###### 摘要 基于概念的可解释人工智能 (AI) 可以使模型推理更易于人类理解,但概念层面的输出并不自动可信。我们提出 ConceptSMILE,一种模型无关、基于扰动的审计框架,用于评估基于概念的解释的可靠性。ConceptSMILE 并非替代 SMILE,而是将其基于扰动的逻辑从特征或区域级别的归因扩展到对可理解概念解释的审计。该框架扰动输入区域,测量概念响应偏移,应用局部加权,并拟合 XGBoost 代理模型来近似局部概念行为。可靠性通过归因准确性、代理模型保真度、忠实性、稳定性和一致性来评估。我们通过比较 MedSAM 导出的视觉概念与基于 VLM 的语义概念,在视网膜眼底图像上评估 ConceptSMILE。结果表明,不同概念和路径的可靠性各不相同:MedSAM 实现了更强的空间归因和最高的代理模型保真度 (R²=0.8503, R_w²=0.8465),而 VLM 路径在特定伪影条件下表现出更强的血管忠实性和稳定性。ConceptSMILE 为评估基于概念的可解释人工智能 (XAI) 的可信度提供了独立的审计层。 ## 1 引言 人工智能系统越来越多地应用于高风险领域,在这些领域中,模型决策不仅需要准确,还需要透明、可靠和负责。深度学习、视觉变换器、多模态模型和基础模型在医学影像、自主系统、环境监测和决策支持等领域取得了强劲性能。然而,这些模型通常仍然难以解释,因为其内部推理通常通过高维潜在特征而非人类可理解的证据来表示 [4] (https://arxiv.org/html/2607.09649#bib.bib9)。当 AI 系统用于那些错误或理由不充分的决策可能影响人类安全、临床判断或公众信任的场景时,这种透明度的缺乏尤其成问题 [17] (https://arxiv.org/html/2607.09649#bib.bib10)。 可解释人工智能 (XAI) 的出现正是为了解决这个问题,使模型行为对用户和领域专家更易于理解。广泛使用的后处理方法如 LIME 和 SHAP 提供了识别重要输入特征的重要工具 [39] (https://arxiv.org/html/2607.09649#bib.bib4), [29] (https://arxiv.org/html/2607.09649#bib.bib5)。在计算机视觉中,Grad-CAM 也被广泛用于突出显示对模型预测有贡献的图像区域 [45] (https://arxiv.org/html/2607.09649#bib.bib6)。这些方法已应用于许多领域,包括医学图像分析,其中热力图和显著性图可以显示图像的哪些部分对预测有贡献。然而,基于区域的归因通常不足以用于高风险决策。热力图可能显示模型关注的位置,但未必能解释模型识别出了哪些临床、语义或操作上有意义的证据。先前的工作也表明,归因解释可能很脆弱或无法通过基本的可靠性检查 [3] (https://arxiv.org/html/2607.09649#bib.bib7), [16] (https://arxiv.org/html/2607.09649#bib.bib17)。在高风险环境中,这促使需要更可解释和负责任的解释策略 [41] (https://arxiv.org/html/2607.09649#bib.bib24)。 因此,基于概念的可解释人工智能 (C-XAI) 已成为提高可解释性的重要方向。基于概念的方法不是仅通过像素、标记或低级特征来解释预测,而是旨在通过人类可理解的概念来表达模型行为 [37] (https://arxiv.org/html/2607.09649#bib.bib11)。这些概念可能包括医学影像中的临床生物标志物、视觉推理中的对象和关系、空间建模中的地理单元,或多模态系统中的语义属性。概念激活向量引入了一种有影响力的方法,用于测试人类定义的概念如何影响模型预测 [21] (https://arxiv.org/html/2607.09649#bib.bib21)。概念瓶颈模型后来将概念直接集成到预测流程中,允许模型通过中间的人类可理解变量进行推理 [26] (https://arxiv.org/html/2607.09649#bib.bib22)。基于原型的模型通过解释预测与学习到的代表性示例的相似性提供了另一种途径 [12] (https://arxiv.org/html/2607.09649#bib.bib95)。最近,语言引导的概念方法展示了文本概念和视觉-语言对齐如何支持语义更丰富的解释 [49] (https://arxiv.org/html/2607.09649#bib.bib70)。总之,这些方法表明,概念可以在复杂模型和人类推理之间提供更有意义的接口。 然而,概念的存在并不能自动保证解释的可靠性。一个模型可能产生看似合理的概念输出,但仍然依赖于虚假相关性、不稳定的特征、标签泄漏、概念纠缠或不完整的表示 [33] (https://arxiv.org/html/2607.09649#bib.bib82)。概念瓶颈模型中的泄漏尤其成问题,因为概念变量可能编码有关目标标签的隐藏信息,而不是表示纯粹的人类定义概念 [19] (https://arxiv.org/html/2607.09649#bib.bib84)。其他工作也强调了在实践中获得鲁棒且解缠的概念表示的困难 [32] (https://arxiv.org/html/2607.09649#bib.bib67)。在高风险领域,这造成了关键的可靠性差距。一个概念解释可能具有人类可读性,但可能不忠实于模型的实际行为。它可能识别出一个有临床意义的概念,而模型的预测却是由伪影、采集偏差或非因果捷径驱动的。因此,基于概念的解释不应被视为本质上自解释的。它们需要独立的审计。 为了解决这个差距,我们引入了 ConceptSMILE (概念级统计模型无关可解释性与局部解释),它是 SMILE 的概念级扩展,旨在审计基于概念的解释的可信度。虽然 SMILE 专注于特征或区域级别的局部扰动可解释性,但 ConceptSMILE 将此思想调整到人类可理解的概念。具体来说,它扰动输入区域,测量概念响应偏移,应用局部加权,并拟合局部代理模型,以评估在受控扰动下概念级解释是否仍然忠实、稳定和一致 [6] (https://arxiv.org/html/2607.09649#bib.bib93)。它也遵循局部扰动解释的更广泛原则,即利用输入周围的改变来理解模型行为 [39] (https://arxiv.org/html/2607.09649#bib.bib4)。ConceptSMILE 不仅仅是问哪些输入区域影响模型输出,而是问:当输入被系统地扰动时,人类可理解的概念是否仍然准确、忠实、稳定和一致。 该框架是模型无关的,可应用于任何产生概念级响应的系统,包括分割模型、概念瓶颈模型、视觉-语言模型、多模态系统或其他基于概念的解释流程。ConceptSMILE 的操作方式是:首先从目标模型或解释路径中提取概念级输出。然后生成输入的受控扰动,测量每个概念响应在扰动下的变化,使用诸如余弦距离或 Wasserstein 距离之类的距离函数分配局部权重,并拟合局部代理模型以近似概念响应行为。在本研究中,使用 XGBoost 代理来捕捉扰动模式与概念置信度偏移之间潜在的非线性关系。生成的审计允许通过多个维度评估概念级解释的可靠性:归因准确性、保真度、忠实性、稳定性和一致性。 我们使用视网膜图像分析作为高风险医学案例研究来演示 ConceptSMILE。视网膜成像非常适合这种验证,因为它包含有临床意义的概念,如病变、血管和视盘结构,而且临床解释依赖于 AI 系统是否以可靠的方式使用这些概念。然而,视网膜成像并非该方法的边界。它在此被用作一个概念验证领域,以展示 ConceptSMILE 如何审计视觉和语义概念解释。具体来说,我们比较了基于 MedSAM 的视觉概念路径(用于分割引导的视觉概念)和基于视觉-语言模型 (VLM) 的语义概念级解释路径。图 1 (https://arxiv.org/html/2607.09649#S1.F1) 总结了本研究中使用的集成式基于概念的可解释性流程,显示了视网膜图像在 ConceptSMILE 审计之前如何通过概念路径进行处理。 本文的主要贡献如下: - •概念级 C-XAI 审计:我们引入了 ConceptSMILE,一个基于扰动的框架,用于评估基于概念的解释的可信度。 - •将 SMILE 扩展到概念解释:我们通过受控扰动、局部加权和代理建模,将 SMILE 从超像素级归因重新构建为概念级可靠性测试。 - •通过两种路径进行模型无关验证:我们在视网膜眼底图像上使用两种不同的概念提取路径演示了 ConceptSMILE:基于 MedSAM 的视觉概念和基于 VLM 的语义概念,通过归因准确性、保真度、忠实性、稳定性和一致性进行评估。 参见图注图 1:用于视网膜分析的集成式基于概念的可解释性流程。 ## 2 文献综述 本节回顾 C-XAI 及其在使模型推理更透明、可解释和可信方面的作用 [4] (https://arxiv.org/html/2607.09649#bib.bib9), [17] (https://arxiv.org/html/2607.09649#bib.bib10), [37] (https://arxiv.org/html/2607.09649#bib.bib11)。我们首先总结现有的后处理和可解释设计型 C-XAI 方法,然后检查可靠性挑战,如虚假相关性、概念泄漏、不稳定性和弱忠实性。这些差距促使 ConceptSMILE 成为一个模型无关、基于扰动的概念级解释审计框架,并通过视网膜图像分析作为高风险案例研究进行演示。 ### 2.1 基于概念的可解释人工智能 C-XAI 旨在通过人类可理解的概念(而非低级特征、像素或潜在激活)来解释模型行为。这一方向是对传统后处理归因方法局限性的一种回应,这些方法通常识别出有影响的区域,但并未清晰描述模型使用了何种语义证据 [4] (https://arxiv.org/html/2607.09649#bib.bib9)。相比之下,基于概念的方法寻求将机器推理与人类有意义的抽象概念对齐,例如对象、属性、临床生物标志物或领域特定的语义单元 [37] (https://arxiv.org/html/2607.09649#bib.bib11)。 早期的基于概念方法包括使用概念激活向量进行测试 (TCAV),它通过测量潜在空间中的方向敏感性来量化用户定义概念对模型预测的影响 [21] (https://arxiv.org/html/2607.09649#bib.bib21)。自动基于概念的解释 (ACE) 通过从图像片段中自动发现概念扩展了这一思想,减少了对预定义概念集的依赖 [16] (https://arxiv.org/html/2607.09649#bib.bib17)。其他后处理方法分析内部神经元、滤波器或表示空间是否对应于可解释的概念,从而提供关于训练模型如何编码语义信息的洞察 [8] (https://arxiv.org/html/2607.09649#bib.bib32)。 第二类方法将概念直接集成到模型架构中。概念瓶颈模型 (CBM) 强制预测通过一个中间概念层,使决策过程更加透明,并可能在概念层面允许人工干预 [26] (https://arxiv.org/html/2607.09649#bib.bib22)。更近期的概念嵌入模型 (CEM) 通过用更丰富的嵌入表示每个概念来放松严格的瓶颈结构,旨在改善可解释性与预测性能之间的平衡 [52] (https://arxiv.org/html/2607.09649#bib.bib25)。基于原型的模型通过解释预测与学习到的代表性示例的相似性,提供了另一种概念级推理形式 [12] (https://arxiv.org/html/2607.09649#bib.bib95)。 尽管有这些进步,基于概念的解释并不是自动可信的。一个模型可能产生看似有意义的概念,但仍然依赖于虚假相关性、不完整的概念表示或来自目标标签的信息泄漏 [33] (https://arxiv.org/html/2607.09649#bib.bib82)。后处理概念解释也可能强烈依赖于探测数据集、概念示例或表示层的选择,这可能影响其稳定性和忠实性 [38] (https://arxiv.org/html/2607.09649#bib.bib44)。这些局限性表明,C-XAI 不应仅根据其概念是否具有人类可读性来评估,还应评估这些概念在系统测试下是否保持可靠。这一可靠性差距正是 ConceptSMILE 的动机所在。ConceptSMILE 不是将基于概念的解释视为本质上自解释的,而是评估概念级输出在受控扰动下的行为。通过这种方式,它将基于概念的 XAI 从语义可解释性扩展到可衡量的可信度。图 2 (https://arxiv.org/html/2607.09649#S2.F2) 展示了视网膜眼底图像如何映射到人类可理解的临床概念,以支持概念级解释和预测。 参见图注图 2:基于概念的 XAI 在视网膜成像中的概述。该流程将眼底图像映射到人类可理解的临床概念,并利用它们支持概念级解释和预测。 #### 2.1.1 基于概念的可解释人工智能面临的挑战 尽管基于概念的可解释人工智能提供了一种更易于人类理解的解释形式,但概念级解释不应被视为固有其可靠性。一个模型可能产生对人类看似有意义的概念,但仍然依赖于不完整、不稳定或非因果的证据。这在高敏感度环境中尤其重要。

相似文章

推理一致性扫描:用于审计AI安全评估中思维链有效性的框架

arXiv cs.AI

本文介绍了推理一致性扫描,一种用于审计AI安全评估中思维链推理是否与最终答案逻辑一致的方法,并将其与忠实性区分开来。作者对不一致性子类型进行了形式化,构建了一个基准测试,实现了一个扫描器,并报告了跨模型和任务的研究结果。

面向工业视觉检测的架构感知解释审计

arXiv cs.LG

本文针对工业视觉检测提出了一种架构感知的解释审计协议,通过晶圆图和异常检测数据集上的实验证明,解释方法的保真度受其与模型原生决策机制的结构兼容性约束。