计算病理学中的可解释人工智能(XAI):定义、分类法和建议

arXiv cs.AI 论文

摘要

本综述通过引入定义、分类法和任务驱动的建议,形式化了计算病理学中的可解释人工智能(XAI)方法,以应对临床采纳的挑战。

arXiv:2608.28820v1 Announce Type: new 摘要:计算病理学(CompPath)通过利用人工智能(AI)算法从千兆像素全切片图像中支持诊断、预后和治疗预测,正在改变医学。临床采纳正在进展,但受限于高风险临床环境中对安全性、责任和监管监督的担忧。可解释人工智能(XAI)系统有望建立信任并实现验证,但由于不一致的术语、重叠的方法论家族、临时验证和现有综述,文献仍然分散。本综述旨在通过以下方式形式化CompPath中的XAI方法:i)引入一个以病理学为中心的词汇表,包含七个核心术语;ii)开发一个跨越方法论家族和三个正交轴(阶段、类型、范围)的分类法;iii)建立一个任务驱动框架,将五个临床问题映射到推荐方法、方法评估和部署环境。本文识别了当前XAI能力与临床部署之间的五个关键差距,并提出了可操作的步骤以推进CompPath的XAI。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:41

# 计算病理学中的可解释人工智能(XAI):定义、分类体系与建议
来源:https://arxiv.org/html/2608.28820
**Shubham Innani**  
地址:印第安纳大学医学院病理科与检验医学部计算病理学部,印第安纳州印第安纳波利斯,美国  
地址:印第安纳大学梅尔文和布伦·西蒙综合癌症中心,印第安纳州印第安纳波利斯,美国  
**Suhang You**  
地址:印第安纳大学医学院病理科与检验医学部计算病理学部,印第安纳州印第安纳波利斯,美国  
地址:印第安纳大学梅尔文和布伦·西蒙综合癌症中心,印第安纳州印第安纳波利斯,美国  
**Adam Shephard**  
地址:华威大学计算机科学系组织图像分析中心,考文垂,英国  
**Francesco Ciompi**  
地址:拉德堡德大学医学中心病理科,奈梅亨,荷兰  
**Joe Yeong**  
地址:新加坡中央医院,新加坡  
**Nasir Rajpoot**  
地址:华威大学计算机科学系组织图像分析中心,考文垂,英国  
**Michael Feldman**  
地址:印第安纳大学医学院病理科与检验医学部计算病理学部,印第安纳州印第安纳波利斯,美国  
地址:印第安纳大学梅尔文和布伦·西蒙综合癌症中心,印第安纳州印第安纳波利斯,美国  
**Solène Florence Kammerer‑Jacquet**  
地址:拉德堡德大学医学中心病理科,奈梅亨,荷兰  
**Dimitrios Makris**  
地址:金斯顿大学伦敦计算机科学与数学学院计算机科学系,伦敦,英国  
**Geert Litjens**  
地址:拉德堡德大学医学中心病理科,奈梅亨,荷兰  
**Anne L. Martel**  
地址:多伦多大学医学物理系,安大略省多伦多,加拿大  
地址:Sunnybrook研究所物理科学平台,安大略省多伦多,加拿大  
地址:Vector研究所,安大略省多伦多,加拿大  
**Jana Lipkova**  
地址:加州大学欧文分校医学院,加利福尼亚州,美国  
**April Khademi**  
地址:多伦多都会大学,安大略省多伦多,加拿大  
地址:Vector研究所,安大略省多伦多,加拿大  
**Spyridon Bakas**  
地址:印第安纳大学医学院病理科与检验医学部计算病理学部,印第安纳州印第安纳波利斯,美国  
地址:印第安纳大学梅尔文和布伦·西蒙综合癌症中心,印第安纳州印第安纳波利斯,美国  
地址:金斯顿大学伦敦计算机科学与数学学院计算机科学系,伦敦,英国  
地址:印第安纳大学医学院生物统计与健康数据科学系;放射学与影像科学科;神经外科,印第安纳州印第安纳波利斯,美国  
地址:印第安纳大学卢迪信息、计算与工程学院计算机科学系,印第安纳州印第安纳波利斯,美国  
**通讯作者**:MICCAI SIG‑CompPath 通讯作者。  
电子邮箱:[[email protected]](mailto:[email protected])

###### 摘要
计算病理学(CompPath)正通过利用人工智能(AI)算法支持对吉像素全切片图像进行诊断、预后和治疗预测,从而改变医学。临床应用正在推进,但在高风险临床环境中,对其安全性、问责制和监管监督的担忧构成了限制。可解释人工智能(XAI)系统在建立信任和实现验证方面具有前景,但由于术语不一致、方法体系重叠、临时性验证以及现有综述等原因,文献仍然零散。本综述旨在通过以下方式对CompPath中的XAI方法进行规范化:i)引入一个以病理学为中心的词汇表,包含七个核心术语;ii)开发一个涵盖方法体系和三个正交轴(阶段、类型、范围)的分类体系;以及 iii)建立一个任务驱动框架,将五个临床问题映射到推荐的方法、方法评估和部署背景。本文指出了当前XAI能力与临床部署之间的五个关键差距,并提出了可行的步骤以推动CompPath的XAI发展。

###### 关键词:XAI,计算病理学,可解释性,分类体系,人工智能,可理解性

## 引言
组织病理学一直是疾病诊断的基石,传统上基于在显微镜下目视检查组织样本[1]。数字扫描仪和高通量基础设施的最新进展已将该领域转变为数字病理学,其中组织切片的玻璃载片被数字化为全切片图像(WSI)。这一转变使得大规模、数据驱动的计算分析得以应用于诊断、预后、治疗反应预测和生物标志物发现[2,3,67,113,6,7,112,22,10,11,12,114,14,15,16,17,18],定义了计算病理学(CompPath)领域。这些进步可以重塑诊断工作流程,提高效率、准确性和患者护理质量[19,20,21,22,23]。

[插图说明] 图1:CompPath流程包括数据获取、模型训练和结果生成。输入包括WSI和组织微阵列,以及病理报告、结构化临床和实验室数据、分子谱以及先前的影像学发现。结果包括分类、分割和生物标志物评分,以及由语言和视觉语言模型生成的文本输出,包括结构化报告草案、基于概念的检索结果和自然语言解释。XAI可以集成在此流程的任何部分,以评估预测是否依赖于临床相关证据。

近年来,用于病理图像的临床级AI工具,如Paige Prostate[24]和Ibex Galen[25],已获得癌症检测的监管批准。这些工具表明临床应用是可能的,但它们也凸显了一个核心挑战:与已建立成熟的医学技术不同,当前的AI模型是新的,现实世界中的部署有限,并且在不同患者群体中缺乏纵向验证。成熟的医疗设备通过多年的验证、明确的特性和整合到医学培训中来建立信任。CompPath中大多数当前的AI模型缺乏这种证据[19,20,21,26],并且它们在精选数据集之外的故障模式、鲁棒性和泛化能力仍未得到充分研究[27,12]。一个主要原因是,CompPath流程从数据获取到模型训练和结果生成,都依赖于复杂的深度学习(DL)模型,这些模型的决策过程无法直接理解或解释[102]。这些系统的不透明性意味着无法直接理解模型故障和缺乏鲁棒性,病理学家也无法始终追溯为何做出特定决策。可解释性是否是临床部署的严格先决条件是一个积极辩论的问题。最近由ESMO召集的37位专家德尔菲共识将基本事实、性能和泛化性列为基于AI的生物标志物的必备要求,而将可解释性视为推荐而非强制,这反映了一种观点,即在临床试验中验证的可重复工具可以证明其采用的合理性,而无需对每次预测提供机制性解释[30]。Ghassemi及其同事也类似地认为,当前的XAI方法常常在患者决策层面提供虚假的希望[31]。我们采取中间立场:可解释性并非总是严格要求,但它是建立信任的重要贡献者,特别是在早期采用、高风险临床决策和监管审查中。

为应对此挑战,人们提出了可解释人工智能(XAI)技术,以提供对这些工具决策过程的见解。图1展示了本综述给出的最终建议和指南,强调了XAI如何通过揭示底层模型推理来照亮“黑箱”。针对CompPath的XAI方法可以支持模型查询、失败分析以及评估预测是否与既定的病理学知识一致。它们的价值取决于应用:治疗反应预测、诊断决策支持或伴随诊断等高风险任务可能需要更强的可解释性证据,而分割图等较低风险或本质上可检查的输出可能需要不同形式的验证。因此,关键问题不在于XAI是否普遍需要,而在于在CompPath中,可解释性何时、为何以及对谁重要。

XAI文献中的一个持续挑战是术语不一致[32,33,34,35,2,1]以及缺乏分类和分类定义。诸如“可理解性”、“透明性”和“可解释性”等术语在技术和临床受众中经常互换使用,这造成了混淆,让人不清楚不同的XAI方法实际提供了什么,以及哪些方法体系更普遍。这种模糊性干扰了定义何为监管批准所需的充分可解释性证据的努力。它需要确定底层术语的含义,而研究、监管和临床社区之间不一致的使用会造成延迟。为解决此问题,我们基于先前关于XAI及其在生物医学成像中应用的基础工作[32,39,33,28,42,43,44,102,45],并专门针对CompPath进行调整。本综述的贡献如下:

1. **术语**:为CompPath定义七个XAI概念(可理解性、可解释性、透明性、因果有效性、因果能力、可证成性、可争辩性)(第2节,表1)。
2. **三轴分类体系**:沿三个正交维度定位XAI方法:阶段(内在与事后)、类型(特定于模型与模型无关)以及范围(局部与区域/切片与全局)(第3.2节,图2(a))。
3. **方法体系**:将该领域组织为五个方法体系(基于反向传播、基于扰动、基于特征、基于概念、基于示例)(图2(b)),其优势、局限性和验证实践总结在补充表3至7中。调研了100多项CompPath研究(第3.2节)。
4. **建议**:基于反映可解释性而非通用“最佳”方法的五个临床问题,提出XAI方法任务驱动应用的建议,包括关于模型架构、部署背景和验证要求的条件性指导(第3节,图3)。

## 定义
本文评估七个相互关联的术语,此处定义并整合在表1中。详细的基于病理学的定义和示例见补充部分S1。
“可理解性”、“可解释性”和“透明性”的使用不一致,这三个术语构成了一个紧密相关的家族,其共同目标是使模型行为对人类可理解。当需要:i)记录验证证据,ii)跨研究比较方法,iii)临床或监管审查者询问关于模型的具体主张实际意味着什么时,这些区分就很重要。最近由病理学创新协作社区(PICC)召集的多学科共识对相关术语“验证”也说明了同样的模式,该术语在传播科学、AI/ML、临床和实验室实践、监管科学和商业背景下具有显著不同的含义,并对临床转化产生了有记录的后果[30];同样的碎片化适用于XAI。

表1:CompPath XAI术语,被视为具有不同范围和评估标准的独立、互补概念。

我们提出的框架建立在先前的XAI文献之上,并为CompPath进行了调整。可理解性与可解释性之间的区别遵循Lipton[1]及其后的综述[2,33]。我们将透明性视为系统及治理层面属性的观点遵循Lipton[1]以及新兴的监管框架(欧盟人工智能法案、FDA关于基于AI/ML的软件作为医疗设备的指南)[14,13]。*因果能力*(Causability)的概念,即由领域专家判断的解释质量,来自Holzinger等人[24]。*因果有效性*(Causal validity)一词源于Campbell,他提出该词表示在特定研究环境中证实的因果关系[51,52];在XAI评估中,它已被采用来描述扰动模型的输入是否确实改变了预测,区分真正的输入-输出因果关系与仅仅是相关性[18,19]。术语

相似文章

联邦可解释人工智能:角色、架构、评估与开放挑战

arXiv cs.LG

对联邦可解释人工智能(FedXAI)的系统性综述,涵盖角色、架构、评估实践和开放挑战。提出了一个多轴分类法,讨论了从模型无关到可解释性设计的方法,强调了标准化和隐私感知评估方面的空白。