一种可迁移的基于阈值的可解释医学数据分类框架

arXiv cs.LG 论文

摘要

本文介绍了一种基于统计的框架,使用伯努利朴素贝叶斯和χ²引导的二值化进行可解释的临床分类,在基准数据集上取得了有竞争力的AUC分数,同时提供了明确的决策规则和校准的风险估计。

arXiv:2607.15394v1 公告类型:新 \n 摘要:黑盒模型因其缺乏可解释性和可重复性而限制了人工智能在医学领域的应用。我们介绍了一种基于统计的框架,使用伯努利朴素贝叶斯(BNB)模型提供完全可解释的基于规则的临床分类。该方法对连续变量应用监督的$\chi^2$引导的统计二值化,识别在训练数据中与临床结果关联最大化的阈值。这种转换使得BNB能够在连续医学数据上有效运行,而不牺牲其固有的透明性。该方法在三个基准数据集上进行了评估:皮马印第安人糖尿病、威斯康星乳腺癌和心力衰竭预测,在皮马分析中实现了0.800的曲线下面积(AUC)分数,在威斯康星乳腺癌中为0.984,在心力衰竭预测中为0.919。除了区分能力外,还使用防泄漏的交叉验证校准分析评估了概率可靠性,包括Brier分数、校准截距/斜率以及事后beta校准,这改善了各数据集的概率校准。这些结果表明,一个统计可解释的框架可以达到与更复杂模型相当的性能,同时提供明确的、具有临床意义的决策规则和校准的风险估计。为了具体说明这种透明性,一个完整的工作示例展示了仅使用参考表和基本算术即可重现模型推理,无需借助软件或专有工具。这项工作为在现实医疗环境中支持可信赖且可推广的人工智能提供了一种实用方法。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:27

# 一种基于可迁移阈值的医学数据可解释分类框架

来源:https://arxiv.org/html/2607.15394

Antony Garcia¹,³,†Adrián Noriega⁴,⁵,⁶,⁷§Gabrielle Britton²,‡Xinming Huang¹,⁵,∗

¹伍斯特理工学院,伍斯特,马萨诸塞州,美国;²疫苗接种与研究中心 (CEVAXIN),巴拿马,巴拿马;³巴拿马科技大学,巴拿马,巴拿马;⁴麻省理工学院,剑桥,马萨诸塞州,美国;⁵麻省理工学院与哈佛大学博德研究所,剑桥,马萨诸塞州,美国;⁶麦吉尔大学,蒙特利尔,魁北克,加拿大;⁷蒙特利尔神经病学医院-研究所,蒙特利尔,魁北克,加拿大

###### 摘要

黑盒模型因缺乏可解释性和可重复性而限制了人工智能在医学领域的应用。我们引入了一个统计基础框架,该框架使用伯努利朴素贝叶斯(Bernoulli Naïve Bayes, BNB)模型提供完全可解释、基于规则的临床分类。该方法对连续变量应用有监督的卡方(χ²)引导统计二值化,识别在训练数据内最大化与临床结果关联的阈值。这种转换使BNB能够有效地在连续医学数据上运行,同时保持其固有的透明性。该方法在三个基准数据集上进行了评估:皮马印第安人糖尿病数据集、威斯康星乳腺癌数据集和心力衰竭预测数据集,分别取得了0.800(皮马)、0.984(威斯康星乳腺癌)和0.919(心力衰竭预测)的曲线下面积(AUC)分数。除了判别能力外,还使用防泄漏的交叉验证校准分析评估了概率可靠性,包括布里尔分数、校准截距/斜率以及事后Beta校准,这些方法改进了各数据集的概率校准。这些结果表明,一个统计上可解释的框架可以在提供明确、临床有意义的决策规则和校准风险估计的同时,实现与更复杂模型相当的性能。为了具体说明这种透明性,一个完整的工作示例表明,仅使用参考表和基本算术,无需访问软件或专有工具,即可重现模型推理。这项工作为在现实世界的医疗环境中支持可信赖和可泛化的人工智能提供了实用方法。

22脚注文本:Antony Garcia:[email protected] (https://arxiv.org/html/2607.15394v1/mailto:[email protected]);[email protected] (https://arxiv.org/html/2607.15394v1/mailto:[email protected])。

44脚注文本:Adrián Noriega:[email protected] (https://arxiv.org/html/2607.15394v1/mailto:[email protected])。

33脚注文本:Gabrielle Britton:[email protected] (https://arxiv.org/html/2607.15394v1/mailto:[email protected])。

11脚注文本:Xinming Huang(通讯作者):[email protected] (https://arxiv.org/html/2607.15394v1/mailto:[email protected])。

关键词:可解释人工智能;伯努利朴素贝叶斯;特征二值化;卡方阈值选取;可解释机器学习;医学分类;阈值优化

## 1 引言

有监督分类是医学数据分析中的一项基本任务。其目标是根据观察到的患者特征,将患者分配到具有临床意义的类别中[moreno-ibarraClassificationDiseasesUsing2021]。在实践中,人口统计学、病史和临床测量等信息被结合起来,以确定患者是否患有某种疾病或是否有患病风险[anComprehensiveReviewMachine2023]。这些预测不仅仅是技术输出,因为诊断、治疗计划和患者预后都可能直接受到它们的影响[ennabEnhancingInterpretabilityAccuracy2024]。医学数据集还带来了一些实际挑战:通常同时包含连续变量和分类变量,可能存在缺失值,并且类别分布不平衡很常见[chenDealingMissingImbalanced2023,razzaghiMultilevelWeightedSupport2016]。对于一个在临床环境中可用的分类模型,它必须处理这些特征,同时保持足够的可解释性,以使临床医生能够信任并理解其做出的决策[kumarExplainableMachineLearning2024]。

人工智能在改善各种临床应用中的诊断准确性方面已显示出巨大潜力[richens_improving_2020,fuse_artificial_2025,ahsan_machine-learning-based_2022]。然而,许多高性能模型,尤其是深度学习算法,被认为是黑盒模型,并且可能在不同患者群体中泛化能力较差[tjoa_survey_2021]。这种缺乏透明性会限制临床医生的信任,并使监管采用复杂化[topol_high-performance_2019,kelly_key_2019],这使得可解释的概率模型对于医疗决策支持具有吸引力。

在有监督学习方法中,概率分类器被认为是一个重要的家族,因为其预测基于对类别标签的估计概率分布。这种观点在不确定性常见的临床环境中尤其有用。一个显著的例子是贝叶斯网络,它表示特征之间的条件依赖关系,并支持数据分析和在不确定性下的决策[perez_supervised_2006]。在这个更广泛的家族中,朴素贝叶斯模型假设特征之间条件独立,从而产生易于解释的模型,并且即使独立性假设并非总是满足时,这些模型通常也表现良好[domingos_optimality_1997]。朴素贝叶斯家族包含了适应不同类型数据的多种似然变体:伯努利模型用于二元特征、高斯模型用于连续正态分布特征、多项式模型用于基于计数的数据,以及类别模型用于离散分类特征。据报道,伯努利模型在文本分类任务中非常有效,其中特征表示单词的出现或缺失[mccallum_comparison_1998,singh_comparison_2019,kharisma_comparison_2021],而高斯和多项式变体通常分别用于连续和基于频率的输入[xu_bayesian_2018,kibriya2004multinomial]。类别模型直接处理离散特征,无需任何排序或类别间距离的假设,使其非常适用于具有名义特征的表格数据。

尽管伯努利变体具有简单性和可解释性,但由于其依赖于二元特征,在医学数据分析中的应用有限。医学数据集通常包含连续变量,例如年龄、血压和血糖水平,这些变量无法在没有预处理的情况下直接与伯努利模型一起使用。结果,尽管可解释性被高度重视,伯努利朴素贝叶斯模型在临床环境中的使用受到限制,因为预处理步骤可能会引入不必要的复杂性和潜在偏差。本文通过引入一种基于卡方(χ²)独立性检验的统计二值化方法来解决这一限制。所提出的方法通过选择阈值将连续特征转换为二元指示变量,在这些阈值下,特征与结果的关联在独立性假设下最不可能偶然发生。在方法开发过程中,评估了多种阈值选取标准,包括互信息、信息增益、基尼增益、基于ROC的标准、大津阈值法和基于分布的分割点。在这些替代方案中,发现在所研究的数据集上,χ²准则提供了最一致的性能,同时与伯努利模型的独立性检验原理紧密对齐。阈值优化仅在训练折内进行,最终性能仅在保留的数据上评估,以避免信息泄漏并获得泛化性能的无偏估计。通过这种策略,伯努利模型可以有效地应用于连续医学数据,同时保持其可解释性。

本文的主要贡献如下:(1) 明确阐述了将伯努利模型应用于具有连续特征的医学数据集所涉及的挑战;(2) 提出了一种基于χ²的二值化方法来确定特征阈值;(3) 在三个多样化且临床相关的数据集上对所提出的方法进行了实证评估;(4) 二元特征对应于明确的决策边界,从而支持在临床环境中的透明解释;(5) 提供了一个完整的患者水平的工作示例,表明临床医生可以使用打印的参考表和计算器,无需软件访问,即可重现从原始特征值到后验概率的完整分类路径。这种对透明阈值规则的强调也与最近的国际框架相一致,包括欧盟人工智能法案和世界卫生组织关于健康领域人工智能伦理与治理的指导,其中可解释性、公平性和可重复性被确定为可信赖临床人工智能的关键要求[aboy_navigating_2024]。通过在特征工程阶段嵌入可解释性,而不是仅仅依赖事后解释,所提出的方法旨在支持在不同临床环境中的更可信部署。

本文的其余部分组织如下。第2节回顾了先前关于朴素贝叶斯模型、有监督二值化和可解释临床预测的工作。第3节描述了数据集、预处理程序、伯努利和类别朴素贝叶斯模型、所提出的基于χ²的阈值选择方法、替代阈值策略以及评估协议。第4节展示了三个医学数据集的比较结果、校准分析和可解释性分析。第5节讨论了本研究的主要意义和局限性。第6节总结了本文并概述了未来的工作方向。数据和代码可用性声明在正文之后提供。

## 2 相关工作

朴素贝叶斯分类器是机器学习的基本技术之一,常因其简单性、高效性和可解释性而受到赞誉[domingos_optimality_1997,zhang_exploring_2004]。尽管朴素贝叶斯假设特征之间条件独立,但在与有效的特征转换相结合时,它在医学分类任务中始终取得了良好性能。在医学领域,伯努利朴素贝叶斯已被证明对于涉及二元或阈值化特征的任务是有效的。当预处理设计适当时,BNB在临床分类任务中展现了竞争性性能。[weegarUsingMachineLearning2020,taghizadehBreastCancerPrediction2022,patraPredictionLungCancer2020,alghamdi_heart_2020,guptaEarlyAutismSpectrum2025,singhOptimizingEarlyDiagnosis2024]。朴素贝叶斯已成功应用于预测肺癌[patraPredictionLungCancer2020]、检测心血管疾病[alghamdi_heart_2020]和自闭症筛查[guptaEarlyAutismSpectrum2025],显示了其在重视可解释性的现实医学环境中的相关性。

将BNB用于临床数据的主要挑战之一在于处理连续生物标志物,例如血糖水平、胆固醇等。由于BNB需要二元输入,这些连续值必须转换为有意义的二值化特征。相比之下,有监督方法使用目标变量来识别最大化预测能力的阈值。与多区间离散化方法不同,所提出的方法侧重于识别每个特征的单一结果导向截止点,这与伯努利朴素贝叶斯所需的二元结构相一致[fayyad_multinterval_1993,kerber_chimerge_1992,tay_modifiedchi2_2002,su_extendedchi2_2005]。本研究表明,统计引导的二值化为将连续临床测量值转化为可解释的决策规则提供了清晰的途径。

先前的工作表明,有监督离散化可以在保持模型可解释性的同时增强预测判别能力[liu_discretization_2002,ramirez_discretization_2016,kotsiantis_discretization_2006,garcia_discretization_2013]。最近的进展进一步将特征二值化应用于高维和特定领域的医学数据集。例如,优化的阈值化已被证明可以改善心血管风险模型[sun_binarization_2017],而统计二值化方法已被证明在基因表达数据上效果良好[wu_featurebinarization_2019]。将离散化与进化算法[tsai_hybrid_2008]或集成学习[yang_ensemble_2010]相结合的混合方法也已在生物医学领域取得了成功。这些技术展示了精心设计的二值化技术将原始临床数据转化为可操作解释的潜力,而不会损失可解释性。

从临床建模的角度来看,基于阈值的转换产生了清晰、类似规则的表示,可以方便地进行解释和审计。与黑盒模型相比,BNB中的统计二值化产生了可理解、基于规则的输出,可由临床医生自己证明和解释。这样的特征符合可解释机器学习的传统目标,强调临床决策环境中的简单性、可问责性和可靠性[rudin_stop_2019,caruana_explaining_2015]。现有的可解释性方法[holzingerCausabilityExplainabilityArtificial2019,ghassemiReviewChallengesOpportunities2020,guidottiSurveyMethodsExplaining2019]传统上描述了预测性和可解释性之间的权衡,并将固有可解释的模型确定为临床应用中最优选的模型。在此基础上,本研究提出了将基于χ²的统计二值化与BNB相结合,作为一种统计上合理且固有可解释的解决方案。

## 3 方法

### 3.1 概述

本研究提出了一种对连续特征进行二值化的方法,使得伯努利朴素贝叶斯分类器能够用于包含连续值的数据集。该方法基于统计假设检验:对于每个特征,使用χ²独立性检验来评估多个阈值,以衡量二值化特征与目标变量之间的关联。选择χ²检验p值最小的阈值,因为它标志着观察到的关系最不可能与独立性一致的点。需要注意的是,此处的p值并不表示特征具有预测性的概率,也不表示关联的强度。相反,它衡量的是观察到的分布与如果特征和目标变量独立时预期分布之间的差异程度,并作为有监督学习中选择阈值的实用指南。为了评估基于卡方的二值化方法的性能,还实施并比较了其他阈值策略,包括互信息、信息增益、基尼增益、基于ROC的标准、大津阈值法和基于分布的分割点。所提出方法的分类性能

相似文章

面向可解释、鲁棒且可审计的临床预测的多模态路由

arXiv cs.LG

本文提出了一种用于临床预测的显式多模态路由框架,利用EHR数据,通过离散的单模态、双模态和三模态路径,以及推理时路径掩码来模拟缺失模态,实现对结构化变量、临床笔记和胸部X射线的可解释、鲁棒且可审计的推理。

从ML预测到基于Toulmin论证模型的知情诊断辅助

arXiv cs.AI

本文提出一个框架,利用Toulmin论证模型对基于OCT图像的ML视网膜诊断进行结构化,整合生物标志物提取、医学大语言模型推理(MedGemma)和相似度度量(MedSigLip),以实现可解释且基于证据的诊断辅助。