贝叶斯不确定性估计提升医疗AI代理的临床决策能力
摘要
本文表明,蒙特卡洛丢弃法能够为胸部X光片分类器提供认知不确定性信号,当以二元错误风险标志的方式传达时,可改善临床决策支持代理的错误检测,并减少自信误诊。
arXiv:2607.20582v1 公告类型:新
摘要:用于医学图像分析的机器学习模型通常缺乏可靠的置信度度量,限制了它们在模糊或非典型病例中的使用。在此,我们表明将蒙特卡洛丢弃法应用于多任务胸部X光片分类器(8项胸部发现,137,593张训练图像),能够提供认知不确定性信号,该信号可追踪训练集规模下的泛化能力,并标记出自信但易出错的预测。将该信号添加到点预测中,将错误检测的AUROC从0.74提升至0.77($\Delta$AUROC +0.023,95%置信区间[+0.014,+0.033])。在受控的2x2析因实验中,临床决策支持代理仅当该不确定性以二元错误风险标志而非原始分数的方式传达时,才能利用它,从而将不可靠发现上的自信误诊率从8.5%降至2.7%。因此,认知不确定性估计携带了超越点预测的决策相关信息,但其对下游代理的价值取决于传达方式。
查看缓存全文
缓存时间: 2026/07/24 05:12
# 贝叶斯不确定性估计提升医疗AI代理的临床决策能力
来源:https://arxiv.org/html/2607.20582
\[1\]\\fnm弗雷德里克\\sur豪克 \[1\]\\orgdiv诊断与介入放射学系,\\orgname亚琛工业大学医院,\\orgaddress\\city亚琛,\\country德国 2\]\\orgdiv肿瘤内科学系,国家肿瘤疾病中心(NCT),\\orgname海德堡大学医院,\\orgaddress\\city海德堡,\\country德国 3\]\\orgdivElse Kröner Fresenius数字健康中心,\\orgname德累斯顿工业大学,\\orgaddress\\city德累斯顿,\\country德国 4\]\\orgdiv第一医学系,医学院与卡尔·古斯塔夫·卡鲁斯大学医院,\\orgname德累斯顿工业大学,\\orgaddress\\city德累斯顿,\\country德国
\\fnm克里斯蒂安\\sur库尔\\fnm戴克\\sur费伯\\fnm雅各布·尼古拉斯\\sur卡瑟\\fnm斯文\\sur内贝隆\\fnm丹尼尔\\sur特鲁恩\*\[\[\[
###### 摘要
用于医学图像分析的机器学习模型通常缺乏可靠的置信度度量,限制了其在模棱两可或非典型病例中的应用。我们在此证明,将蒙特卡洛丢弃法应用于多任务胸部X光片分类器(八种胸部发现,137,593张训练图像),能够提供一种认知不确定性信号,该信号可追踪跨训练集规模的泛化能力,并标记出自信但易出错的预测。将该信号添加到点预测中,将错误检测AUROC从0.74提高到0.77(ΔAUROC +0.023,95%置信区间\[+0.014,+0.033\])。在一个受控的2×2析因实验中,一个临床决策支持代理仅当不确定性以二元错误风险标志而非原始分数形式传递时才能利用这一信号,将不可靠发现上的自信误诊率从8.5%降至2.7%。因此,认知不确定性估计携带了点预测之外的决策相关信息,但其对下游代理的价值取决于传递方式。
###### 关键词:
贝叶斯深度学习,不确定性估计,蒙特卡洛丢弃法,胸部X光摄影,临床决策支持
临床放射学中的影像发现常常细微或模糊,尤其是在疾病早期和患有多种合并症的患者中s13244_023_01521_7 (https://arxiv.org/html/2607.20582#bib.bib1)。诊断不确定性在胸部X光摄影中尤为常见:放射科医生通常通过“可能”、“很可能”或“可能代表”等模糊用语来表达怀疑defined2025_clinical_uncertainty_radiology_reports (https://arxiv.org/html/2607.20582#bib.bib2),而这种模糊表述直接影响关于额外影像检查和随访的决策。
随着机器学习模型在医学图像解读中扮演越来越重要的角色,类似的不确定性表达能力变得至关重要。许多当前模型,包括大型语言模型(LLMs),会以高置信度产生错误预测,且不提供明确的不确定性估计wen2024_llm_overconfidence (https://arxiv.org/html/2607.20582#bib.bib3),cash2025_llm_confidence (https://arxiv.org/html/2607.20582#bib.bib4)。贝叶斯深度学习技术通过为每个预测附加明确的不确定性估计来解决这一缺陷。其价值已在多种临床任务中得到证明,包括胸部X光摄影、结核病分割、中风分析和COVID-19检测bargagna2023_uncertain_labels_cxr (https://arxiv.org/html/2607.20582#bib.bib5),rajaraman2022_tb_uncertainty (https://arxiv.org/html/2607.20582#bib.bib6),herzog2020_stroke_uncertainty (https://arxiv.org/html/2607.20582#bib.bib7),calderon2021_covid_uncertainty (https://arxiv.org/html/2607.20582#bib.bib8),bayesian_cnn_medical_scarcity (https://arxiv.org/html/2607.20582#bib.bib9),并已被用于标记分布外输入和罕见、代表性不足的类别yang2019_bayesian_retinopathy (https://arxiv.org/html/2607.20582#bib.bib10),rezaei2023_class_imbalance (https://arxiv.org/html/2607.20582#bib.bib11)。
通常区分两种主要形式的不确定性。偶然不确定性源于数据中固有的噪声,而认知不确定性则反映了模型知识的缺乏,原则上可以通过更多训练数据来减少wimmer2023_aleatoric_epistemic (https://arxiv.org/html/2607.20582#bib.bib12)。使用交叉熵损失训练的标准分类器产生的类别概率在理论上近似偶然不确定性gustafsson2020_scalable_bayesian (https://arxiv.org/html/2607.20582#bib.bib16),kurz2022_uncertainty_systematic_review (https://arxiv.org/html/2607.20582#bib.bib27),gawlikowski2023_uncertainty_survey (https://arxiv.org/html/2607.20582#bib.bib14)。然而,这些概率无法捕获认知不确定性,这意味着它们不能指示预测是否超出了模型的训练经验范围gawlikowski2023_uncertainty_survey (https://arxiv.org/html/2607.20582#bib.bib14),gustafsson2020_scalable_bayesian (https://arxiv.org/html/2607.20582#bib.bib16)。在实践中,有限且不平衡的训练数据(这在医学影像中很常见)使问题更加复杂:模型过拟合,其输出概率校准不佳,即使温度缩放等事后校正也只能提供部分缓解gal2016_dropout_bayesian (https://arxiv.org/html/2607.20582#bib.bib13),gawlikowski2023_uncertainty_survey (https://arxiv.org/html/2607.20582#bib.bib14)。因此,需要单独的方法从模型本身估计认知不确定性。
在这些方法中gawlikowski2023_uncertainty_survey (https://arxiv.org/html/2607.20582#bib.bib14),深度集成需要训练多个独立的网络lakshminarayanan2017_deep_ensembles (https://arxiv.org/html/2607.20582#bib.bib15),而蒙特卡洛(MC)丢弃法仅在推理时通过重复的随机前向传播获得不确定性,在成本和有效性之间提供了有利的权衡gustafsson2020_scalable_bayesian (https://arxiv.org/html/2607.20582#bib.bib16)。MC丢弃法也被证明能够为Transformer架构提供可靠的不确定性估计shelmanov2021_transformer_uncertainty (https://arxiv.org/html/2607.20582#bib.bib17)。
用于胸部X光片解读的深度学习系统已在临床使用,美国食品药品监督管理局(FDA)批准的模型在心脏、肺部和胸膜发现的全方位异常检测中实现了超过0.97的曲线下面积(AUCs),并提高了医生的准确性anderson2024_dl_improves_cxr (https://arxiv.org/html/2607.20582#bib.bib25)。然而,估计有3-5%的放射学解读包含错误或差异brady2017_error_discrepancy_radiology (https://arxiv.org/html/2607.20582#bib.bib26),部署无法指示自身预测是否不可靠的模型,有可能将自信但错误的结果传播到临床工作流程中。一项系统综述得出结论,AI-临床医生协作中不确定性估计的益处很大程度上仍未得到研究kurz2022_uncertainty_systematic_review (https://arxiv.org/html/2607.20582#bib.bib27)。
最近的研究表明,临床AI将越来越依赖协调的代理,这些代理调用专门的模型并将其输出与临床背景整合41586_023_05881_4 (https://arxiv.org/html/2607.20582#bib.bib18),Towards_Generalist_Biomedical_AI (https://arxiv.org/html/2607.20582#bib.bib19),ferber2025_ai_agent_oncology (https://arxiv.org/html/2607.20582#bib.bib20),survey_llm_agents_medicine_2025 (https://arxiv.org/html/2607.20582#bib.bib21)。在此,我们为多任务胸部X光片分类器配备MC丢弃法不确定性估计。我们通过三个步骤评估该系统:一个数据扩展实验(在逐渐减小的训练数据子集上训练模型)、一个按类别的可靠性分析,以及一个受控析因代理实验。我们发现预测标准差追踪模型的泛化程度,随验证损失增减,并标记出自信但不可靠的单个预测。披露此信号可测量地改善对模型自身错误的检测;然而,临床决策支持代理只有在信号以预处理的二元标志而非原始数字形式传递时,才能实现此价值。整个流程的概述见图1 (https://arxiv.org/html/2607.20582#S0.F1)。
参照图注图1:研究概述。a,一个DINOv2视觉Transformer将胸部X光片分类为八种胸部发现,每个类别产生一个sigmoid激活值。b,MC丢弃法不确定性估计:启用丢弃法的多次随机前向传播产生相同的点预测外加预测标准差,标记不稳定的输出。c,代理实验:每个留出测试案例在一个2×2设计下被路由到临床决策支持代理,该设计交叉了错误风险指标(仅预测 vs 预测+不确定性)与呈现方式(原始模型输出 vs 二元错误风险标志);代理的提交与升级决策与放射科医生真实标签进行比较。
## 1结果
### 1.1标准差与验证损失共同演变
我们首先考察了训练集大小如何影响优化、泛化和认知不确定性。在十个子集分数中,训练损失随epoch和规模单调递减,100%训练数据运行(137,593张X光片)达到了最低训练损失(图2 (https://arxiv.org/html/2607.20582#S1.F2)a)。相比之下,验证损失在每个子集上随epoch呈非单调变化:在前20-30个epoch迅速下降,达到最小值,然后在剩余训练阶段上升(图2 (https://arxiv.org/html/2607.20582#S1.F2)b)。全数据运行最早且以最低值达到最小值。随后的上升,即过拟合的典型标志,非常明确且出现在每个数据规模上。
预测标准差(在留出验证集上对八种发现取平均)几乎遵循相同的U形(图2 (https://arxiv.org/html/2607.20582#S1.F2)c):在前约20-30个epoch急剧下降,在接近验证损失最小值处达到最小值,然后稳步上升。更多训练数据降低了每个epoch的标准差(如预期),但并未消除后期上升。重要的是,一旦模型开始过拟合,验证损失和预测标准差会同步上升:即使预测本身仍接近0或1,MC丢弃法也能检测到泛化能力的丧失。
参照图注图2:训练拟合、泛化和认知不确定性随训练集大小共同演变。曲线按训练集分数(1-100%)着色。a,训练损失随epoch和规模单调递减。b,在包含34,860张图像的完整验证集上的验证损失;在每个子集大小上,最小值都很早达到,之后上升。c,平均MC丢弃法预测标准差(30次前向传播,对八种发现取平均)遵循与验证损失相同的U形,确立了标准差作为依赖泛化能力的置信信号的地位。
### 1.2该信号在所有八种发现上泛化
为了验证后期epoch的标准差上升不是由单个异常类别驱动,我们按发现分解了预测标准差(图3 (https://arxiv.org/html/2607.20582#S1.F3))。所有八个类别都表现出相同的轨迹:早期塌陷,在epoch 30-50附近达到最小值,然后缓慢上升直到epoch 150。子集大小之间的区分在每个类别中均得以保持。这证实了标准差信号反映了模型的认知状态,而非任何特定发现中的标注噪声。
参照图注图3:标准差U形和数据规模排序在所有八种发现上泛化。验证集上每种发现的MC丢弃法预测标准差随训练epoch的变化,按训练集分数(0.1-100%)着色。每个类别重现了在图2 (https://arxiv.org/html/2607.20582#S1.F2)c中看到的U形和数据规模的单调排序,确认了标准差是一个表现良好的逐类置信信号。
综合来看,这些结果表明MC丢弃法预测标准差在所有八种发现上都是一个可靠的置信信号。它捕获了普通网络输出无法捕获的信息:当模型开始过拟合且泛化能力下降时,即使预测本身看起来仍然自信,标准差也会上升。
### 1.3高标准差标记出自信的错误预测
接下来,我们评估了预测标准差是否对个别预测错误具有信息量。对于每种发现,我们绘制了确定性绝对误差\(\|\hat{y}-y\|\)与MC丢弃法标准差(在完整验证集上,n=34,860;图4 (https://arxiv.org/html/2607.20582#S1.F4))的散点图。大多数预测聚集在低标准差、低误差区域,但每个类别都在高标准差处表现出高误差点的尾部,包括模型以高置信度报告的预测,在这种情况下披露不确定性增加了无法从点预测中恢复的信息。我们直接在下面的代理实验中量化了这个错误检测价值(图5 (https://arxiv.org/html/2607.20582#S1.F5))。
参照图注图4:预测标准差对每种发现的预测错误具有信息量。每种发现绝对误差\(\|\hat{y}-y\|\)与MC丢弃法标准差(n=34,860张X光片,30次MC采样)的散点图。a-h,每个面板对应一种发现;标准差的预测富含大误差,这激励了在点预测旁边披露不确定性信号。
### 1.4不确定性改善错误检测
我们首先在留出测试集上量化了不确定性是否比单独的点预测更能改善对模型自身错误的检测。如方法中所述,每个有序等级在所有分割中以阈值>0进行二值化(无阴性;(+)至++++阳性),当预测相对于这个二值真实标签落在0.5的错误一侧时,计为错误。对所有八种发现取平均,仅凭置信度(sigmoid输出距离0.5的距离)对预测进行排序,检测模型错误的AUROC为0.74;添加MC丢弃法不确定性后,该值提高到0.77(ΔAUROC +0.023,95%置信区间[+0.014,+0.033],p<0.001;案例聚类bootstrap;图5 (https://arxiv.org/html/2607.20582#S1.F5)a,插图)。因此,不确定性信号携带了点预测所不具有的错误相关信息。
然而,代理能否利用这些信息取决于其呈现方式。我们将每个案例在一个2×2设计下路由给代理,该设计交叉了错误风险指标(仅预测 vs 预测+不确定性)与其表示方式:要么是模型输出的原始逐类输出(代理必须自行解释),要么是模型预先计算的二元错误风险标志(一个验证集校准的错误检测器,阈值设定在Youden最优点)。给定原始的预测加不确定性数字,代理的错误捕捉敏感度为0.63,使其工作点远低于a相似文章
交易信心:算法交易中的全面不确定性估计
提出了一种面向算法交易的不确定性感知强化学习框架,通过SHAP加权重构、MC Dropout和LSTM共识机制,整合了分布性、认知性和偶然性不确定性。在五大美国股票指数上,其表现优于传统模型。
不确定性下的人机互补稳健性
本文研究了对AI预测质量的不确定性如何影响人类决策者从互补信息中获益的能力,发现人类与AI预测之间的负误差相关能够实现稳健的改进策略。
一种可迁移的基于阈值的可解释医学数据分类框架
本文介绍了一种基于统计的框架,使用伯努利朴素贝叶斯和χ²引导的二值化进行可解释的临床分类,在基准数据集上取得了有竞争力的AUC分数,同时提供了明确的决策规则和校准的风险估计。
通过随机因果表征学习解决个性化医疗中的偏差-精度悖论
本文提出了一种随机因果表征学习框架,以解决个性化医疗中的偏差-精度悖论,并证明了其在重症监护室(ICU)临床决策支持中提高了准确性和可解释性。
面向Agentic RAG管道的贝叶斯不确定性传播:关于多跳问答的概念验证研究
本文提出了一种面向Agentic RAG系统的贝叶斯不确定性传播框架,并在使用GPT模型的多跳问答基准上进行了评估,显示出在工业决策支持中监控可靠性的潜力。