基于CPRD的可扩展临床数据基础设施及比较性机器学习评估在多重慢性病老年患者住院风险预测中的应用

arXiv cs.LG 论文

摘要

本文提出了一种可扩展的临床数据基础设施,并比较了深度学习(TG-CNN)与传统机器学习模型(LASSO和Random Forests)在多重慢性病老年患者住院风险预测中的应用,结论是由于LASSO具有更优的校准性能,更适合临床部署。

arXiv:2608.29419v1 公告类型:新 摘要:深度学习架构越来越多地被提出用于电子健康记录(EHR)中的患者轨迹建模,但与更简单、更可解释的模型相比,其优势在现实世界临床环境中很少受到严格的实证检验。我们提出了一种应用于CPRD Aurum中老年患者的综合患者时间线管道,通过一个三层自动分类框架纳入了260种临床疾病,其中包括17种复杂疾病的专门检测逻辑。使用此基础设施,我们对时间图卷积神经网络(TG-CNN)与带有LASSO正则化的逻辑回归和Random Forests进行了基准测试,用于预测12个月全因急诊住院风险,动机是(但不限于)不良药物反应的高风险。在交叉验证下,TG-CNN的平均AUC-ROC略高于LASSO(0.712 对 0.705),而在留出测试集上,LASSO在三个模型中达到了最高的区分度(AUC-ROC 0.733,对比Random Forest的0.710和TG-CNN的0.702)。我们表明,单独的区分度是临床部署的不完整标准:经过Platt校准后,LASSO是唯一具有可接受校准斜率(0.817)的模型,而Random Forest(0.759)和TG-CNN(0.391)仍然存在显著的校准偏差。我们认为,LASSO,而不是最高区分度模型,是最适合直接临床部署的模型。我们为机器学习和医疗保健社区提供了关于数据基础设施、模型选择以及校准和可解释性在高风险决策支持中价值的经验教训。
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:14

# 基于CPRD数据源的可扩展临床数据基础设施与多病共存老年患者住院风险预测的机器学习比较评估  
来源:https://arxiv.org/html/2608.29419  

Asra Aslam  
附属机构:英国谢菲尔德大学信息学院  
电子邮件:[[email protected]](mailto:[email protected])  

Volodymyr Chapman  
附属机构:英国利兹大学医学与健康学院医学院  
电子邮件:[[email protected]](mailto:[email protected])  

Maurice M. O’Connell  
附属机构:英国曼彻斯特大学信息学部  
电子邮件:[[email protected]](mailto:[email protected])  

Aseel S. Abuzour  
附属机构:英国利兹大学老龄化与中风研究学术单位  
电子邮件:[[email protected]](mailto:[email protected])  

Michael Abaho  
附属机构:英国利物浦大学人口健康研究所  
电子邮件:[[email protected]](mailto:[email protected])  

Danushka Bollegala  
附属机构:英国利物浦大学人口健康研究所  
电子邮件:[[email protected]](mailto:[email protected])  

Gary Leeming  
附属机构:英国利物浦大学人口健康研究所  
电子邮件:[[email protected]](mailto:[email protected])  

Eduard Shantsila  
附属机构:英国利物浦大学人口健康研究所  
电子邮件:[[email protected]](mailto:[email protected])  

Andrew Clegg  
附属机构:英国利兹大学老龄化与中风研究学术单位  
电子邮件:[[email protected]](mailto:[email protected])  

Lauren E. Walker  
附属机构:英国利物浦大学人口健康研究所  
电子邮件:[[email protected]](mailto:[email protected])  

Iain Edward Buchan  
附属机构:英国利物浦大学人口健康研究所  
电子邮件:[[email protected]](mailto:[email protected])  

Samuel D. Relton  
附属机构:英国利兹大学医学与健康学院医学院  
电子邮件:[[email protected]](mailto:[email protected])  

###### 摘要  
深度学习架构日益被提出用于电子健康记录(EHRs)中的患者轨迹建模,但其相对于更简单、更可解释模型的优势,在现实临床环境中很少受到严格的实证检验。我们提出一个应用于CPRD Aurum老年患者的综合患者时间线流程,涵盖260种临床病症,这些病症通过一个三层自动化框架进行分类,其中包含针对17种复杂病症的专门检测逻辑。利用该基础设施,我们对时间图卷积神经网络(TG-CNN)与带LASSO正则化的逻辑回归及随机森林进行基准测试,以预测12个月全因急诊住院风险——该目标设定受到药物不良反应风险升高的启发(但未使用其进行数据筛选)。在交叉验证下,TG-CNN的平均AUC-ROC略高于LASSO(0.712 vs. 0.705),但在保留测试集上,LASSO展现出三种模型中最高的判别能力(AUC-ROC 0.733,而随机森林为0.710,TG-CNN为0.702)。我们证明,仅凭判别能力不足以作为临床部署的评判标准:经过Platt校准后,LASSO是唯一具有可接受校准斜率(0.817)的模型,而随机森林(0.759)和TG-CNN(0.391)仍存在显著的校准偏差。我们认为,最适合直接临床部署的模型是LASSO,而非判别能力最高的模型。我们为机器学习与医疗界提供了关于数据基础设施、模型选择,以及校准与可解释性在高风险决策支持中价值的经验教训。  

## 1 引言  
患有多种长期疾病(MLTCs)的患者面临更高的治疗负担以及因复杂的药物相互作用和药物-疾病相互作用而导致的伤害风险(Dumbreck等人,2015 (https://arxiv.org/html/2608.29419#bib.bib12);Osanlou等人,2022 (https://arxiv.org/html/2608.29419#bib.bib10))。管理该人群的多重用药问题是现代医疗保健系统面临的最紧迫挑战之一,据估计,药物不良反应(ADRs)导致的住院每年给英国国家医疗服务体系(NHS)造成22.1亿英镑的损失(Chapman等人,2026 (https://arxiv.org/html/2608.29419#bib.bib7))。结构化药物审查(SMRs)提供了一种药物优化的机制,但这些审查的患者选择仍然主观且不一致(Agwunobi等人,2025 (https://arxiv.org/html/2608.29419#bib.bib20);Abuzour等人,2024 (https://arxiv.org/html/2608.29419#bib.bib3))。电子健康记录(EHRs)捕获了丰富的纵向患者数据,涵盖诊断、处方、实验室检查和临床测量。然而,系统性地综合随时间变化的病症、检测结果和干预措施的方法仍然有限。Health-AI研究(Walker等人,2022 (https://arxiv.org/html/2608.29419#bib.bib6))通过开发基于AI的动态风险预测和处方优化工具来弥补这一空白,该工具应用于MLTCs患者,数据来源于临床实践研究数据链(CPRD)——这是全球最大的初级保健数据库之一,拥有超过6000万英国患者的记录(NHS England,2025 (https://arxiv.org/html/2608.29419#bib.bib30)),其中约1900万来自Aurum数据库(Wolf等人,2019 (https://arxiv.org/html/2608.29419#bib.bib9))。  

在此领域应用AI的一个核心假设是,能够表示时间序列的深度学习架构将优于传统统计模型,因为临床事件的*顺序*和*时间*包含了回归方法无法充分利用的预后信息。长短期记忆(LSTM)网络(Hochreiter和Schmidhuber,1997 (https://arxiv.org/html/2608.29419#bib.bib13))和图神经网络架构在基于EHR数据的基准任务中已显示出潜力。时间图卷积神经网络(TG-CNN)(Hancox和Relton,2022 (https://arxiv.org/html/2608.29419#bib.bib8);Aslam和Relton,2025 (https://arxiv.org/html/2608.29419#bib.bib5))通过使用带有指数衰减权重的三维张量表示,显式地建模事件之间的时间间隔,扩展了这些思想,为学习具有临床意义的时间模式提供了一种理论上引人注目的机制。  

在这项工作中,我们对此假设进行了实证检验。我们将TG-CNN应用于CPRD老年队列,预测12个月内的全因住院,并将其性能与LASSO逻辑回归(Tibshirani,1996 (https://arxiv.org/html/2608.29419#bib.bib14))和随机森林(Breiman,2001 (https://arxiv.org/html/2608.29419#bib.bib15))这两种理解充分、可解释的基线模型进行比较。我们将预测目标定义为12个月全因急诊住院,排除计划或选择性入院。此单一结果定义在数据标注、模型训练和评估中保持一致。接受复杂多重用药的老年患者因药物不良反应而面临更高的住院风险,这为结构化药物审查的临床应用场景提供了动机;然而,在分析的任何阶段,药物不良反应均未被用作筛选或定义结果标签。  

我们的结果揭示,在判别能力方面,较简单的模型优于TG-CNN,而判别能力最佳的模型在校准方面表现不佳。这些研究构成了临床和科学上重要的发现,对社区应如何选择和评估临床部署模型具有直接意义。本研究的贡献包括:  
- • **可扩展的CPRD基础设施**。一个可重复使用的CPRD Aurum患者时间线流程,通过三层自动化框架对临床病症进行分类,并使用经过验证的临床阈值,为17种复杂病症采用专门的检测逻辑。  
- • **大规模基准测试**。在英国初级保健EHR中前所未有的规模上(570,125名训练患者),对时间深度学习模型与可解释基线模型进行严格的实证比较,并对模型进行交叉验证。  
- • **多标准模型评估框架**。提供实证证据表明,仅AUC-ROC不足以作为临床模型选择的标准:我们证明,判别能力最佳的模型在部署前需要事后重新校准,而最具可解释性的模型则无需,并提出了一个三标准评估体系。  

### 医疗背景下机器学习的可推广见解  
- • **复杂性并不保证优越性**:在具有稀疏、不规则事件和高维度的真实世界临床数据集中,LASSO和随机森林等可解释模型可以匹配或超越时间复杂的深度学习架构。TG-CNN相对于更简单模型的理论优势并不能自动转化为常规EHR数据上的实证收益。  
- • **稀疏性和数据异质性限制了时间架构的应用**:来自初级保健的患者EHR时间线具有高度稀疏、采样事件和异质化患者病史的特点。这些特性可能削弱了为更密集的序列数据设计的时间加权机制的益处。  
- • **校准比判别能力对临床部署更重要**:一个系统性地分配过高风险评分的模型,在没有事后校正的情况下,无法直接用于向临床医生传达风险。我们比较中判别能力最佳的模型在部署前需要重新校准,而最具可解释性的模型则不需要。在临床风险预测中,不应仅由AUC-ROC决定模型选择。  
- • **可解释性在性能之外具有临床价值**:在临床决策支持中,特别是在初级保健的结构化药物审查中,一个其预测能够向临床医生解释的模型,可能比性能略优的黑盒模型更具可部署性。研究项目(Abuzour等人,2026 (https://arxiv.org/html/2608.29419#bib.bib2))的定性发现高度重视理解和信任AI生成的推荐基础。  
- • **严格的基线比较至关重要**:医疗领域的机器学习论文经常与复杂的深度学习方法进行比较。我们的发现强化了(Rudin,2019 (https://arxiv.org/html/2608.29419#bib.bib18);Wynants等人,2020 (https://arxiv.org/html/2608.29419#bib.bib17))的呼吁,即在将复杂AI部署到医疗保健领域之前,必须与可解释基线进行严格比较。  

## 2 相关工作  
### 2.1 多病共存与多重用药的风险预测  
现有的针对MLTCs人群的风险预测工具主要针对单一终点。诸如QRISK和QAdmissions等工具预测住院或心血管结果,但并未建模随时间变化的疾病、药物和结果之间的动态纵向相互作用。其后果是,EHR中丰富的时序信息在风险分层和治疗优化方面在很大程度上未得到利用。  

越来越多的研究将机器学习应用于基于EHR的风险预测。Churpek等人(2016)(https://arxiv.org/html/2608.29419#bib.bib19)证明,机器学习方法在预测临床恶化方面可以优于传统回归,但也表明其超越逻辑回归的优势通常不大。关于老年患者药物不良反应风险和多重用药危害的研究依赖于Cox回归和LASSO特征选择(Fahmi等人,2023 (https://arxiv.org/html/2608.29419#bib.bib11);Chapman等人,2026 (https://arxiv.org/html/2608.29419#bib.bib7));这些方法已在CPRD Aurum数据集中识别出与可预防的药物不良反应住院相关的具有临床意义的患者亚组。定性研究阐明了医疗专业人员在结构化药物审查过程中对AI工具的需求以及采用的重大障碍(Abuzour等人,2024 (https://arxiv.org/html/2608.29419#bib.bib3);Abuzour等人,2026 (https://arxiv.org/html/2608.29419#bib.bib2))。医疗专业人员对复杂的黑箱预测模型表示怀疑,并强烈偏好透明/可解释的系统。可视化患者历史时间线也被研究用于辅助药物审查中的临床推理(Hama等人,2024 (https://arxiv.org/html/2608.29419#bib.bib4))。  

### 2.2 患者轨迹的深度学习  
大量研究已将深度学习应用于基于EHR的患者轨迹建模。RETAIN(Choi等人,2016a (https://arxiv.org/html/2608.29419#bib.bib21))是一种开创性的基于注意力的循环模型,通过学习就诊级别和编码级别的注意力权重,展示了从纵向EHR序列中可解释地预测心力衰竭发作的能力。Med2Vec(Choi等人,2016b (https://arxiv.org/html/2608.29419#bib.bib22))将表示学习方法扩展到医学概念和就诊,表明临床编码的无监督嵌入可以改善下游预测任务。更新的基于Transformer的架构,如BEHRT(Li等人,2020 (https://arxiv.org/html/2608.29419#bib.bib23))和MedBERT(Rasmy等人,2021 (https://arxiv.org/html/2608.29419#bib.bib29)),将BERT预训练范式应用于EHR序列,通过联合建模临床编码、时间位置和就诊结构,在死亡率和疾病预测基准上取得了强劲的表现。  

然而,许多这些结果是在密集的住院或二级保健数据集(如MIMIC-III ICU记录)上获得的,在这些数据集中事件频繁且时间上密集。初级保健EHR具有非常不同的统计特性:长达数年到数十年的观察窗口、不规则且不频繁的就诊模式,以及从数百种可能的诊断和药物编码中衍生出的高维度,这些编码稀疏地分布在患者病史中。深度学习在这一特定环境(大规模、稀疏、初级保健、长时域)中的优越性证据仍然有限(Churpek等人,2016 (https://arxiv.org/html/2608.29419#bib.bib19);Wynants等人,2020 (https://arxiv.org/html/2608.29419#bib.bib17))。Aslam和Relton(2025)(https://arxiv.org/html/2608.29419#bib.bib5)将TG-CNN(Hancox和Relton,2022 (https://arxiv.org/html/2608.29419#bib.bib8))改编用于EHR轨迹聚类,在一个概念验证数据集上展示了比竞争方法更好的聚类分离度,并为其在CPRD上的应用提供了依据。然而,在中等复杂度序列数据集中的聚类质量并不一定能预测在大规模、稀疏的初级保健EHR中针对二元预测任务(如全因急诊住院)的判别性能。  

### 2.3 医疗保健中的可解释模型与复杂模型  
模型复杂性与临床可部署性之间的权衡问题引起了学者们越来越多的关注。Rudin(2019)(https://arxiv.org/html/2608.29419#bib.bib18)有力地论证,在医疗保健等高风险决策领域,除非复杂模型能通过仔细的特征工程实现无法通过可解释模型达到的决定性性能优势,否则应优先选择可解释模型。Wynants等人(2020)(https://arxiv.org/html/2608.29419#bib.bib17)

相似文章

从结构化临床数据预测心血管风险的大语言模型

arXiv cs.CL

本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。

通过先进机器学习技术变革心脏病预测

arXiv cs.LG

本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。