CardioMeta: 跨人群与电子健康记录数据中糖尿病、高血压和心血管疾病的校准多任务预测
摘要
CardioMeta是一个校准的多任务框架,用于在NHANES和MIMIC-IV数据上联合预测糖尿病、高血压和心血管疾病,强调泄漏控制、校准和透明可靠性。
arXiv:2607.15721v1 公告类型:新
摘要:心代谢疾病仍然是可预防发病的主要驱动因素之一,因为糖尿病、高血压和心血管疾病经常同时发生,并共享代谢、血管、人口统计学和行为决定因素。现有的用于慢性病预测的机器学习研究通常强调在单一数据集上的区分能力,而较少报告标签泄漏、校准、时间鲁棒性、外部可迁移性和亚组可靠性。本文介绍了CardioMeta,一个校准的多任务框架,用于在人口调查和电子健康记录(EHR)数据上联合预测糖尿病、高血压和心血管疾病。研究使用NHANES进行人口水平模型开发和时间验证,并使用MIMIC-IV进行在显著分布偏移下的EHR域评估。为了减少循环标签重建,主要分析从相应的预测头排除了疾病定义变量,而全临床特征设置仅作为敏感性分析保留。CardioMeta结合了一个共享的心代谢编码器与疾病特定的门控头以及事后概率校准。在减少泄漏的时间验证设置中,模型实现了宏观AUROC 0.839、宏观AUPRC 0.536、宏观F1 0.614和期望校准误差0.024,比强梯度提升和神经表格基线有适度但一致的改进。在MIMIC-IV上的外部评估显示在域偏移下有明显的退化,而有限的微调部分恢复了性能。研究结果表明,多任务心代谢建模的主要价值不在于虚高的准确率,而在于可重复的泄漏控制、校准概率以及在异构医疗数据源上的透明可靠性报告。
查看缓存全文
缓存时间: 2026/07/20 09:30
# CardioMeta:基于校准的多任务模型实现跨群体与EHR数据的糖尿病、高血压及心血管疾病联合预测
来源:https://arxiv.org/html/2607.15721
S M Asif Hossain, Ruksat Khan Shayoni0009\-0002\-8737\-1789 (https://orcid.org/0009-0002-8737-1789)计算学院,威奇塔州立大学,堪萨斯州,美国,M. F. Mridha0000\-0001\-5738\-1631 (https://orcid.org/0000-0001-5738-1631)计算机科学与工程系,美国国际大学-孟加拉国,达卡,孟加拉国,以及Jungpil Shin0000\-0002\-7476\-2468 (https://orcid.org/0000-0002-7476-2468)计算机科学与工程学院,会津大学,会津若松,日本
###### 摘要。
心血管代谢疾病仍然是可预防发病率的持续驱动因素之一,因为糖尿病、高血压和心血管疾病经常同时发生,并共享代谢、血管、人口统计和行为决定因素。现有的针对慢性病预测的机器学习研究通常强调在单一数据集上的区分能力,而较少报告标签泄漏、校准、时间稳健性、外部可迁移性和子组可靠性。本文提出了CardioMeta,一个经校准的多任务框架,用于跨人口调查和电子健康记录(EHR)数据联合预测糖尿病、高血压和心血管疾病。本研究使用NHANES进行群体级模型开发和时间验证,并使用MIMIC-IV在显著的分布偏移下进行EHR领域评估。为了减少循环标签重构,主要分析中从相应的预测头中排除了疾病定义变量,而完整的临床特征设置仅作为敏感性分析保留。CardioMeta结合了共享的心血管代谢编码器、特定疾病的门控头以及事后概率校准。在减少泄漏的时间验证设置中,该模型的宏AUROC为0.839,宏AUPRC为0.536,宏F1为0.614,期望校准误差为0.024,相较于强梯度提升和神经表格基线有适度但一致的改进。在MIMIC-IV上的外部评估显示在领域偏移下性能明显下降,而有限的微调部分恢复了性能。研究结果表明,多任务心血管代谢建模的主要价值不在于虚高的准确率,而在于可复现的泄漏控制、校准的概率以及跨异构医疗数据源的透明可靠性报告。
医疗AI,心血管代谢疾病,多任务学习,校准,可解释性,NHANES,MIMIC-IV
††版权:无††ccs:应用计算 健康信息学††ccs:计算方法 机器学习方法## 1. 引言
糖尿病、高血压和心血管疾病(CVD)是发病率、死亡率和长期医疗支出的主要来源。这些疾病在临床上相互关联:肥胖、衰老、血糖功能障碍、血压负担、肾功能损害、血脂异常、用药史、饮食和生活方式暴露可能影响不止一个结局。因此,机器学习是面向筛查的心血管代谢预测的有吸引力的工具,因为它可以将异质的临床、人口统计、实验室和行为变量结合成患者级疾病状态概率。然而,心血管代谢预测也是一个实验设计控制不佳可能产生误导性乐观结果的场景。
许多慢性病预测研究的一个核心局限性是建模目标并非总能精确陈述。NHANES是横截面的,许多基于EHR的标签代表入院期间或之前记录的疾病。在这些条件下训练的模型识别的是流行或记录的疾病状态,而不是预测新发疾病。这种区别很重要,因为血压、血糖、HbA1c、用药或诊断代码等当代测量值可能接近结局定义。如果这些变量保留在输入中同时也定义了标签,模型可能学习到循环诊断规则而非临床信息丰富的风险结构。因此,本文将任务定义为面向筛查的多标签疾病状态预测,并区分了主要的减少泄漏特征设置和次要的完整临床特征设置。
另一个局限性是可重复性。声称泄漏安全的医疗预测的论文必须明确报告数据集周期、纳入标准、标签构建、软件版本、训练-验证-测试分离、超参数搜索,以及处理插补、缩放、重采样、校准和特征选择的方法。没有这些细节,核心方法论主张就无法验证。这在使用MIMIC-IV时尤其重要,因为访问需要经认证的PhysioNet批准、完成必要的培训并同意数据使用政策(johnson2023mimiciv, (https://arxiv.org/html/2607.15721#bib.bib10))。NHANES也需要仔细的周期级报告,因为2017-2020年3月的大流行前版本将不完整的2019-2020年数据与2017-2018周期相结合,以支持全国代表性的大流行前估计(cdc2024nhanes, (https://arxiv.org/html/2607.15721#bib.bib9))。
本文提出了CardioMeta,一个经校准的多任务学习框架,用于跨人口调查和EHR数据联合预测糖尿病、高血压和CVD。该架构使用共享编码器学习共同的心血管代谢证据,并使用特定疾病的门控头保持任务专业化。该模型在减少泄漏的主要设置下进行评估,其中直接定义标签的变量被排除在相应的疾病任务之外。次要的完整临床设置量化了当有同期诊断证据可用时性能如何变化。这种双设置设计直接解决了常见问题:高表观准确率可能由定义标签的实验室、生命体征、用药或诊断变量驱动。
主要贡献总结如下。
- • 我们将糖尿病、高血压和CVD表述为跨NHANES和MIMIC-IV的多标签疾病状态预测任务,同时明确区分流行疾病识别与新发疾病预测。
- • 我们定义了一个减少泄漏的主要特征设置,该设置去除了每种疾病直接定义标签的变量,并将完整临床特征设置保留为敏感性分析而非主要宣称依据。
- • 我们提出了CardioMeta,一个经校准的共享编码器多任务框架,带有用于心血管代谢预测的特定疾病门控头。
- • 我们提供了一个可复现的评估协议,涵盖NHANES周期定义、MIMIC-IV凭证访问报告、预处理隔离、超参数搜索、bootstrap置信区间、校准、临床效用、子组可靠性和可解释性。
- • 我们将所提出的框架与临床风险评分基线、逻辑回归、随机森林、XGBoost、LightGBM、CatBoost、调优的多层感知器(MLP)、TabNet、TabTransformer和RealMLP进行了基准测试。
本文其余部分组织如下。第2节(https://arxiv.org/html/2607.15721#S2)回顾了慢性病预测、多任务医疗建模、表格学习、校准和可解释的临床AI。第3节(https://arxiv.org/html/2607.15721#S3)描述了数据集构建、标签定义、减少泄漏的特征设计、CardioMeta、基线、训练细节、可重复性和评估指标。第4节(https://arxiv.org/html/2607.15721#S4)展示了实证评估,包括减少泄漏的性能、完整临床敏感性分析、EHR领域评估、校准、消融、子组可靠性和解释结果。第5节(https://arxiv.org/html/2607.15721#S5)总结了研究的启示和局限性。
## 2. 相关工作
本节将本研究置于临床预测、多任务医疗学习、表格建模、校准和可解释性方面的先前工作中。目标不仅是比较模型族,而且是阐明为什么严格的报告协议对于心血管代谢疾病状态预测至关重要。
### 2.1. 慢性病与临床风险预测
长期以来,临床预测模型一直用于支持心血管和代谢风险评估。传统临床评分如弗雷明汉风险评分、合并队列方程和糖尿病风险评分仍然是重要的参考指标,因为它们可解释且临床熟悉,即使其终点定义与横断面疾病状态标签不同。现代机器学习研究通常报告比经典评分更强的区分能力,但只有在透明、无泄漏的条件和适当的验证分割下评估时,改进才有意义。诸如TRIPOD等预测模型报告指南强调清晰的队列定义、终点定义、预测因子处理、验证和不确定性报告(collins2015tripod, (https://arxiv.org/html/2607.15721#bib.bib34))。对于不平衡的二分类终点,仅AUROC可能不足;AUPRC和F1分数可能更好地反映阳性病例上的性能(davis2006relationship, (https://arxiv.org/html/2607.15721#bib.bib37);saito2015precision, (https://arxiv.org/html/2607.15721#bib.bib38);chicco2020advantages, (https://arxiv.org/html/2607.15721#bib.bib36))。
慢性病建模特别容易受到循环性的影响。在糖尿病分类中,HbA1c和空腹血糖常用于定义结局;在高血压分类中,收缩压和舒张压可以直接定义标签;在CVD分类中,诊断代码或自我报告的疾病史可以定义现有疾病。如果这些变量也被用作预测因子,模型可能检测到标签构建规则,而不是从间接风险模式推断疾病状态。因此,本文将减少泄漏的疾病状态预测作为主要任务,将完整临床预测作为敏感性设置。
### 2.2. 医疗健康中的多任务学习
多任务学习非常适合医疗健康,因为疾病、症状、干预措施和风险因素是相互关联的。早期的神经EHR模型如Doctor AI和RETAIN展示了学习序列临床表征的价值,其中RETAIN还通过注意力强调可解释性(choi2016doctorai, (https://arxiv.org/html/2607.15721#bib.bib2);choi2016retain, (https://arxiv.org/html/2607.15721#bib.bib1))。BEHRT和Med-BERT展示了基于Transformer或上下文表征学习如何改善结构化EHR预测(li2020behrt, (https://arxiv.org/html/2607.15721#bib.bib3);rasmy2021medbert, (https://arxiv.org/html/2607.15721#bib.bib4))。PRIME将先验医学知识融入临床风险预测,而MetaPred研究了基于少量患者记录的临床风险预测的元学习(ma2018prime, (https://arxiv.org/html/2607.15721#bib.bib5);wang2019metapred, (https://arxiv.org/html/2607.15721#bib.bib6))。AutoDP近期研究了MIMIC-IV上的自动化多任务疾病预测,进一步证实了当任务相关性得到适当利用时,联合疾病建模是有用的(cui2024autodp, (https://arxiv.org/html/2607.15721#bib.bib8))。
当前工作遵循这一方向但在两点上有所不同。首先,它特别关注跨糖尿病、高血压和CVD的心血管代谢疾病状态预测,而非仅广泛的EHR多疾病预测。其次,它评估了从人口健康调查到医院EHR队列的跨数据集迁移。后一种设计故意设置困难,因为NHANES和MIMIC-IV在抽样框架、测量过程、疾病患病率和临床严重程度方面存在差异。
### 2.3. 表格学习、校准与可解释性
表格医疗预测需要强大的基线。随机森林、XGBoost、LightGBM和CatBoost在结构化数据上仍然具有竞争力(breiman2001random, (https://arxiv.org/html/2607.15721#bib.bib19);chen2016xgboost, (https://arxiv.org/html/2607.15721#bib.bib11);ke2017lightgbm, (https://arxiv.org/html/2607.15721#bib.bib12);prokhorenkova2018catboost, (https://arxiv.org/html/2607.15721#bib.bib13))。神经表格模型如TabNet和TabTransformer引入了基于注意力的表征,而近期关于调优MLP和TabPFN式基础模型的研究表明,神经方法在某些表格条件下可以表现良好(arik2021tabnet, (https://arxiv.org/html/2607.15721#bib.bib14);huang2020tabtransformer, (https://arxiv.org/html/2607.15721#bib.bib15);gorishniy2021revisiting, (https://arxiv.org/html/2607.15721#bib.bib16);hollemann2025tabpfn, (https://arxiv.org/html/2607.15721#bib.bib18))。由于没有单一模型类在所有表格医疗场景中占主导地位,CardioMeta在提升和神经基线两个方面均进行了评估。
校准是必要的,因为临床决策依赖于概率,而不仅仅是排序。Platt缩放、等温回归和温度缩放是提高概率可靠性的常用方法(platt1999probabilistic, (https://arxiv.org/html/2607.15721#bib.bib23);zadrozny2002transforming, (https://arxiv.org/html/2607.15721#bib.bib24);guo2017calibration, (https://arxiv.org/html/2607.15721#bib.bib25))。可解释性同样重要,因为临床医生和研究人员需要知道模型是否依赖可信的证据。LIME和SHAP广泛用于局部和全局解释(ribeiro2016lime, (https://arxiv.org/html/2607.15721#bib.bib26);lundberg2017shap, (https://arxiv.org/html/2607.15721#bib.bib27));反事实解释可以提供额外见解,但不应在观察性数据中被解释为因果(wachter2017counterfactual, (https://arxiv.org/html/2607.15721#bib.bib28))。公平性和子组分析也至关重要,因为临床算法可能在不同人口统计群体间产生不均衡的性能(obermeyer2019dissecting, (https://arxiv.org/html/2607.15721#bib.bib32);mehrabi2021survey, (https://arxiv.org/html/2607.15721#bib.bib33))。医学影像和临床多导睡眠图方面的相关医疗AI工作说明了在医疗数据集中对稳健架构设计、领域感知验证和子组敏感评估的更广泛需求(hossain2026infiltrnet, (https://arxiv.org/html/2607.15721#bib.bib17);hossain2026demographic, (https://arxiv.org/html/2607.15721#bib.bib7))。
## 3. 方法论
本节描述了完整的研究设计。方法论被故意详细说明,因为主要贡献不仅是模型架构,而且是跨异质数据源进行可复现的、减少泄漏的心血管代谢疾病状态预测评估协议。
### 3.1. 问题定义
对于每个个体 \(i\),令 \(x_i \in \mathbb{R}^d\) 表示一个表格特征向量,并令
\[(1) \quad y_i = [y_i^D, y_i^H, y_i^C] \in \{0,1\}^3\]
表示糖尿病、高血压和CVD状态。模型估计校准后的概率
\[(2) \quad f_\theta(x_i) = [p_i^D, p_i^H, p_i^C], \quad p_i^k \in [0,1].\]
主要任务是横断面疾病状态预测,而非新发疾病预测。相似文章
基于加速度测量的心血管代谢风险数字生物标志物:具有不确定性量化的人群代表性表格基准
本文介绍了NHANES加速度测量心血管代谢基准,这是一个用于从加速度测量数据预测心血管代谢风险的人群代表性表格数据集,并评估了岭回归、XGBoost和TabPFN v2,结合使用保形预测进行不确定性量化。
MiGHT-EHR:面向异质时序电子健康记录的多任务图变换器
本文介绍了MiGHT-EHR,一种针对异质时序EHR数据的多任务图变换器,联合建模临床实体、时间轨迹和任务依赖。在MIMIC-III和MIMIC-IV上,它在药物推荐、住院时长、死亡率和再入院预测方面均优于现有最先进方法。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
CardioState-JEPA:延迟感知的跨模态共享心脏表征学习
介绍了CardioState-JEPA,一种心脏基础模型,利用延迟感知的联合嵌入预测架构,在ECG、PPG和PCG信号之间学习共享表征,从而改进下游心脏分类任务。
从NHANES调查数据(2011-2018)分类冠心病风险,并进行全面数据泄露审计和校准检查[P]
一个分析NHANES调查数据以分类冠心病风险的项目,强调数据泄露审计和校准检查,同时比较机器学习模型。