机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析
摘要
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
arXiv:2607.16253v1 公告类型:新
摘要:基于机器学习的2型糖尿病风险预测模型在内部验证中表现良好,但由于缺乏外部测试和公平性评估,在现实应用中效果不佳。我们构建了一个多维框架,在具有全国代表性的人群中评估区分度、校准度、可解释性和算法公平性。使用NHANES 2015-2020的数据(n=15,685)训练了一个XGBoost模型,采用了八个非实验室预测因子:年龄、性别、种族/民族、BMI、吸烟状况、体力活动、心脏病发作史和中风史。在BRFSS 2020-2022数据(n=1,285,783)上进行了外部验证,模拟了现实分布偏移。内部验证显示良好的区分度(AUC=0.794,95% CI 0.788-0.800),外部验证中性能下降(AUC=0.717,相对下降:-9.7%,p<0.001)。公平性分析揭示了严重的偏差:老年人(≥60岁)的AUC=0.607,而年轻人为0.742(差异=0.135,p<0.001);肥胖个体的AUC=0.698,而正常体重者为0.735(差异=0.037,p<0.001)。性别方面表现相当(男性=0.723,女性=0.712,p=0.142)。校准度显示风险高估(Brier分数=0.123)。SHAP分析识别出年龄、BMI和体力活动是主要风险驱动因素。糖尿病风险最高的人群获得的算法性能最差,这强调了在临床应用前需要采用公平感知、按年龄分层的部署策略。
查看缓存全文
缓存时间: 2026/07/21 06:47
# 基于机器学习预测2型糖尿病风险的综合评估:大规模外部验证与公平性分析 来源:https://arxiv.org/abs/2607.16253 查看 PDF (https://arxiv.org/pdf/2607.16253) > **摘要**:基于机器学习的2型糖尿病风险预测模型在内部验证中表现良好,但由于缺乏外部测试和公平性评估,在现实应用中失效。我们开发了一个多维框架,针对全国代表性人群进行区分度、校准度、可解释性和算法公平性评估。基于NHANES 2015-2020数据集(n=15,685),使用八个非实验室预测因子(年龄、性别、种族/民族、BMI、吸烟状况、体力活动、心脏病发作史、中风史)训练了一个XGBoost模型。在现实分布偏移条件下,使用BRFSS 2020-2022数据集(n=1,285,783)进行外部验证。内部验证显示良好的区分度(AUC=0.794,95% CI 0.788-0.800),但外部验证中性能下降(AUC=0.717,相对下降9.7%,p<0.001)。公平性分析揭示了严重偏差:老年人(≥60岁)AUC=0.607,而年轻人AUC=0.742(差异=0.135,p<0.001);肥胖个体AUC=0.698,而正常体重个体AUC=0.735(差异=0.037,p<0.001)。性别方面表现相当(男性=0.723,女性=0.712,p=0.142)。校准显示风险高估(Brier评分=0.123)。SHAP分析确定年龄、BMI和体力活动是主要风险驱动因素。糖尿病风险最高的人群获得最差的算法性能,这突显了在临床使用前需要采用公平性感知、按年龄分层的部署策略。 ## 提交历史 来自:Rajveer Singh Pall [查看邮箱 (https://arxiv.org/show-email/d15c9dcd/2607.16253)] **[v1]** 2026年6月27日星期六 07:02:40 UTC (464 KB)
相似文章
通过先进机器学习技术变革心脏病预测
本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。
CKD风险预测中的校准、不确定性沟通与部署就绪:一项框架评估研究
本研究评估了五种用于慢性肾脏病风险预测的机器学习分类器,发现近乎完美的内部性能在分布偏移下失效。强调在临床部署前需要校准稳定性和共形覆盖迁移。
一个用于医学大语言模型安全性、鲁棒性和公平性评估的多领域红队框架
本文提出了一个多领域红队框架,用于在690个临床相关场景中评估医学大语言模型的安全性、鲁棒性和公平性。结果表明,高聚合准确率可能掩盖关键失败,而结合临床专家审核的混合评估对于可信的安全性评估是必要的。
手术风险分层和结局预测中缺失了什么:端到端机器学习方法的范围综述
一项对190项研究的范围综述,描述了使用电子健康记录(EHR)数据进行手术风险分层和结局预测的端到端机器学习流程,并识别了预处理、评估和可解释性方面的方法论空白。
基于CPRD的可扩展临床数据基础设施及比较性机器学习评估在多重慢性病老年患者住院风险预测中的应用
本文提出了一种可扩展的临床数据基础设施,并比较了深度学习(TG-CNN)与传统机器学习模型(LASSO和Random Forests)在多重慢性病老年患者住院风险预测中的应用,结论是由于LASSO具有更优的校准性能,更适合临床部署。