机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析

arXiv cs.LG 论文

摘要

本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。

arXiv:2607.16253v1 公告类型:新 摘要:基于机器学习的2型糖尿病风险预测模型在内部验证中表现良好,但由于缺乏外部测试和公平性评估,在现实应用中效果不佳。我们构建了一个多维框架,在具有全国代表性的人群中评估区分度、校准度、可解释性和算法公平性。使用NHANES 2015-2020的数据(n=15,685)训练了一个XGBoost模型,采用了八个非实验室预测因子:年龄、性别、种族/民族、BMI、吸烟状况、体力活动、心脏病发作史和中风史。在BRFSS 2020-2022数据(n=1,285,783)上进行了外部验证,模拟了现实分布偏移。内部验证显示良好的区分度(AUC=0.794,95% CI 0.788-0.800),外部验证中性能下降(AUC=0.717,相对下降:-9.7%,p<0.001)。公平性分析揭示了严重的偏差:老年人(≥60岁)的AUC=0.607,而年轻人为0.742(差异=0.135,p<0.001);肥胖个体的AUC=0.698,而正常体重者为0.735(差异=0.037,p<0.001)。性别方面表现相当(男性=0.723,女性=0.712,p=0.142)。校准度显示风险高估(Brier分数=0.123)。SHAP分析识别出年龄、BMI和体力活动是主要风险驱动因素。糖尿病风险最高的人群获得的算法性能最差,这强调了在临床应用前需要采用公平感知、按年龄分层的部署策略。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:47

# 基于机器学习预测2型糖尿病风险的综合评估:大规模外部验证与公平性分析
来源:https://arxiv.org/abs/2607.16253
查看 PDF (https://arxiv.org/pdf/2607.16253)

> **摘要**:基于机器学习的2型糖尿病风险预测模型在内部验证中表现良好,但由于缺乏外部测试和公平性评估,在现实应用中失效。我们开发了一个多维框架,针对全国代表性人群进行区分度、校准度、可解释性和算法公平性评估。基于NHANES 2015-2020数据集(n=15,685),使用八个非实验室预测因子(年龄、性别、种族/民族、BMI、吸烟状况、体力活动、心脏病发作史、中风史)训练了一个XGBoost模型。在现实分布偏移条件下,使用BRFSS 2020-2022数据集(n=1,285,783)进行外部验证。内部验证显示良好的区分度(AUC=0.794,95% CI 0.788-0.800),但外部验证中性能下降(AUC=0.717,相对下降9.7%,p<0.001)。公平性分析揭示了严重偏差:老年人(≥60岁)AUC=0.607,而年轻人AUC=0.742(差异=0.135,p<0.001);肥胖个体AUC=0.698,而正常体重个体AUC=0.735(差异=0.037,p<0.001)。性别方面表现相当(男性=0.723,女性=0.712,p=0.142)。校准显示风险高估(Brier评分=0.123)。SHAP分析确定年龄、BMI和体力活动是主要风险驱动因素。糖尿病风险最高的人群获得最差的算法性能,这突显了在临床使用前需要采用公平性感知、按年龄分层的部署策略。

## 提交历史

来自:Rajveer Singh Pall [查看邮箱 (https://arxiv.org/show-email/d15c9dcd/2607.16253)] **[v1]** 2026年6月27日星期六 07:02:40 UTC (464 KB)

相似文章

通过先进机器学习技术变革心脏病预测

arXiv cs.LG

本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。