基于人群健康的机器学习揭示社会心理因素与慢性肾病之间的关联
摘要
该论文提出了一项两部分的研究,使用机器学习对大规模远程医疗数据进行分析,以分类自我报告的慢性肾病状态并识别关键的社会心理和医学预测因子,平衡准确率约为72-76%,并通过SHAP分析增强可解释性。
arXiv:2608.17174v1 公告类型:新
摘要:慢性肾病(CKD)悄无声息地进展,严重影响生活质量,使得早期检测对于改善患者预后至关重要。我们提出了一项两部分的研究,结合大规模远程医疗数据和先进机器学习技术,以分类自我报告的CKD状态并识别疾病的关键驱动因素。使用来自行为风险因素监测系统(BRFSS 2021:438,693个样本;BRFSS 2019:418,268个样本)和国家健康访谈调查(NHIS 2021:29,482个样本;NHIS 2020:31,568个样本)的选定特征,我们采用九种先进的插补方法处理缺失数据,并通过采样策略缓解类别不平衡。我们定制的堆叠集成模型达到了72.56-76.12%的平衡准确率,相应的AUROC分数为79.59-82.29%。SHapley Additive exPlanations(SHAP)分析,随后进行临床审查,突出了关键预测因子,包括定期医疗检查、年龄、血压和心理健康压力指标。这些发现为CKD风险分层提供了一个稳健且可解释的框架,并为其相关因素提供了可操作的见解。
查看缓存全文
缓存时间: 2026/08/19 10:23
# 基于人群健康的机器学习揭示心理社会因素与慢性肾病的关联 来源:https://arxiv.org/abs/2608.17174 作者:Md\. Atik Shams、David Eisenberg、Sumaiya Fatema、Asma Sultana、D\. M Hasibul Islam、Junnatul Mawa、Anindita Datta、Nafiya Ahmed、Danastan Tasaouf Mridula、SK\. Sazid Mahmud、Simon Bin Akter、Tanjila Helaly、Jorge Fresneda Fernandez、Humayera Islam、Tanmoy Sarkar Pias 查看PDF (https://arxiv.org/pdf/2608.17174) > **摘要**:慢性肾病(CKD)进展隐匿且严重损害生活质量,因此早期检测对改善患者预后至关重要。本研究采用两阶段方法,结合大规模远程医疗数据与先进机器学习技术,既对自我报告的CKD状态进行分类,又识别疾病的关键驱动因素。基于行为风险因素监测系统(BRFSS 2021:438,693个样本;BRFSS 2019:418,268个样本)与国家健康访谈调查(NHIS 2021:29,482个样本;NHIS 2020:31,568个样本)的精选特征,我们采用九种前沿插补方法处理缺失数据,并通过采样策略缓解类别不平衡问题。定制化堆叠集成模型实现了72.56%-76.12%的平衡准确率,对应AUROC值达79.59%-82.29%。SHapley加性解释(SHAP)分析结合临床复核,突显了关键预测因素,包括定期医疗检查、年龄、血压及心理健康压力指标。研究结果为CKD风险分层提供了稳健且可解释的框架,并为其相关因素提供了可操作的洞见。 ## 投稿历史 发送者:Tanmoy Sarkar Pias \[查看邮件 (https://arxiv.org/show-email/120e3cb1/2608.17174)\] **\[v1\]** 2026年8月17日 周一 22:22:13 UTC(4,074 KB)
相似文章
评估机器学习模型在早期慢性肾脏病预测中的可靠性:数据泄露与预测因子稳定性的系统综述
本系统综述评估了机器学习模型在早期慢性肾脏病预测中的方法论可靠性,揭示数据泄露使报告的准确性虚高超过15%,且超过80%的预测因子在不同研究中缺乏稳定性。
CKD风险预测中的校准、不确定性沟通与部署就绪:一项框架评估研究
本研究评估了五种用于慢性肾脏病风险预测的机器学习分类器,发现近乎完美的内部性能在分布偏移下失效。强调在临床部署前需要校准稳定性和共形覆盖迁移。
从繁多到有意义:利用大语言模型进行特征引导的零样本慢性肾病筛查
本研究提出了一种基于特征引导的零样本框架,利用大语言模型进行早期慢性肾病筛查,在异构数据集上使用最少的社区可获取特征实现了一致的改进。
通过先进机器学习技术变革心脏病预测
本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。
机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。