从NHANES调查数据(2011-2018)分类冠心病风险,并进行全面数据泄露审计和校准检查[P]

Reddit r/MachineLearning 论文

摘要

一个分析NHANES调查数据以分类冠心病风险的项目,强调数据泄露审计和校准检查,同时比较机器学习模型。

GitHub仓库:https://github.com/YouCele/nhanes-chd-classification 我构建了一个项目,使用四个周期的NHANES数据(2011-2012至2017-2018)来预测自报、医生诊断的冠心病,清洗后约有21,500名成人。它比较了逻辑回归、随机森林和梯度提升,训练数据包括人口统计学、血压、身体测量和脂质面板。NHANES有一个问卷部分直接询问其他心血管疾病诊断,如中风、心脏病发作和心绞痛,以及CHD结果本身。如果我包括这些变量,PR-AUC从0.23跳到了0.51。这主要是模型学习到报告一种心血管疾病的人倾向于报告其他疾病,而不是关于真正的风险因素。所以我移除了整个部分,并写出了数据泄露效应有多大,而不是悄悄地删除列。类别加权逻辑回归,因为CHD患病率仅约4%而需要,给出了严重校准错误的原始概率。平均预测风险接近30%,而实际率为4%。我用sigmoid重新校准在开发集上拟合,然后才处理测试集,固定了决策阈值,所以报告的测试指标不是事后调整的。最终结果在保留的测试集上:逻辑回归的ROC-AUC为0.875,PR-AUC为0.239,随机森林和梯度提升结果相似。仅年龄得到0.83 AUC。血压、胆固醇和身体大小解释了大部分剩余的。在选定阈值下的PPV为0.13,所以大多数阳性预测是错误的,考虑到数据中CHD的稀有性,这是预期的,我在报告中直接说明这一点,而不是省略。吸烟状态、糖尿病和血压药物使用不在当前特征中。NHANES有这三项,我只是还没有添加。欢迎提供反馈,特别是在校准步骤或我处理泄露的方式中看起来有误的任何内容。
查看原文

相似文章

从结构化临床数据预测心血管风险的大语言模型

arXiv cs.CL

本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。

通过先进机器学习技术变革心脏病预测

arXiv cs.LG

本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。