从NHANES调查数据(2011-2018)分类冠心病风险,并进行全面数据泄露审计和校准检查[P]
摘要
一个分析NHANES调查数据以分类冠心病风险的项目,强调数据泄露审计和校准检查,同时比较机器学习模型。
GitHub仓库:https://github.com/YouCele/nhanes-chd-classification 我构建了一个项目,使用四个周期的NHANES数据(2011-2012至2017-2018)来预测自报、医生诊断的冠心病,清洗后约有21,500名成人。它比较了逻辑回归、随机森林和梯度提升,训练数据包括人口统计学、血压、身体测量和脂质面板。NHANES有一个问卷部分直接询问其他心血管疾病诊断,如中风、心脏病发作和心绞痛,以及CHD结果本身。如果我包括这些变量,PR-AUC从0.23跳到了0.51。这主要是模型学习到报告一种心血管疾病的人倾向于报告其他疾病,而不是关于真正的风险因素。所以我移除了整个部分,并写出了数据泄露效应有多大,而不是悄悄地删除列。类别加权逻辑回归,因为CHD患病率仅约4%而需要,给出了严重校准错误的原始概率。平均预测风险接近30%,而实际率为4%。我用sigmoid重新校准在开发集上拟合,然后才处理测试集,固定了决策阈值,所以报告的测试指标不是事后调整的。最终结果在保留的测试集上:逻辑回归的ROC-AUC为0.875,PR-AUC为0.239,随机森林和梯度提升结果相似。仅年龄得到0.83 AUC。血压、胆固醇和身体大小解释了大部分剩余的。在选定阈值下的PPV为0.13,所以大多数阳性预测是错误的,考虑到数据中CHD的稀有性,这是预期的,我在报告中直接说明这一点,而不是省略。吸烟状态、糖尿病和血压药物使用不在当前特征中。NHANES有这三项,我只是还没有添加。欢迎提供反馈,特别是在校准步骤或我处理泄露的方式中看起来有误的任何内容。
相似文章
基于CT钙化积分扫描中机会性冠状动脉钙化和心外膜脂肪评估的机器学习预测阻塞性冠状动脉疾病
本文提出了一种使用CatBoost和SHAP的机器学习框架,通过结合钙组学和心外膜脂肪特征,从CT钙化积分扫描中预测阻塞性冠状动脉疾病,实现了高准确性。
CardioMeta: 跨人群与电子健康记录数据中糖尿病、高血压和心血管疾病的校准多任务预测
CardioMeta是一个校准的多任务框架,用于在NHANES和MIMIC-IV数据上联合预测糖尿病、高血压和心血管疾病,强调泄漏控制、校准和透明可靠性。
基于加速度测量的心血管代谢风险数字生物标志物:具有不确定性量化的人群代表性表格基准
本文介绍了NHANES加速度测量心血管代谢基准,这是一个用于从加速度测量数据预测心血管代谢风险的人群代表性表格数据集,并评估了岭回归、XGBoost和TabPFN v2,结合使用保形预测进行不确定性量化。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。
通过先进机器学习技术变革心脏病预测
本研究论文比较了各种机器学习分类器用于心脏病预测,发现支持向量机 (SVM) 和 Simple Cart 分别在 UCI 和 Kaggle 数据集上表现最佳,突显了机器学习在早期临床诊断中的潜力。