评估机器学习模型在早期慢性肾脏病预测中的可靠性:数据泄露与预测因子稳定性的系统综述

arXiv cs.LG 论文

摘要

本系统综述评估了机器学习模型在早期慢性肾脏病预测中的方法论可靠性,揭示数据泄露使报告的准确性虚高超过15%,且超过80%的预测因子在不同研究中缺乏稳定性。

arXiv:2607.11963v1 Announce Type: new 摘要:使用机器学习早期检测慢性肾脏病(CKD)在医疗相关计算机科学领域引起了广泛关注。尽管该领域发展迅速,但许多已报告的研究仍存在不一致且可能具有误导性。一个显著缺陷是缺乏对方法论问题的系统评估。关键问题包括数据泄露、患者时间序列记录获取受限以及临床指标报告不一致。本研究对现有使用可解释机器学习技术的CKD预测研究进行了系统性文献综述,通过系统检索主要学术数据库筛选出19项相关研究。为了评估方法论可靠性,本研究引入了一个结构化的信息泄露分类体系和一个定量泄露评分框架,以系统评估CKD预测研究的可靠性。分析揭示了泄露与性能虚高之间的强相关性。其中,高泄露研究报告的平均准确率为95.48%,而无泄露研究为80.2%,提升了约15.28%。此外,跨研究特征稳定性分析表明,仅有一小部分预测因子具有一致的可复现性,超过80%缺乏可靠性。总体而言,研究结果表明,许多报告的性能提升源于方法论局限性,而非真正的预测能力。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:17

# 1. 引言
来源:https://arxiv.org/html/2607.11963

机器学习模型中早期慢性肾病预测的可靠性评估:数据泄露与预测变量稳定性的系统综述

Mashrul Hossain, Nafesa Kibria, Fahim Shahriar
mashrul16hossain@gmail\.com, nafesa220128@gmail\.com, fahimshahriar1306@gmail\.com
East West University, Dhaka, Bangladesh

摘要 - 利用机器学习早期检测慢性肾病已在医疗相关计算机科学领域引起广泛关注。尽管该领域进展迅速,但许多已报道的研究仍存在不一致且可能具有误导性。一个显著缺陷是缺乏对方法论问题的系统评估。关键问题包括数据泄露、对时序患者记录的有限访问以及所报告临床指标的不一致性。本研究通过可解释机器学习技术对现有CKD预测研究进行了系统性文献综述,通过跨主要学术数据库的系统搜索筛选出19项相关研究。为评估方法论可靠性,本研究引入了信息泄露的结构化分类法和定量泄露评分框架,以系统评估CKD预测研究的可靠性。分析揭示了泄露与性能膨胀之间的强相关性。其中,高泄露研究的平均准确率为95.48%,而无泄露研究的平均准确率为80.2%,增幅约为15.28%。此外,跨研究特征稳定性分析表明,只有少数预测变量具有一致的可重复性,超过80%的预测变量缺乏可靠性。总体而言,研究结果表明,许多报告的性能提升源于方法论局限而非真正的预测能力。

关键词:慢性肾病,机器学习,数据泄露,指标,特征分析,生物标志物

慢性肾病(Chronic Kidney Disease, CKD)是一种以肾功能逐渐下降为特征的进行性疾病,影响全球超过8.5亿人\[2 (https://arxiv.org/html/2607.11963#bib.bib1)\]\[24 (https://arxiv.org/html/2607.11963#bib.bib2)\]。CKD的早期检测至关重要,因为症状往往仅在晚期才出现,而此时治疗选择相当有限。因此,早期识别CKD对于延缓疾病进展、管理相关合并症以及减轻医疗系统的长期经济负担至关重要\[8 (https://arxiv.org/html/2607.11963#bib.bib5)\]\[22 (https://arxiv.org/html/2607.11963#bib.bib6)\]。近年来,机器学习(ML)已成为分析复杂临床数据集和识别与CKD早期发病相关模式的有前景方法,这些模式可能无法通过传统统计技术检测到\[5 (https://arxiv.org/html/2607.11963#bib.bib7)\]\[20 (https://arxiv.org/html/2607.11963#bib.bib3)\]。

机器学习模型可以评估多种类型的患者数据,例如实验室结果、人口统计信息和病史,以评估一个人患上CKD的可能性。这些预测系统帮助医疗服务提供者更早地识别高风险患者,并在发生显著肾损伤之前促进预防性治疗策略的实施\[8 (https://arxiv.org/html/2607.11963#bib.bib5)\]\[20 (https://arxiv.org/html/2607.11963#bib.bib3)\]。然而,许多关键挑战仍然限制了ML驱动的诊断系统在医疗领域的实际应用。一个众所周知的问题是,许多高性能模型(如深度神经网络和复杂集成技术)的可解释性受限\[8 (https://arxiv.org/html/2607.11963#bib.bib5)\]\[10 (https://arxiv.org/html/2607.11963#bib.bib8)\]。临床医生通常需要算法预测的清晰解释,以便信任并将其整合到医疗决策中。此外,方法论上的局限性,如数据集偏差、有限的外部验证以及来自单个中心的小样本量,继续影响着许多现有研究的可靠性和泛化能力\[5 (https://arxiv.org/html/2607.11963#bib.bib7)\]\[20 (https://arxiv.org/html/2607.11963#bib.bib3)\]\[32 (https://arxiv.org/html/2607.11963#bib.bib11)\]。

近期关于早期CKD预测的研究显示,从传统统计方法向更先进的机器学习方法逐步转变。逻辑回归常被用作简单的基线模型,而基于树的集成方法(如随机森林、XGBoost和CatBoost)则通常用于提高预测准确性\[5 (https://arxiv.org/html/2607.11963#bib.bib7)\]\[4 (https://arxiv.org/html/2607.11963#bib.bib12)\]\[19 (https://arxiv.org/html/2607.11963#bib.bib4)\]。这些模型通常依赖于几个广泛引用的临床指标,例如血清肌酐浓度、估算肾小球滤过率(eGFR)、血红蛋白浓度、白蛋白尿标志物以及年龄或高血压病史等人口统计学变量\[5 (https://arxiv.org/html/2607.11963#bib.bib7)\]\[2 (https://arxiv.org/html/2607.11963#bib.bib1)\]\[33 (https://arxiv.org/html/2607.11963#bib.bib13)\]\[19 (https://arxiv.org/html/2607.11963#bib.bib4)\]。多项研究在选定数据集上评估其模型时,显示出极高的诊断精度和稳健的曲线下面积(AUC)指标。然而,在对照研究中取得近乎完美结果的模型,在数据质量、患者多样性和临床变异性更高的真实医疗环境中,可能无法同样有效地发挥作用\[20 (https://arxiv.org/html/2607.11963#bib.bib3)\]\[1 (https://arxiv.org/html/2607.11963#bib.bib14)\]。

尽管机器学习在早期CKD预测研究方面取得了快速进展,但文献中仍有一些方法论问题未得到充分解决。CKD检测研究中的一个关键问题是信息泄露,即当预测变量包含与模型训练中使用的结果标签直接相关的信息时发生。例如,即使CKD标签来源于相同的测量值,eGFR或血清肌酐等变量有时仍被用作预测变量,这可能导致过于乐观的模型性能\[17 (https://arxiv.org/html/2607.11963#bib.bib9)\]。此外,被识别为重要的预测变量在不同研究中常有所不同,表明特征显著性的变异性基于特征选择技术和数据集特性\[17 (https://arxiv.org/html/2607.11963#bib.bib9)\]。尽管以往关于CKD预测的研究主要比较模型性能,但缺乏一个统一的框架来系统地检测信息泄露或评估跨研究特征稳定性。这一局限性凸显了在现有CKD研究中对方法论有效性、预测变量一致性和临床相关性进行全面评估的必要性。

研究问题:
• 数据泄露对机器学习模型有效性的影响有多大?
• 哪些临床特征在早期CKD预测研究中表现出一致稳定性,哪些预测变量是数据集特异的?

目标:本研究通过提供基于机器学习的CKD预测研究方法论的结构化分析,来应对上述挑战。本研究的主要目标如下:
• 对CKD机器学习研究中的信息泄露进行分类,分为直接泄露、代理泄露和时间泄露,以期为未来的研究提供更一致的实验设计。
• 通过三步跨研究特征稳定性分析,识别在多个群体中保持一致性的临床预测变量以及那些看似数据集特异的预测变量。

## 2. 相关工作

早期检测慢性肾病至关重要,因为它可以减缓疾病进展。CKD在初期阶段没有症状,因此大多数病例在初级医疗环境中被发现\[8 (https://arxiv.org/html/2607.11963#bib.bib5),1 (https://arxiv.org/html/2607.11963#bib.bib14)\]。可解释的机器学习框架已成为整理复杂临床非结构化数据和揭示经验丰富的临床医生可能遗漏的风险检测模式的重要工具\[20 (https://arxiv.org/html/2607.11963#bib.bib3),1 (https://arxiv.org/html/2607.11963#bib.bib14)\]。早期的CKD预测研究依赖于经典算法,如逻辑回归、支持向量机和决策树\[30 (https://arxiv.org/html/2607.11963#bib.bib22),29 (https://arxiv.org/html/2607.11963#bib.bib24)\]。由于数据集小而单一中心、数据质量管理不足,这些模型的泛化能力严重受限\[9 (https://arxiv.org/html/2607.11963#bib.bib19),1 (https://arxiv.org/html/2607.11963#bib.bib14)\]。具体而言,在UCI基准上常报告的高性能分数是过拟合的证据,引发了对模型在真实医疗环境中可靠性的质疑。在患者多样性真实存在且临床环境混乱的现实世界中,这些模型很可能会失败\[20 (https://arxiv.org/html/2607.11963#bib.bib3),1 (https://arxiv.org/html/2607.11963#bib.bib14)\]。关于关键生物标志物(如血清肌酐和估算肾小球滤过率(eGFR))的重要性,研究方法论上存在共识,这些标志物通常通过特征选择方法(如递归特征消除(RFE)、主成分分析(PCA)或LASSO)识别出来\[6 (https://arxiv.org/html/2607.11963#bib.bib48),1 (https://arxiv.org/html/2607.11963#bib.bib14)\]。此外,常见的预测变量包括白蛋白尿、患者年龄和血红蛋白水平\[17 (https://arxiv.org/html/2607.11963#bib.bib9),3 (https://arxiv.org/html/2607.11963#bib.bib23)\]。一个核心方法论问题是主要预测变量在不同研究中的不稳定性。这些变化通常反映了数据集偏差和区域人口统计学差异,例如不同的环境因素和医疗系统限制\[17 (https://arxiv.org/html/2607.11963#bib.bib9),15 (https://arxiv.org/html/2607.11963#bib.bib18)\]。

识别出的一个关键局限性是信息泄露的普遍存在。许多研究将基于病理检测的标志物(如血清肌酐或eGFR)作为模型训练的输入特征,

相似文章