基于梯度提升与无分布覆盖的非酒精性脂肪肝病一致性风险预测
摘要
本文介绍了LiverRisk,一个用于NAFLD风险预测的机器学习框架,它结合了梯度提升决策树和一致性预测,为个体风险评估提供校准后的无分布覆盖保证,在内部和外部队列上均实现了高AUROC。
arXiv:2606.09860v1 公告类型:新
摘要:非酒精性脂肪肝病(NAFLD)影响全球约25%的成年人,带来显著的肝脏和心血管风险。然而,人群层面的筛查工具仍然不足。我们提出了Method,一个用于NAFLD风险预测的机器学习框架,将梯度提升决策树与一致性预测相结合,为个体风险评估提供校准后的无分布覆盖保证。该方法集成了基于互信息的稳定性选择过程,通过自助重采样识别一个紧凑且临床可解释的特征子集,构建预测集,其边际覆盖可证明超过用户指定的置信水平。我们在中国广州的一个多中心队列(主要队列 n=2,187;外部验证 n=412)上评估了Method,使用了78个候选特征,涵盖人口统计学、代谢生物标志物和生活方式因素。Method内部AUROC达到0.912,外部AUROC达到0.891,优于深度神经网络、TabNet、支持向量机和逻辑回归。一致性预测集在90%名义水平下实现了91.3%的经验覆盖率。基于这些评分得出的三层风险分层将人群分为不同组别,高风险亚组12个月进展率是低风险层的4.7倍。选定的特征——特别是腰围、ALT、GGT、甘油三酯、空腹血糖和BMI——与已知的代谢风险因素一致,提供了生物学合理性。
查看缓存全文
缓存时间: 2026/06/10 06:13
# 基于梯度提升与无分布假设覆盖的非酒精性脂肪性肝病保形风险预测
来源: https://arxiv.org/html/2606.09860
Xinze Zhang¹ ¹南加州大学,洛杉矶,CA 90007,美国 *通讯作者: zhangxinze00@outlook\.com
###### 摘要
非酒精性脂肪性肝病影响着全球约四分之一的成年人口,并带来显著的长期肝脏和心血管风险,然而人群层面的筛查工具仍不足以早期识别高风险个体。我们提出LiverRisk,一个用于NAFLD风险预测的机器学习框架,该框架将梯度提升决策树与保形预测相结合,为个体风险估计提供经过校准的、无分布假设的覆盖保证。该框架整合了基于互信息的稳定特征选择过程,通过自助法重采样识别出紧凑且临床可解释的特征子集,并构建了保形化预测集,在仅假设可交换性的条件下,其边际覆盖率可证明超过用户指定的置信水平。我们使用来自中国广州的多中心健康体检队列(主队列 n=2,187;外部验证 n=412)评估LiverRisk,该队列包含78个候选特征,涵盖人口统计学、人体测量学、代谢生物标志物、肝酶、血脂谱、生活方式因素和血液学指标。LiverRisk在内部测试集上达到0.912的受试者工作特征曲线下面积,在外部队列上达到0.891,优于深度神经网络、TabNet、支持向量机和逻辑回归。在名义置信水平90%下,保形预测集实现了91.3%的经验覆盖率。从保形化分数导出的三层风险分层将人群分为临床不同的组别,高风险亚组的12个月进展率是低风险组的4.7倍。所选特征集——以腰围、丙氨酸氨基转移酶、γ-谷氨酰转移酶、甘油三酯、空腹血糖和体重指数为主——与已确定的代谢风险因素一致,为模型决策提供了生物学合理性。
关键词: NAFLD,梯度提升,保形预测,无分布假设推断,特征选择,临床风险分层
## 1 引言
非酒精性脂肪性肝病涵盖从单纯性脂肪变性到非酒精性脂肪性肝炎、纤维化和肝硬化的一系列肝脏疾病,现已被公认为全球最常见的慢性肝病\[18 (https://arxiv.org/html/2606.09860#bib.bib44),11 (https://arxiv.org/html/2606.09860#bib.bib45),10 (https://arxiv.org/html/2606.09860#bib.bib46),47 (https://arxiv.org/html/2606.09860#bib.bib58),28 (https://arxiv.org/html/2606.09860#bib.bib53)\]。患病率估算因地理和诊断标准而异,但荟萃分析一致显示全球数字接近25%,在具有代谢综合征、肥胖或2型糖尿病特征的人群中比例更高\[27 (https://arxiv.org/html/2606.09860#bib.bib47),22 (https://arxiv.org/html/2606.09860#bib.bib48),25 (https://arxiv.org/html/2606.09860#bib.bib49),12 (https://arxiv.org/html/2606.09860#bib.bib54)\]。临床负担因NAFLD常隐匿进展而加重:许多患者直到出现晚期纤维化或肝细胞癌才被诊断,此时治疗选择有限\[24 (https://arxiv.org/html/2606.09860#bib.bib50),23 (https://arxiv.org/html/2606.09860#bib.bib51),46 (https://arxiv.org/html/2606.09860#bib.bib61),49 (https://arxiv.org/html/2606.09860#bib.bib62),30 (https://arxiv.org/html/2606.09860#bib.bib55)\]。因此,早期风险识别有可能在疾病可逆的窗口期内,将临床资源引导至生活方式干预和药物治疗。
人群层面的NAFLD筛查传统上依赖于肝脏超声或血清转氨酶水平升高,但两者均存在广为人知的局限性。超声对轻度脂肪变性的灵敏度低于65%\[26 (https://arxiv.org/html/2606.09860#bib.bib52),48 (https://arxiv.org/html/2606.09860#bib.bib59),37 (https://arxiv.org/html/2606.09860#bib.bib60)\],而单独使用丙氨酸氨基转移酶会漏诊相当一部分活检确诊的NAFLD病例\[33 (https://arxiv.org/html/2606.09860#bib.bib6),15 (https://arxiv.org/html/2606.09860#bib.bib56),29 (https://arxiv.org/html/2606.09860#bib.bib57)\]。复合临床评分如脂肪肝指数\[5 (https://arxiv.org/html/2606.09860#bib.bib7)\]和肝脂肪变性指数\[21 (https://arxiv.org/html/2606.09860#bib.bib8)\]相比单标志物方法有所改进,但受限于其构建所依据的线性或对数线性函数形式。机器学习方法原则上能够捕捉NAFLD病理生理学特征中代谢、人体测量学和生活方式变量之间的非线性、高阶交互作用,且已有越来越多的研究将随机森林\[32 (https://arxiv.org/html/2606.09860#bib.bib9)\]、梯度提升树\[44 (https://arxiv.org/html/2606.09860#bib.bib10)\]和深度神经网络\[42 (https://arxiv.org/html/2606.09860#bib.bib11)\]应用于基于电子健康记录的NAFLD分类。
在临床环境中,机器学习风险模型一直受到的一项批评是缺乏严格的量化不确定性。点预测——无论其准确度如何——都不能给临床医生提供原则性的方法,以区分预测风险为0.72且估计紧密的患者与预测风险同样为0.72但高度不确定的患者。保形预测\[43 (https://arxiv.org/html/2606.09860#bib.bib17),38 (https://arxiv.org/html/2606.09860#bib.bib18)\]提供了一种优雅的解决方案:给定任意基础预测器和可交换的校准样本,保形预测构建的预测集以用户指定的概率包含真实结果,且无需对数据生成过程进行分布假设。近期的工作已开始探索保形方法在医学影像\[31 (https://arxiv.org/html/2606.09860#bib.bib21)\]和生存分析\[7 (https://arxiv.org/html/2606.09860#bib.bib22)\]中的应用,但其在表格型临床风险预测——特别是NAFLD筛查——中的应用仍基本未开发。
第二个挑战涉及特征选择。健康体检数据集通常包含几十到几百个实验室和问卷变量,其中许多对于特定疾病终点是冗余或不相关的。选择精简的特征集对于临床部署(考虑成本和患者负担)、模型可解释性以及推广到某些检测可能无法获得的新人群具有重要意义。稳定选择\[34 (https://arxiv.org/html/2606.09860#bib.bib25)\]通过聚合自助法重采样结果来解决单次特征选择众所周知的稳定性问题,提供每个特征的选择概率,并具有有限样本误差控制。我们通过将基础选择器替换为捕捉非线性依赖关系的互信息估计器\[20 (https://arxiv.org/html/2606.09860#bib.bib27)\]来扩展这一思想,使其与后续梯度提升模型的能力相匹配。
本文做出三项贡献。首先,我们开发了LiverRisk,一个基于LightGBM的预测框架,包裹了分割保形预测以产生带有无分布假设预测区间的风险估计,并证明了在可交换性假设下边际覆盖保证成立。其次,我们提出了一种互信息稳定选择程序,该程序识别出一个紧凑的特征集,其选择频率超过理论驱动的阈值,从而对纳入的无信息特征数量提供逐族错误率控制。第三,我们在来自中国广州的多中心队列(内部AUROC 0.912,外部0.891)上验证了完整流程,展示了强大的判别能力、良好校准的保形集和具有临床意义的三层风险分层。图1提供了临床动机及LiverRisk所解决差距的概要示意。
引用图注图 1: NAFLD筛查中临床差距的示意图。现有复合评分和单一生物标志物(左侧)遗漏了相当一部分高危患者。LiverRisk(右侧)将梯度提升与保形预测相结合,提供带有覆盖保证的个体化风险估计,为临床决策实现原则性的三层分层。
## 2 相关工作
### 2.1 用于NAFLD预测的机器学习
机器学习在NAFLD预测中的应用在过去十年间加速发展,驱动因素包括电子健康记录数据的日益可用性,以及线性模型无法捕捉肝脂肪变性背后复杂代谢交互作用的共识。Ma等人\[32 (https://arxiv.org/html/2606.09860#bib.bib9)\]在中国健康体检队列上训练了随机森林,报告AUROC约为0.84,其中BMI、甘油三酯和ALT位列最重要的预测因子。Xia等人\[44 (https://arxiv.org/html/2606.09860#bib.bib10)\]在韩国人群队列上比较了XGBoost\[9 (https://arxiv.org/html/2606.09860#bib.bib12)\]与逻辑回归,发现梯度提升的AUROC优势为5-7个百分点。Sowa等人\[42 (https://arxiv.org/html/2606.09860#bib.bib11)\]将深度神经网络应用于德国三级诊疗数据集,达到0.87的AUROC,但指出模型校准和可解释性方面的困难。基于LightGBM的集成方法\[19 (https://arxiv.org/html/2606.09860#bib.bib13)\]因其计算效率和天然处理缺失值(在常规健康检查中常见)的能力而受到关注。TabNet\[3 (https://arxiv.org/html/2606.09860#bib.bib14)\],一种为表格数据设计的基于注意力的架构,也已在肝病学背景下被评估\[41 (https://arxiv.org/html/2606.09860#bib.bib15)\],但往往需要更大的样本量才能优于经过良好调优的树集成。在这一文献中,存在两个持续的差距:缺乏个体风险评分的无分布假设不确定性量化,以及缺乏理论严谨的特征选择来解释变量重要性排名在训练运行间的不稳定性。
### 2.2 临床环境中的保形预测
保形预测最初由Vovk等人\[43 (https://arxiv.org/html/2606.09860#bib.bib17)\]提出,提供了一个与模型无关的框架,用于构建具有有限样本覆盖保证的预测集。分割(或归纳)变体\[35 (https://arxiv.org/html/2606.09860#bib.bib19)\]将可用数据划分为训练集和校准集,在训练集上拟合任意基础学习器,并使用校准残差(或非一致性分数)设置阈值,以在目标错误覆盖率α下定义预测集。边际覆盖保证所需的唯一假设是校准点和测试点的可交换性,这严格弱于独立同分布假设,并允许某种形式的分布偏移\[4 (https://arxiv.org/html/2606.09860#bib.bib20)\]。在临床应用中,Lu等人\[31 (https://arxiv.org/html/2606.09860#bib.bib21)\]将保形预测应用于皮肤科图像分类,并展示了通过组条件校准可以在人口统计学亚组间维持覆盖率。Candès等人\[7 (https://arxiv.org/html/2606.09860#bib.bib22)\]将保形思想扩展到生存分析,产生了以指定概率覆盖真实事件时间的保形化生存曲线。Angelopoulos和Bates\[1 (https://arxiv.org/html/2606.09860#bib.bib23)\]提供了一篇易于理解的教程,促进了该方法在应用领域的采纳。尽管有此势头,保形预测在表格型临床风险模型中的使用仍然有限,而这类模型中混合特征类型、中等样本量以及对临床可操作输出的需求构成了特殊挑战,我们的工作正是针对这些挑战。
### 2.3 具有稳定性保证的特征选择
临床预测模型的特征选择必须在预测性能、可解释性、成本和对数据扰动的鲁棒性之间取得平衡。经典过滤方法通过单变量关联度量(如χ²统计量、互信息\[13 (https://arxiv.org/html/2606.09860#bib.bib24)\]或相关性)对特征进行排序,并选择前k个,但它们忽略了特征交互作用,并且对特定的训练样本敏感。包装方法,包括递归特征消除\[17 (https://arxiv.org/html/2606.09860#bib.bib28)\],迭代重新训练模型,计算成本高。嵌入式方法,如L1惩罚回归或基于树的特征重要性\[6 (https://arxiv.org/html/2606.09860#bib.bib30)\],效率较高,但当特征相关时(这在代谢生物标志物面板中很典型)会产生不稳定的排名。稳定选择\[34 (https://arxiv.org/html/2606.09860#bib.bib25)\]通过重复对数据的随机子样本进行选择步骤,并仅保留选择频率超过阈值π_thr的特征来解决这一脆弱性。Meinshausen和Bühlmann表明,错误选择的变量的期望数量(逐族错误率)可以作为π_thr和每个子样本平均选择特征数量的函数而被限定。Shah和Samworth\[39 (https://arxiv.org/html/2606.09860#bib.bib26)\]完善了这些界限并引入了互补对稳定选择。在我们的工作中,我们将基础选择器替换为k近邻互信息估计器\[20 (https://arxiv.org/html/2606.09860#bib.bib27)\],该估计器无需参数分布假设即可捕捉非线性依赖关系,并将所得特征集整合到LightGBM训练循环中。
## 3 方法
### 3.1 问题设定
设\{(x_i, y_i)\}_{i=1}^n表示一个可交换的特征-标签对序列,其中x_i ∈ X ⊆ ℝ^d包含d个临床特征,y_i ∈ {0, 1}表示NAFLD状态(y_i = 1表示NAFLD阳性)。我们寻求一个评分函数f: X → [0, 1],其输出p̂(x) = f(x)估计条件概率Pr(Y = 1 | X = x),同时寻求一个预测集函数C_α: X → 2^{{0, 1}},该函数满足边际覆盖性质:
Pr(Y_{n+1} ∈ C_α(X_{n+1})) ≥ 1 - α (1)
对于用户指定的错误覆盖水平α ∈ (0, 1),且仅需假设(X_1, Y_1), ..., (X_{n+1}, Y_{n+1})是可交换的。
我们还寻求一个特征子集S ⊆ {1, …, d},满足|S| ≪ d,使得限制模型f_S(作用于x_S = (x_j)_{j∈S})相似文章
将数据驱动预测与分配对齐:一种以决策为中心的生存分析方法
本文介绍了一种面向决策的生存分析学习方法,该方法通过NDCG优化将预测模型与后续分配决策对齐。应用于美国心脏移植数据后,排名性能提升了50-100%,每年可能带来数千额外生命年。
基于可解释集成机器学习模型检测丙型肝炎患者肝硬化的存在
本文应用集成机器学习模型(随机森林、梯度提升、XGBoost、极端随机树)检测丙型肝炎患者的肝硬化,使用了来自2038名埃及患者的28个特征。极端随机树模型仅用16个特征就达到了96.92%的准确率,优于其他模型。
CKD风险预测中的校准、不确定性沟通与部署就绪:一项框架评估研究
本研究评估了五种用于慢性肾脏病风险预测的机器学习分类器,发现近乎完美的内部性能在分布偏移下失效。强调在临床部署前需要校准稳定性和共形覆盖迁移。
机器学习用于2型糖尿病风险预测的综合评估:大规模外部验证与公平性分析
本文构建了一个多维框架,用于评估基于机器学习的2型糖尿病风险预测模型的区分度、校准度、可解释性和算法公平性,揭示了在现实世界分布偏移下性能显著下降以及按年龄和肥胖程度存在的偏差。
在线局部化共形预测
本文提出了在线局部化共形预测(OLCP),旨在解决在线学习和时间序列设置中的协变量异质性问题。文章引入了用于带宽选择的 OLCP-Hedge 算法,并证明与现有基线相比,该方法在获得更窄预测集的同时,仍能保持有效的长期覆盖率。