基于人口分层模型的全国性电子健康记录慢性鼻窦炎预测

arXiv cs.LG 论文

摘要

本文提出了一种基于人口分层模型和混合特征选择流程的全国性电子健康记录慢性鼻窦炎预测模型,在All of Us研究计划的数据上实现了总体AUC为0.8461。

arXiv:2605.05213v1 公告类型:新 摘要:慢性鼻窦炎(CRS)是一种常见的异质性炎症性疾病,会导致显著的发病率和医疗费用。由于症状表现与过敏性鼻炎等常见疾病重叠,且异质性表型进一步模糊了风险模式,因此从常规就诊中早期识别CRS较为困难。先前的预测研究通常依赖单一机构的队列,这降低了人群级别的泛化性。为克服这一局限,我们利用All of Us研究计划的全国性纵向电子健康记录(EHR)数据,基于两年诊断前病史预测CRS诊断。为应对编码EHR数据中极端特征稀疏性和高维性,我们实施了一种混合特征选择流程,结合基于患病率的统计筛选和基于模型的重要性排序,将约11万个候选代码压缩为100个可解释特征。为捕捉人口异质性,我们针对六个成年性别和生命阶段子组训练了人口分层模型,并进行子组特定的超参数调优。我们的框架实现了总体AUC为0.8461,比最佳基线提升了0.0168的区分能力。这些结果表明,常规收集的EHR数据可能支持具有人群代表性的CRS风险分层,并为初级保健中的早期分诊和转诊优先排序提供信息。
查看原文
查看缓存全文

缓存时间: 2026/05/08 06:25

# 基于人口统计学分层模型的全国性 EHR 慢性鼻窦炎预测
来源:https://arxiv.org/html/2605.05213
Yidan Shen†Justina VargheseAkshay R PrabhakarSebastian Guadarrama\-Sistos\-VazquezJiefu ChenMasayoshi TakashimaOmar G\. AhmedRenjie HuXin Fu∗∗\*通讯作者:Xin Fu

###### 摘要

慢性鼻窦炎(CRS)是一种常见的异质性炎症性疾病,会导致显著的发病率和医疗费用。由于症状与过敏性鼻炎等常见疾病重叠,且异质表型进一步模糊了风险模式,因此 CRS 在常规就诊中难以早期识别。先前的预测研究通常依赖于单一机构的队列,这降低了人群层面的泛化能力。为克服这一局限,我们利用“All of Us”研究计划的全国性纵向 EHR 数据,通过两年的诊断前病史来预测 CRS 诊断。为解决编码化 EHR 数据中的极端特征稀疏性和高维性,我们实施了一个混合特征选择流程,将基于患病率的统计筛选与基于模型的重要性排序相结合,将约 110,000 个候选代码压缩为 100 个可解释特征。为捕捉人口统计异质性,我们针对六个成人性别和生命阶段亚组训练了人口统计学分层模型,并进行亚组特定的超参数调整。我们的框架实现了总体 AUC 为 0.8461,相比最佳基线提高了 0.0168 的鉴别能力。这些结果表明,常规收集的 EHR 数据可能支持具有人群代表性的 CRS 风险分层,并有助于在初级保健中实现更早的分诊和转诊优先级排序。

## I 引言

慢性鼻窦炎(CRS)是一种异质性的鼻窦和鼻腔慢性炎症性疾病[8 (https://arxiv.org/html/2605.05213#bib.bib1),21 (https://arxiv.org/html/2605.05213#bib.bib24)]。CRS 是慢性发病的主要来源,影响美国约 11-12% 的人口[2 (https://arxiv.org/html/2605.05213#bib.bib22)],带来沉重的疾病负担,与健康相关生活质量的显著下降相关,且在美国每年造成 220 亿美元(2014 年美元)的国家财政负担[24 (https://arxiv.org/html/2605.05213#bib.bib27),22 (https://arxiv.org/html/2605.05213#bib.bib26)]。CRS 的正式临床诊断需要在鼻内镜或计算机断层扫描(CT)上获得客观炎症证据,因为基于症状的评估会因与其他炎症性气道疾病(如过敏性鼻炎)重叠而高估患病率[7 (https://arxiv.org/html/2605.05213#bib.bib25)]。然而,并非所有患者都能获得影像学检查,尤其是在许多初级保健环境中。利用常规收集的电子健康记录(EHR)数据在专科评估前识别潜在的 CRS 病例,可能有助于将决策从主观印象转向基于证据的预测。

最近一项研究使用鼻息肉 PRS 应用逻辑回归,其鉴别能力接近随机水平,表明没有临床或环境协变量的简单线性模型对于预测 CRS 效用有限[12 (https://arxiv.org/html/2605.05213#bib.bib5)]。相比之下,一些研究利用 CT 和 MRI 等影像学手段获得更好结果[7 (https://arxiv.org/html/2605.05213#bib.bib25),4 (https://arxiv.org/html/2605.05213#bib.bib16)];然而,CT/MRI 并非总是可用,限制了泛化能力。相关工作还利用已建立 CRS 队列中的 EHR 特征来预测下游结果。Ramakrishnan 等人比较了多种机器学习模型以对 CRS 患者的嗅觉功能障碍进行分类[20 (https://arxiv.org/html/2605.05213#bib.bib11)],Nuutinen 等人使用 EHR 衍生特征结合可解释性分析估计了修正鼻窦手术风险[18 (https://arxiv.org/html/2605.05213#bib.bib48)]。Hopkins 等人验证了 SNOT-22 作为患者报告结局指标,具有临床可解释的最小重要差异[10 (https://arxiv.org/html/2605.05213#bib.bib50)]。然而,这些研究并不预测个体是否会被诊断为 CRS。此外,许多研究来自单一机构或高护理强度队列,这些队列可能过度代表严重或难治性表型,而低估了更广泛的异质性人群。

为应对这些挑战,我们利用“All of Us”研究计划的全国性纵向 EHR 数据集,通过参与者两年的既往病史来预测 CRS 诊断。但编码临床特征具有极高的维度、稀疏性,且以弱信息变量为主。这种设置相对于样本量而言往往是病态的,会引入噪声和计算负担,降低预测性能并增加过拟合风险。为缓解这些问题,我们实施了一个混合特征选择流程,将基于统计患病率的筛选与基于模型的特征重要性选择相结合,得到紧凑且可解释的特征集,将超过 110,000 个候选特征减少到 100 个关键变量。

我们在分析中观察到表型模式随年龄和性别而变化:男性表现出年龄依赖性的向结构性及息肉样病理的转变,而女性则表现出黏膜炎症和特应性丰富的特征,年龄调节着从急性到更系统性表现的进展。这些观察结果得到了先前 CRS 研究的支持[26 (https://arxiv.org/html/2605.05213#bib.bib38),15 (https://arxiv.org/html/2605.05213#bib.bib39),29 (https://arxiv.org/html/2605.05213#bib.bib40),1 (https://arxiv.org/html/2605.05213#bib.bib44),11 (https://arxiv.org/html/2605.05213#bib.bib45)]。受此启发,我们应用了人口统计学特定的建模框架。具体而言,个体被分为六个亚组,由性别与基于年龄的成人生命阶段的交叉定义。为每个亚组独立训练了定制化的预测模型,以有效捕捉慢性炎症性疾病表现和医疗资源利用中已确立的差异。总体而言,这种人口统计学特定的方法实现了 AUC 为 0.8461,相对最佳基线提高了 0.0168 的鉴别能力,表明显式建模人口统计学异质性在 CRS 风险预测中带来了可衡量的改进。本文的贡献如下:

- •我们观察并利用了“All of Us”EHR 队列的全国性多样性和丰富因素。
- •我们引入了一个混合特征选择框架,将超过 110,000 个临床代码压缩为 100 个关键特征。
- •我们提出了受疾病表型和进展中显著的年龄依赖性性别二态性启发的人口统计学分层建模。
- •我们构建了六个独立模型,以捕捉每个亚组中的不同风险因素。
- •我们的方法在整体和亚组层面均展示了改进的鉴别能力。
- •我们的方法可能有助于在临床环境中,尤其是在诊断性影像不可用时,实现更早的分诊和转诊优先级排序。

## II 相关工作

机器学习(ML)越来越多地被用于增强 CRS 的诊断、表型分型和预后评估。总体而言,先前的研究集中于两个主要领域:利用专门影像或遗传模态的方法,以及利用电子健康记录(EHR)的方法。

### II-A 遗传与影像学方法

一系列有针对性的研究专门关注预测 CRS 的存在。在此范围内,已利用来自大规模生物样本库队列的多基因风险评分(PRS)探索遗传易感性,以估计跨不同祖先的疾病易感性[12 (https://arxiv.org/html/2605.05213#bib.bib5)]。补充性的方法利用头部 CT 和 MRI 的客观影像数据,基于 Lund-Mackay 阈值定义 CRS,并量化超出症状报告的炎症负担[7 (https://arxiv.org/html/2605.05213#bib.bib25)]。在方法上,遗传学研究中通常采用逻辑回归等线性框架来评估累积风险等位基因的预测效用。相比之下,以影像为中心的研究经常采用深度学习和影像组学流程,从扫描中提取高维特征以进行精确的表型分类[4 (https://arxiv.org/html/2605.05213#bib.bib16)]。然而,这些工作的一个主要局限性是依赖于资源密集型的数据模态;获取基因测序或影像涉及大量成本和后勤负担,使得这些方法在常规临床实践中不可行。此外,现有建模框架存在算法缺陷:线性模型往往缺乏捕捉异质性疾病通路中固有非线性交互的复杂性,而深度学习则存在可解释性有限的问题。

### II-B EHR 数据建模

一系列并行的工作利用广泛可获得的 EHR 和常规临床数据进行预测建模。例如,利用多中心前瞻性队列来区分 CRS 患者的嗅觉功能障碍与正常嗅觉[19 (https://arxiv.org/html/2605.05213#bib.bib49)]。类似地,利用纵向 EHR 数据的分析来预测修正鼻窦手术的个体风险[14 (https://arxiv.org/html/2605.05213#bib.bib12)],表明纳入更长的历史观察窗口显著提升了模型性能。在这些设置中,常采用随机森林和决策树等非线性学习器来捕捉症状和合并症之间的高阶交互,同时保持相对可解释性。

然而,这些研究依赖于相对较小的数据集,这带来了两个显著局限。首先,由于它们完全聚焦于在已建立的 CRS 队列内刻画结局,这些模型无法解决普通人群中更广泛的疾病筛查挑战。其次,这些队列有限的范围和规模引入了选择偏倚,缺乏人群层面的覆盖,使得难以交叉验证发现或确保跨不同人口统计群体的泛化能力。

见图注图1:流程概览。我们的框架通过数据预处理处理原始数据,通过混合特征选择识别关键特征,并基于人口统计学分层策略训练特定组别的模型。

## III 数据准备

为了克服先前慢性鼻窦炎建模研究(通常局限于单一机构 EHR)的有限泛化能力,我们利用了 NIH “All of Us” 研究计划,这是一个全国性、纵向的队列,其 EHR 数据已标准化为 OMOP 通用数据模型。然而,原始 OMOP 数据存储为稀疏的、事务性的事件日志,本身不兼容标准机器学习算法。为弥合这一差距,我们实施了一个严格的预处理流程,将这些不规则的纵向记录转换为结构化的、基于近期性的特征表示。这种转换对于捕捉疾病的时间动态至关重要:通过根据与索引日期的接近程度将历史临床事件聚合到固定窗口向量中,我们使模型能够优先考虑近期、活跃的临床信号,而不是远处历史。这个过程有效地将原始时间序列转换为统一的、适用于预测建模的近期性特征表。

### III-A 队列构建与目标定义

CRS 目标使用基于规则的表型分析策略进行识别。为验证诊断并最大限度地减少来自孤立编码事件的误分类,如果参与者在两年内至少有两次符合条件的 CRS 相关诊断代码,则被标记为 CRS 目标。所有未达到 CRS 目标定义的其余参与者被标记为对照。

对照与 CRS 目标按倾向评分匹配,以平衡人口统计学和医疗资源利用情况,匹配变量包括年龄类别、出生性别、种族、民族和就诊频率类别。就诊频率被纳入作为匹配标准,以减轻监测(确定)偏倚,因为就医次数更多的参与者有更多机会接受 CRS 相关诊断和记录的合并症。就诊频率由指定时间段内相关医疗就诊的平均次数定义,并分为少于 12 次、12-24 次或超过 24 次。对于 CRS 目标,索引日期定义为首次符合条件的 CRS 诊断日期;对于匹配的对照,索引日期分配为其匹配的 CRS 目标的相同日期,以确保观察窗口对齐。

### III-B 队列平衡与特征工程

原始电子健康记录在本质上表现出严重的类别不平衡,CRS 目标在一般人群中占很小比例。在此类偏斜数据上训练机器学习模型通常会产生偏向分类器,优先考虑特异性(预测多数类)而牺牲敏感性(检测真实目标)。为缓解这一问题并确保模型有效学习少数类信号,我们采用了降采样策略。

首先,排除在两年观察窗口内没有任何记录临床事件的参与者,以确保有足够的纵向信息用于可靠预测。随后,从剩余池中,对照按 1:1 与 CRS 目标匹配,基于预先计算的倾向评分采用最近邻匹配。这一过程产生了最终平衡的队列,包含 17,560 名参与者(目标=8,780,对照=8,780),作为全局模型训练和亚组分析的基础。

为将原始 OMOP 数据日志转换为可用格式,我们跨所有域(包括状况、药物和手术)应用了相同的基于近期性的编码方案。具体而言,对于内镜和影像等诊断性手术,这些特征捕捉的是服务的利用(即事件的发生),而非临床结果或发现。与仅指示条件存在或不存在的传统二元编码不同,近期性编码捕捉临床事件的时间接近性。这种方法反映了临床决策原则,即近期医疗交互通常比远处历史事件对患者当前健康状况具有更大的预后价值和相关性。对于每个临床变量,特征值定义为事件最近一次发生与索引日期之间的天数。为处理稀疏性,从未发生或在两年观察窗口外发生的事件被赋予一个哨兵值 999,999。这使得基于树的模型能够在数学上将缺失或远处事件与近期、临床活跃信号分开,而无需进行人为均值插补。最后,为确保严格评估并防止数据泄漏,所有显式 CRS 诊断代码在训练前都从特征集中移除。

见图注图2:混合特征选择流程

## IV 方法

如图 1 (https://arxiv.org/html/2605.05213#S2.F1) 中我们方法的整体流程所示,所提出的方法论包括三个核心组成部分,构建于预处理数据之上。

相似文章