面向令牌化电子健康记录的联邦生成式事件模型
摘要
这篇arXiv论文评估了在来自三个医疗系统的ICU EHR数据上,对令牌化生成式事件模型(GEMs)进行联邦训练的效果,结果表明联邦学习能够保留集中式训练的大部分性能,并且与传统监督模型相比,提高了跨站点的可迁移性。
arXiv:2608.02939v1 公告类型:新 \n摘要:电子健康记录基础模型受到机构数据孤岛和跨站点迁移时性能大幅下降的限制。我们评估了在来自三个独立医疗系统、统一为通用纵向ICU数据格式的122,251次重症监护住院记录上,对令牌化生成式事件模型(GEMs)进行联邦训练的效果。使用站点内、跨站点、集中式和联邦训练配置,在12项入院后24小时临床预测任务上对模型进行了评估。GEMs在站点内和跨站点的平均ROC-AUC上取得了最高值,并且比传统监督模型具有显著更高的可迁移性:其平均跨站点惩罚为0.025 ROC-AUC和0.027 PR-AUC,而LightGBM分别为0.079和0.089。联邦学习(FedAvg和FedAvgM)接近集中式GEM训练的性能,且大部分收益在5-10轮通信内即可获得。然而,集中式多站点训练相比完全本地训练仅带来适度改善。多站点模型在本地训练数据有限时最为有用,随着机构数据积累其优势逐渐缩小。这些发现表明,联邦GEM训练在技术上是可行的,并能保留集中式训练的大部分性能,但主要开放挑战在于学习可迁移的表征,以便将来自多个医疗系统的更大但异构的数据转化为可靠的目标站点收益。
查看缓存全文
缓存时间: 2026/08/05 07:43
# 面向标记化电子健康记录的联邦生成事件模型
来源:https://arxiv.org/html/2608.02939
Luke Solo
Inhyeok Lee
S’Khaja
Charles Zewei “Whiskey” Liao
Kaveri Chhikara
Dema Therese
芝加哥大学医学系,芝加哥,伊利诺伊州,美国
电子邮件:\{burkh4rt,lsolo,ihlee,skhaja,wliao0504,kaveri,dema\}@uchicago\.edu
Wan\-Ting Liao
Catherine A\. Gao
西北大学范伯格医学院医学系,芝加哥,伊利诺伊州,美国
电子邮件:\{wanting\.liao,catherine\.gao\}@northwestern\.edu
William F\. Parker 和 Brett K\. Beaulieu\-Jones
芝加哥大学医学系,芝加哥,伊利诺伊州,美国
电子邮件:\{wparker,beaulieujones\}@uchicago\.edu
###### 摘要
电子健康记录基础模型受到机构数据孤岛和跨机构迁移时性能显著下降的制约。我们评估了在来自三个独立卫生系统、并统一到通用纵向ICU数据格式(Common Longitudinal ICU Data Format)的122,251次重症监护住院记录上,对标记化生成事件模型(GEMs)进行联邦训练的效果。模型在12项24小时后的临床预测任务上,采用机构内、跨机构、集中式和联邦式训练配置进行评估。GEMs在机构内和跨机构的平均ROC-AUC上均取得最高值,并且比传统监督模型具有显著更好的可迁移性:其平均跨机构惩罚为0.025 ROC-AUC和0.027 PR-AUC,而LightGBM分别为0.079和0.089。联邦学习(FedAvg和FedAvgM)接近集中式GEM训练的性能,且大部分收益在5–10轮通信内即可获得。然而,集中式多机构训练相比完全本地训练仅提供了适度的改进。当本地训练数据有限时,多机构模型的效用最大;随着机构数据积累,其优势逐渐缩小。这些发现表明,联邦GEM训练在技术上是可行的,并保留了集中式训练的大部分性能,但主要的开放挑战在于学习可迁移的表征,从而将来自多个卫生系统的更大但异构的数据转化为对目标机构的可靠收益。
###### 关键词:
联邦学习;基础模型;生成事件模型;标记化电子健康记录
\\copyrightinfo
© 2026 作者。
## 1 引言
用于语言的Transformer模型受益于大规模公开可用的训练数据[1 (https://arxiv.org/html/2608.02939#bib.bib1),2 (https://arxiv.org/html/2608.02939#bib.bib2)]。相比之下,电子健康记录(EHRs)本质上是私密的、受机构治理约束的,并且使用各机构特有的约定进行记录。因此,临床生成事件模型(GEMs)在扩展规模时面临两个相关的障碍。首先,任何单一机构内的可用数据量在既定的扩展关系下限制了模型规模和性能[3 (https://arxiv.org/html/2608.02939#bib.bib3),4 (https://arxiv.org/html/2608.02939#bib.bib4)]。其次,在一个机构训练的模型在未进行额外训练的情况下迁移到另一个机构时,往往会损失性能[5 (https://arxiv.org/html/2608.02939#bib.bib5),6 (https://arxiv.org/html/2608.02939#bib.bib6),7 (https://arxiv.org/html/2608.02939#bib.bib7)]。因此,扩展临床GEMs不仅需要访问更多数据,还需要能够跨异构卫生系统学习的方法,而不能假设患者级别的记录可以自由汇集。
这两个障碍需要互补的解决方案。通用数据模型可以通过人工审校的映射[8 (https://arxiv.org/html/2608.02939#bib.bib8),9 (https://arxiv.org/html/2608.02939#bib.bib9)]或通过学习得到的跨机构对应关系[10 (https://arxiv.org/html/2608.02939#bib.bib10),11 (https://arxiv.org/html/2608.02939#bib.bib11)]来建立跨机构的共享临床语义。然而,自动对应方法仍然复杂,并且可能比领域专家审校的映射表现差得多。即使在语义统一之后,治理、隐私和安全方面的顾虑也可能阻止患者级别数据的集中化。考虑到涉及受保护健康信息的泄露事件在频率和规模上日益增加[12 (https://arxiv.org/html/2608.02939#bib.bib12),13 (https://arxiv.org/html/2608.02939#bib.bib13)],这些顾虑变得愈发突出。联邦学习(FL)提供了一个框架,可以在各参与机构保留对其底层记录控制权的同时,联合训练模型。
在本研究中,我们使用来自三个卫生系统的ICU数据来研究这两种方法的交汇点:芝加哥大学医学中心、西北医学中心和贝斯以色列女执事医学中心。这些数据集已由领域专家映射到通用纵向ICU数据格式(CLIF)[14 (https://arxiv.org/html/2608.02939#bib.bib14),15 (https://arxiv.org/html/2608.02939#bib.bib15)],从而在各机构之间提供了重症监护数据的共享表示。然后,我们评估联邦优化是否能在不需要将底层患者级别数据集存储在一起的情况下,恢复多机构GEM训练的收益。这种设计使我们能够区分由跨机构的语义和分布差异引入的限制与由联邦学习引入的限制。
在标准的GEM工作流程中[16 (https://arxiv.org/html/2608.02939#bib.bib16),17 (https://arxiv.org/html/2608.02939#bib.bib17)],每次住院被表示为一个按时间顺序排列的token序列,每个token对应患者记录中的一次事件。例如,`LAB-ORD//albumin`表示一次白蛋白实验室医嘱,而`XFR-OUT//ed`表示转出急诊科。GEM从随机初始化开始进行预训练,以根据前面的序列预测下一个事件token。训练完成后,该模型可以通过基于表征、生成式或监督微调的方法来支持下游预测[18 (https://arxiv.org/html/2608.02939#bib.bib18)]。
我们专注于基于表征的推断[19 (https://arxiv.org/html/2608.02939#bib.bib19),20 (https://arxiv.org/html/2608.02939#bib.bib20),21 (https://arxiv.org/html/2608.02939#bib.bib21),22 (https://arxiv.org/html/2608.02939#bib.bib22),23 (https://arxiv.org/html/2608.02939#bib.bib23)],而非生成式推断或监督微调[24 (https://arxiv.org/html/2608.02939#bib.bib24),25 (https://arxiv.org/html/2608.02939#bib.bib25),26 (https://arxiv.org/html/2608.02939#bib.bib26),27 (https://arxiv.org/html/2608.02939#bib.bib27),4 (https://arxiv.org/html/2608.02939#bib.bib4),28 (https://arxiv.org/html/2608.02939#bib.bib28),29 (https://arxiv.org/html/2608.02939#bib.bib29),30 (https://arxiv.org/html/2608.02939#bib.bib30),6 (https://arxiv.org/html/2608.02939#bib.bib6),17 (https://arxiv.org/html/2608.02939#bib.bib17)]。对于每次住院,预训练的GEM为观察到的事件序列生成一个固定长度的表征。然后,这些表征被用作轻量级、特定于结果的分类器的特征。这种方法直接检验了GEM预训练是否产生可复用的患者表征,并允许在相同的下游估计器下对本地训练、迁移、联邦和集中式模型进行受控比较。
我们在覆盖122,251次ICU住院和12项临床结局的三个独立卫生系统中评估GEMs。我们的主要贡献如下:
1. 1. GEM表征在跨卫生系统时比传统监督模型产生的表征具有显著更好的可迁移性。一个GEM在机构内和跨机构的平均ROC-AUC上均取得最高值,同时其跨机构惩罚为0.025 ROC-AUC和0.027 PR-AUC。相应的LightGBM惩罚为0.079和0.089。一个单epoch的GEM表现出相同的定性模式,表明改进的可迁移性并不局限于扩展训练配置。
2. 2. 联邦学习恢复了集中式多机构训练的大部分性能,但其实际价值集中在数据有限的机构。FedAvg和FedAvgM非常接近在中心化汇总数据上训练的模型,而FedAdam的表现明显较差。性能增益在5–10轮联邦通信后基本饱和,从而限制了所需的跨机构通信量。联邦模型对新参与或数据有限的医院具有最明显的优势;本地训练模型在大约3,000个训练样本后变得具有竞争力。
3. 3. 该场景中的主要限制似乎是跨机构迁移和适应,而非联邦优化。在我们的实证分析中,联邦模型紧密跟踪集中式多机构模型,表明使用联邦而非集中式优化仅解释了剩余性能差距的一小部分。与此同时,集中式多机构训练相对于拥有大型训练数据集的机构中的强本地模型仅提供了有限的改进。总之,这些发现表明,主要挑战不仅仅是模型更新如何聚合,而是额外的异构数据如何有效地改善特定目标机构的性能。
我们还发布了`coreopsis` (https://github.com/bbj-lab/coreopsis),这是一个用于联邦GEM训练的开源框架,集成了CLIF兼容的tokenization、本地模型训练和联邦聚合。总的来说,我们的结果刻画了联邦GEM训练在何时可能有用,并支持一种实际部署策略:数据有限的医院从多机构联邦模型开始,并随着机构数据的积累越来越依赖本地训练或适应。
## 2 相关工作
大多数已发表的医疗保健FL研究是单一机构模拟[31 (https://arxiv.org/html/2608.02939#bib.bib31),32 (https://arxiv.org/html/2608.02939#bib.bib32)]。许多FL方法操作于先前已统一的数据集上,例如MIMIC[33 (https://arxiv.org/html/2608.02939#bib.bib33)]或eICU[34 (https://arxiv.org/html/2608.02939#bib.bib34)]。Dang等人[35 (https://arxiv.org/html/2608.02939#bib.bib35)]在eICU上对ICU相关结局的FL进行了基准测试,发现FedAvg[36 (https://arxiv.org/html/2608.02939#bib.bib36)]和FedAvgM[37 (https://arxiv.org/html/2608.02939#bib.bib37)]表现强劲。在MIMIC中,Shoham等人[38 (https://arxiv.org/html/2608.02939#bib.bib38)]对诊断代码预测进行了FL实验,Renc等人[39 (https://arxiv.org/html/2608.02939#bib.bib39)]提出了用于合成数据生成的GEM联邦学习。
一般来说,跨机构学习依赖于通用数据模型,例如OMOP[40 (https://arxiv.org/html/2608.02939#bib.bib40)]或i2b2[8 (https://arxiv.org/html/2608.02939#bib.bib8)]。Guo等人[5 (https://arxiv.org/html/2608.02939#bib.bib5)]将在斯坦福医学中心训练的模型迁移到贝斯以色列女执事医学中心和多伦多病童医院,并表明在本地数据上继续进行预训练可以迅速达到最优本地性能。
已有工作尝试自动统一数据集。Hong等人[10 (https://arxiv.org/html/2608.02939#bib.bib10)]使用嵌入来建立跨机构的临床对应关系。Zhou等人[11 (https://arxiv.org/html/2608.02939#bib.bib11)]使用图神经网络学习对应关系。近期的工作还尝试利用基于语言的事件表征来克服数据统一这一挑战[41 (https://arxiv.org/html/2608.02939#bib.bib41),42 (https://arxiv.org/html/2608.02939#bib.bib42)]。
## 3 方法
### 3.1 数据
我们考虑了2018–2024年间入住芝加哥大学医学中心(UCMC)的成年患者(年龄18岁或以上)、2018–2024年间入住西北医学卫生系统(NU)的成年患者,以及2008–2022年间入住贝斯以色列女执事医学中心(MIMIC-IV-3.1)[33 (https://arxiv.org/html/2608.02939#bib.bib33)]的成年患者。该研究已获得相关机构审查委员会(IRBs)的批准:芝加哥大学(IRB20-1823)、西北大学(STU00202840)。MIMIC数据通过数据使用协议下的凭证访问获得。对于每位患者,我们考虑了其首次住院,并筛选出持续时间超过24小时且在入院24小时内转入重症监护病房(ICU)的住院记录。这产生了UCMC的22,000次住院、NU的65,758次住院和MIMIC的34,495次住院,每次住院对应唯一患者(表3.1 (https://arxiv.org/html/2608.02939#S3.SS1))。每个数据集按70%-10%-20%的比例划分为训练集、调优集和留出集。对于UCMC和NU,住院记录按入院时间划分,较早期入院的记录被放入训练集,然后是调优集,最后是留出集。对于MIMIC,患者隐私通过患者级别的随机时间偏移得到保护,因此训练、调优和留出集的划分是均匀随机的。
\\tbl
各数据集中患者的汇总统计:数量和入院年龄(均值,标准差),随后是按性别、族裔和种族的百分比分布。
参见说明
图1:实验设计:EHR数据在三个机构分别并行转换为CLIF-2.1标准。在MIMIC训练数据上学习一个`acocoa-tokenizer`实例,然后应用于其他数据集,将患者记录转换为token序列。每个机构使用各自训练和调优序列,通过`cotorra`实例从头开始训练GEM。本文介绍的`coreopsis`软件与每个`cotorra`模型交互以构建联邦GEM。为了进行预测,使用给定模型提取的表征,在每个机构的训练集上学习特定于结局的分类器。然后将这些模型应用于留出集的表征以进行推断。
### 3.2 Tokenization
Tokenization过程如下:UCMC、NU和MIMIC数据被转换为通用纵向ICU格式(CLIF)[14 (https://arxiv.org/html/2608.02939#bib.bib14)]2.1版标准,该标准通过将各机构特有的实验室和生命体征代码映射到最小通用ICU数据元素集来统一跨机构的重症监护数据。每次住院被分配一个token序列,以`BOS`开始序列token开头。年龄、性别、种族、族裔和入院类型的token按此顺序在入院时插入。医院内部的科室间转科在各自时间各接收一个进入和离开token。带剂量的药物、带定量结果的实验室检查以及带测量值的生命体征均采用类别-值tokenization。对于每个类别(标准化药物种类、实验室类型、生命体征类型),训练集中报告的所有数值用于确定十分位数截断点。该类别(在训练、调优和留出数据中)的所有值随后根据这些十分位数分入Q0、Q1、...、Q9[6 (https://arxiv.org/html/2608.02939#bib.bib6)]。对于每个类别-值对,创建一个新的“融合”token[21 (https://arxiv.org/html/2608.02939#bib.bib21),22 (https://arxiv.org/html/2608.02939#bib.bib22),43 (https://arxiv.org/html/2608.02939#bib.bib43)](例如,`LAB-RES//so2_arterial_Q0`对应动脉SO2在最低十分位数的实验室结果)。药物token...相似文章
加速合成电子健康记录生成中的可重复研究
本文介绍了一个轻量级、端到端的基准测试框架,用于可重复的合成电子健康记录(EHR)生成,将多个基线模型(MedGAN、CorGAN、PromptEHR、HALO)和一个GPT-2基线统一到单个流水线中,并配备严格的隐私-效用评估套件。
超越原始上下文传输:基于表示的联邦检索增强生成
本文提出了FedRepRAG,一种去中心化的检索增强生成框架,它通过交换潜在表示而非原始内容来减少计算开销,并提高医疗保健等敏感领域的隐私性。
CT-HEG:一种用于ICU院内死亡预测的双向、时间戳属性事件图——一项架构消融研究
介绍了CT-HEG,一种用于ICU死亡预测的连续时间异质EHR图模式,通过消融研究表明双向连接和时间注意力边特征很重要;令人惊讶的是,在MIMIC-IV队列上,简化的同质图优于完整的异质模型。
医疗中的联邦生存分析:跨机构异质性乳腺癌数据的多模型评估
本文系统评估了联邦学习下三种生存模型(Cox、DeepSurv、RSF)在异质性乳腺癌数据上的表现,发现联邦学习优于本地训练,且RSF在各客户端间提供了最佳性能平衡。
MiGHT-EHR:面向异质时序电子健康记录的多任务图变换器
本文介绍了MiGHT-EHR,一种针对异质时序EHR数据的多任务图变换器,联合建模临床实体、时间轨迹和任务依赖。在MIMIC-III和MIMIC-IV上,它在药物推荐、住院时长、死亡率和再入院预测方面均优于现有最先进方法。