LLM4EHR:通过大型语言模型对齐临床时间序列与医疗事件序列
摘要
LLM4EHR 提出了一种临床基础模型,该模型通过领域自适应的大语言模型和正则化对比目标,在时间上对齐电子健康记录(EHR)时间序列与医疗事件序列,从而提升下游预测任务的性能。
arXiv:2607.15447v1 公告类型:新
摘要:近期在临床机器学习领域的研究,重点关注重症监护病房(ICU)中的结果预测,已从定制化的监督模型转向基础模型,利用现代表示学习方法。在此,基础模型通过混合复杂的临床数据模态进行预训练,适用于各种下游任务。现有工作常利用电子健康记录(EHR)提供丰富多样的患者观察数据来训练临床基础模型。然而,现有方法未能充分探索临床事件与EHR中记录的时间序列(TS)观测之间的共享时间结构。这一局限可能导致临床基础模型的鲁棒性和适应性不足,从而在下游任务上表现下降。为了充分利用这种时间结构,我们提出了LLM4EHR,一种在ICU EHR数据上训练的新的临床基础模型。通过结合领域自适应的大语言模型与Transformer时间序列编码器,我们通过时间对齐EHR事件与TS来预训练LLM4EHR。为此,我们提出了一种正则化对比目标,以基于领域自适应LLM产生的EHR事件嵌入来学习鲁棒的EHR TS表示。通过消融研究的支持,我们发现LLM4EHR学习到的EHR TS嵌入在多个下游临床任务上提升了性能,并取得了有竞争力的结果。此外,我们通过实验证明,LLM4EHR学习了可迁移的临床TS嵌入,可通过k-shot适应部署到新队列。这些发现为构建更具泛化性和高性能的临床基础模型迈出了一步。
查看缓存全文
缓存时间: 2026/07/20 09:27
# LLM4EHR:通过大型语言模型将临床时间序列与医疗事件序列对齐
来源:https://arxiv.org/html/2607.15447
\[type=editor, orcid=0009\-0003\-0011\-5828\] \\credit 写作 - 初稿, 写作 - 审阅与编辑, 数据整理, 可视化, 资源, 调查, 形式分析, 验证, 软件, 方法论, 概念化
\[type=editor, orcid=0000\-0002\-3884\-8045,\] \\credit 写作 - 审阅与编辑, 方法论
\[type=editor, orcid=0009\-0008\-7252\-6622,\] \\credit 写作 - 审阅与编辑
\[type=editor, orcid=0009\-0006\-5785\-4295,\] \\credit 写作 - 审阅与编辑, 方法论
\[type=editor, orcid=0000\-0001\-5348\-9063,\] \\credit 写作 - 审阅与编辑, 监督, 项目管理, 资金获取
\[type=editor, orcid=0000\-0001\-8591\-9638,\] \\credit 写作 - 审阅与编辑, 方法论, 资源, 项目管理, 监督, 资金获取, 概念化
1\]organization=伦敦大学学院 GOS 儿童健康研究所, addressline=University College London, city=伦敦, country=英国
2\]organization=伦敦帝国理工学院脑科学系, addressline=Imperial College London, city=伦敦, country=英国
3\]organization=英国痴呆症研究所, addressline=护理研究与技术中心, city=伦敦, country=英国
4\]organization=NIHR 大奥蒙德街医院生物医学研究中心, addressline=中心与 GOSH 数据研究、创新与虚拟环境部门, city=伦敦, country=英国
\\cortext \[cor1\]通讯作者
\\cortext\[cor2\]通讯作者
Alexander Capstick, Louise Rigny, Iona Biggart, Neil J Sebire, Payam Barnaghi
p\.barnaghi@imperial\.ac\.uk
\\[\[\[
###### 摘要
近期临床机器学习研究中,针对重症监护室(ICU)结局预测的研究,已从定制的监督模型转向基础模型,并采用现代表示学习方法。在此框架下,基础模型通过混合复杂临床数据模态进行预训练,适用于多种下游任务。现有工作常利用电子健康记录(EHR)提供丰富多样的患者观测数据来训练临床基础模型。然而,现有方法未能充分探索临床事件与EHR中记录的时间序列(TS)观测数据之间的共享时间结构。这一局限可能导致临床基础模型鲁棒性和适应性不足,从而降低下游任务性能。为充分利用这种时间结构,我们提出了LLM4EHR,一种在ICU EHR数据上训练的新型临床基础模型。通过结合领域自适应的大型语言模型(LLM)与Transformer时间序列编码器,我们采用时间对齐EHR事件与TS的方式预训练LLM4EHR。为此,我们提出一种正则化对比目标,以学习基于领域自适应LLM生成的EHR事件嵌入为条件的鲁棒EHR时间序列表示。消融研究结果表明,LLM4EHR学习到的EHR时间序列嵌入在多个下游临床任务上性能具有竞争力且有所提升。此外,我们通过实验证明LLM4EHR能够学习可迁移的临床时间序列嵌入,并可通过小样本适应部署到新队列。这些发现为构建更通用且性能更优的临床基础模型迈出了重要一步。
###### 关键词:电子健康记录\sep
临床预测建模\sep
对比学习\sep
表示学习\sep
大型语言模型
\{highlights\}
- **LLM4EHR**:提出一种多模态融合框架,通过语义正则化对比目标,将LLM编码的电子健康记录(EHR)事件序列与专用的EHR时间序列(TS)编码器进行时间对齐。
- **改进的预测结果**:与监督式和自监督基线相比,LLM4EHR在临床相关的下游任务(包括死亡率预测、表型分类、病情恶化和剩余住院时间预测)中均实现了一致的性能提升。
- **改进的可迁移性**:我们通过实验证明,LLM4EHR能够学习可迁移的临床TS嵌入,并可通过小样本适应部署到新队列。
- **消融与敏感性分析**:针对不同预训练目标的消融研究表明,我们的语义正则化对齐目标使LLM4EHR在下游任务中取得了更优的预测结果。
## 1 引言
电子健康记录(EHR)数据本质上是多模态的。患者的临时观测、交互和测量被记录为EHR事件和EHR时间序列(TS),如图1a和图1b所示。具体而言,EHR事件包括条目化的、非规则采样的临床交互,并带有具体时间戳;而EHR时间序列则包括常规收集的患者监测测量值。在EHR数据建模中,药物处方等条目通常被视为事件,因为其缺乏细粒度的时间动态性。相反,患者生命体征等监测信号最适合建模为时间序列,因为这些信号的时间变化具有临床意义。这两种数据模态在表征患者健康状况方面相互补充。然而,这些模态之间的结构差异为构建通用临床基础模型带来了重大挑战。为克服这一挑战,我们发布了一种新的临床基础模型结构——LLM4EHR,该模型通过时间与语义感知的对比预训练目标联合建模EHR事件和EHR时间序列。我们发现,由此学到的表示能够适应死亡率预测、表型分类和剩余住院时间预测等下游临床任务,并通过消融研究加以支持。此外,我们展示了LLM4EHR能够使用常规收集的EHR时间序列变量适应新数据集,且性能一致。
传统上,定制化的监督方法分别针对临床任务开发,包括生存分析[Ghassemi2014, Barajas2015]、风险预测[Alvarez2013, Cheng2016]和表型分类[Albers2014, Liu2015]。然而,在大型多任务临床基准(MIMIC-Benchmark, eICU-Benchmark)上的实验表明,从一个任务中学到的信息往往对其他任务也有用。此外,临床场景中的患者观测形成时间序列,使其非常适合语言建模技术。这些观察结果,加上最近发现大型语言模型(LLM)可作为无监督多任务学习器[GPT-2],推动了多任务临床基础模型的开发[Wornow2023]。近期工作因此探索了使用预训练LLM建模EHR事件轨迹[BEHRT, MedBERT, ETHOS, Foresight]或EHR时间序列[LLM4TS, AutoTimes]。Wornow2023的综述发现,在大规模无标注EHR数据集上预训练的临床基础模型,可以使用有限标注数据适应下游任务。然而,许多现有方法在预训练时未能纳入多种时间EHR数据模态,尽管有证据表明结合临床笔记和TS等模态能提升下游性能[king2023, MedsTsLLM, MAIN]。考虑到EHR事件与EHR时间序列观测之间的相互依赖性,我们假设通过自监督预训练联合建模这两种时间模态也能实现类似的改进。
先前对齐这些不同临床数据模态的工作集中于样本对之间的对比表示学习[Kline2022]。在这些情况下,对齐通常以模态之间的共享身份为中心,例如对齐描述同一护理周期的临床时间序列和笔记嵌入[king2023, MAIN]。然而,这种跨临床数据模态的静态实例级对齐并未考虑EHR事件与EHR时间序列观测之间的共享时间结构,而我们认为这种结构能提供更有效的学习表示。
请参见图标题
图1:a)EHR时间序列示例,b)EHR事件示例,c)LLM4EHR预训练期间我们的正则化对比目标与InfoNCE[InfoNCE, he2020momentum]目标的区别。领域自适应LLM产生的EHR事件嵌入通过我们提出的目标引导EHR时间序列嵌入。
与先前工作不同,LLM4EHR学习与EHR事件嵌入纠缠的EHR时间序列表示,其中可训练的EHR时间序列编码器通过对比预训练由预训练且领域自适应的大型语言模型(LLM)指导。我们重新设计了常用的InfoNCE[InfoNCE, he2020momentum]目标,以时间上对齐LLM产生的EHR事件嵌入与EHR时间序列嵌入,使EHR时间序列嵌入在每个时间步靠近EHR事件嵌入。这导致了在下游任务中性能的提升,并可泛化到新数据集。此外,我们提出将预训练LLM中学到的语义相似性纳入对比目标,以减轻对比学习中类别碰撞[SimCLR, Zheng2021, Wu2024]的影响。当相似实例因严格的一对一正采样而在嵌入空间中被推离时,便会出现类别碰撞。如果时间t和t'的EHR时间序列观测对应相似的EHR事件,则不应按InfoNCE损失将其视为负样本。我们提出了一种语义正则化的InfoNCE目标[InfoNCE, he2020momentum],其中LLM嵌入的EHR事件之间的语义相似性用于加权学习到的EHR时间序列嵌入(图1c),从而提供改进的EHR时间序列嵌入。我们的贡献如下:
- • 我们提出了LLM4EHR,一个基于LLM的EHR时间序列表示学习框架,使用重症监护室数据进行训练。
- • 为训练LLM4EHR,我们提出了一种对比学习目标,用于时间对齐EHR事件和EHR时间序列嵌入。通过消融研究,我们发现这改善了学习到的表示。
- • 我们展示了我们的方法在少样本和跨数据集设置下的临床分类任务中取得了优越性能。
请参见图标题
图2:LLM4EHR概览。EHR条目和临床时间序列以ICU入院为中心,EHR操作用米色表示,时间序列操作用红色表示。预训练LLM层(新词元的嵌入权重除外)在预训练期间保持冻结。
## 2 相关工作
EHR基础模型是在大规模EHR数据上训练的临床基础模型[Wornow2023]。近期方法在训练方式上与LLM有显著相似之处,它们通过自回归[ETHOS, Foresight, MedGPT, Cascella2023]或掩码序列建模[MedBERT, BEHRT, BioClinicalBERT, CEHR-BERT]在标记化的事件序列上进行训练。值得注意的例子包括Foresight[Foresight]和ETHOS[ETHOS],它们重新利用了GPT-2[GPT-2]的自回归注意力层来模拟患者时间线中的事件转换。然而,这些工作主要将患者轨迹视为事件序列,这可能导致细粒度的时间动态在建模过程中丢失或被掩盖。
时间序列的自监督表示学习从无标签数据中学习可迁移的时间序列特征表示,用于下游任务[SimMTM, PatchTST, PatchTSMixer]。近期工作表明,通过Transformer架构建模时间序列可在时间序列预测中取得改进性能[Transformer]。在此方法中,时间序列片段被标记化以形成时间序列,注意力层通过自监督预训练任务处理时间序列词元。LLM4TS[LLM4TS]使用自监督重建来重新利用预训练LLM进行时间序列预测。类似地,AutoTimes[AutoTimes]在自监督预训练期间使用语言提示,允许通过冻结的LLM进行上下文时间序列预测。与先前工作不同,LLM4EHR为EHR时间序列维护了一个专用的Transformer编码器,其中EHR时间序列嵌入在预训练期间由预训练LLM产生的EHR事件嵌入指导。
对比学习可以在样本对之间创建纠缠表示。临床机器学习领域的先前工作探索了通过对比学习对齐相似的EHR时间序列样本。EBCL[EBCL]使用对比预训练对齐关键索引事件前后的时间序列观测,并在下游分类任务中显示了改进性能。CROCS[Kiyasseh2021]使用对比学习对齐心电图测量嵌入与患者原型嵌入,其中患者原型作为查询来检索相似的心电图样本。[king2023]探索了通过共享LLM对齐临床时间序列(TS)与ICU笔记。然而,他们的工作维持了EHR时间序列与临床笔记之间的静态对齐,并未考虑重要的时间关系。
## 3 背景
### 3.1 EHR数据表示
当患者与护理服务交互时,每次测量、观察和护理人员操作都被记录在电子健康记录(EHR)中。虽然不同类型的EHR数据共享相同的结构化格式,但它们通过不同的过程生成,并且通常使用不同的数据模态。常规收集的生理观察因其动态特性通常被建模为临床时间序列(TS)。这些变量随时间追踪以监测患者的健康状况,其突变对标准化风险分析(如SAPS[SAPS]或SOFA[SOFA])有重要贡献。临床机器学习中的监督方法通常依赖于时间序列特征作为下游任务的输入,特别是对于时间敏感型预测,如生存[Ghassemi2014, Barajas2015]或风险[Albers2014, Liu2015]预测。
相比之下,EHR系统中的某些事件或发生情况并不方便或逻辑上不适合建模为时间序列变量。例如,虽然在某个时间点存在长期药物处方具有临床意义,但由于缺乏时间变化,将其建模为时间序列变量并无信息价值。此外,每个独特事件都需要表示为单独的二进制变量,考虑到EHR系统中自然存在的独特交互多样性,这会导致扩展性差。EHR事件通常被标记化以形成时间序列,用于序列建模[Meds_reader, ETHOS, Foresight],这简化了时间维度为词元的纵向排序。
与先前关于EHR时间序列与临床笔记之间跨模态对齐的工作类似,我们将多模态EHR数据建模问题定义为EHR时间序列与事件之间的跨模态对齐,其中时间序列变量和EHR事件是分开生成但在时间上对齐的。我们的框架没有使用临床笔记,因为虽然临床笔记提供了ICU患者观察和治疗的高层摘要,但它们的记录通常存在显著延迟,因此不能假设与细粒度的时间序列观测在时间上对齐。
我们将临床时间序列定义为由随时间变化的患者观测(主要是实验室检测和护士图表记录)组成的多变量时间序列。虽然有些工作不将非规则采样的实验室值视为时间序列变量[stein2025prediction],但我们将其包括在内,因为实验室观测值随时间的变化具有临床意义。形式上,我们定义一组具有L个变量、T个时间步的临床时间序列实例为x^{1:T} = {x^1, x^2, ..., x^T}, x^t ∈ R^L。而EHR事件则表示为时间索引序列。我们定义一个在T个时间步上具有N个事件的EHR事件序列。相似文章
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
训练大型语言模型预测临床事件
本文通过将按时间排序的临床笔记转换为预测示例,将前瞻性学习扩展到临床事件预测。在120B模型上使用LoRA适配器改善了校准性能,并在留出问题上优于GPT-5。
AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估
介绍了AIPatient Arena,一个基于电子健康记录的评估框架,用于评估大语言模型在临床能力的多个维度。研究揭示了在问诊和伦理方面的优势,但在处理模糊性和诊断准确性方面的弱点。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。