大型语言模型作为统一多模态学习器用于临床预测
摘要
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
arXiv:2607.15380v1 Announce Type: cross
摘要:电子健康记录结合了自由文本临床叙述与结构化测量数据,如生命体征、实验室检查值和合并症。然而,大多数临床预测系统仍然依赖于特定任务的融合架构,为每种模态配备专用编码器,并配以需要通过学习和组合机制,且必须针对每个新任务和临床环境重新设计。我们提出了一种更简单的替代方案:将所有患者数据(无论模态如何)转换为单一自然语言序列,并对预训练语言模型进行端到端微调,无需对融合进行架构修改。我们在三个临床不同的预测任务上评估了这一方法:MIMIC-III 上的住院死亡率、使用德国移植中心纵向数据的移植物衰竭预测,以及基于救护车记录的急诊分诊分类——将基于编码器(ModernBERT)和基于解码器(Llama 3.1、Gemma、DeepSeek-R1-Qwen、Qwen3)的微调与已建立的多模态基线进行比较,并在移植物衰竭预测中与当前临床上用于移植后患者管理的梯度提升模型进行比较。在所有三个任务中,统一的文本序列化方法达到或超过了特定任务的多模态基线,并在移植物衰竭预测上优于临床部署的梯度提升系统。这些结果表明,单一基于序列化的范式(无需定制融合架构)足以应对多模态临床预测,在显著降低系统复杂性的同时,达到或超过专用设计的性能。
查看缓存全文
缓存时间: 2026/07/20 09:24
# 大语言模型作为临床预测的统一多模态学习器 来源:https://arxiv.org/html/2607.15380 Ajay Madhavan Ravichandran¹ Bilgin Osmandoglu² Klemens Budde² Klaus Netter³ Tobias Strapatsas⁴ Aljoscha Burchardt¹ Sebastian Möller¹,⁵ Roland Roller¹,²,⁵ ¹德国人工智能研究中心(DFKI),德国 ²柏林夏里特大学医学院,德国 ³DNC Information Management GmbH,德国 ⁴Asklepios Klinikum Harburg 急救与急诊医学科,德国 ⁵柏林工业大学,德国 ###### 摘要 电子健康记录将自由文本的临床叙述与结构化测量(如生命体征、实验室值和合并症)结合在一起。然而,大多数临床预测系统仍然依赖于特定任务的融合架构,为每种模态配备专用编码器,并结合学习到的组合机制,这些机制必须为每个新任务和临床环境重新设计。我们提出了一种更简单的替代方案:将所有患者数据(无论模态如何)转换为单一的自然语言序列,并对预训练的语言模型进行端到端微调,无需为融合进行架构修改。我们在三个临床不同的预测任务上评估了这种方法——MIMIC-III 上的住院死亡率预测、使用德国移植中心纵向数据的移植物衰竭预测,以及基于救护车记录的急诊分诊分类——将基于编码器(ModernBERT)和基于解码器(Llama 3.1、Gemma、DeepSeek-R1-Qwen、Qwen3)的微调与已建立的多模态基线进行比较,对于移植物衰竭,还与当前临床实践中用于移植后患者管理的梯度提升模型进行比较。在所有三个任务中,统一的文本序列化方法达到或超过了特定任务的多模态基线,并在移植物衰竭预测上优于临床部署的梯度提升系统。这些结果表明,一个基于序列化的单一范式,无需定制融合架构,就足以应对多模态临床预测——在达到或超越专门设计的同时,大幅降低了系统复杂性。 大语言模型作为临床预测的统一多模态学习器 ## 1 引言 电子健康记录(EHR)本质上是多模态的:它们在不同表示空间中捕获患者信息,结合了医生撰写的自由文本临床叙述与实验室值、生命体征、人口统计信息和编码诊断等结构化测量(Johnson 等人,2016 (https://arxiv.org/html/2607.15380#bib.bib9))。有效的临床预测需要整合这些模态;然而,它们不容易组合。主流方法是设计特定任务的融合架构,由每种模态的专用编码器组成,随后是学习到的组合机制,例如门控注意力或跨模态变换器(Khadanga 等人,2019 (https://arxiv.org/html/2607.15380#bib.bib12);Soenksen 等人,2022 (https://arxiv.org/html/2607.15380#bib.bib11);Cui 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib29);Kim 等人,2026 (https://arxiv.org/html/2607.15380#bib.bib32))。虽然有效,但这种范式具有显著的实际局限性:每个新的临床任务都需要定制架构、特定模态的预处理管道和广泛的调优。因此,现有系统常常是碎片化的,难以重用,且在不同临床环境中部署成本高昂(Ben-Miled 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib34))。 大语言模型(LLM)最近作为一种潜在替代方案出现。越来越多的工作表明,结构化数据可以序列化为自然语言并由预训练的 LLM 处理,从而消除了对特定模态编码器的需求。CPLLM(Ben Shoham 和 Rappoport,2024 (https://arxiv.org/html/2607.15380#bib.bib36))证明,在文本序列化的 EHR 记录上微调 Llama2 在疾病预测和再入院任务上优于 Med-BERT,而无需领域特定的预训练。Hegselmann 等人(Hegselmann 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib38))进一步表明,序列化结构化患者记录的 LLM 嵌入在多个临床任务上达到或超过了专门的 EHR 基础模型。这些研究确立了序列化对于单独的结构化数据是有效的。然而,一个重要的局限性仍然存在:现实世界的 EHR 预测任务本质上是多模态的。临床决策依赖于医生撰写的叙述和结构化测量,它们提供互补信息(Ruan 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib30))。现有的基于序列化的方法尚未系统地解决这种需要将两种模态整合在统一框架中的情况。 在这项工作中,我们通过提出一个统一框架来弥补这一差距,在该框架中,*所有*患者数据(无论模态如何)都被转换为单一的自然语言序列,并用于对预训练语言模型进行端到端微调。结构化 EHR 变量——包括人口统计信息、合并症、实验室结果和生命体征——被序列化为键值文本表示,并与临床叙述连接起来。这种统一的表示使模型能够通过其注意力机制学习跨模态关系,而无需架构修改。重要的是,相同的模型架构和微调程序可以应用于不同的模态组合和预测任务,避免了特定任务融合设计的需要。 我们在三个具有不同数据源和目标的临床预测任务上评估了这种方法:MIMIC-III(Johnson 等人,2016 (https://arxiv.org/html/2607.15380#bib.bib9))上的住院死亡率预测,结合临床笔记与时序生理特征;使用德国移植中心数据的移植物衰竭预测,结合临床叙述与纵向实验室和合并症数据(Roller 等人,2022 (https://arxiv.org/html/2607.15380#bib.bib1));以及急诊分诊分类,结合简短的救护车笔记与结构化生命体征测量和神经系统评分(Maschhur 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib2))。对于每个任务,我们将基于编码器的微调(ModernBERT(Warner 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib4)))和基于解码器的监督微调(Llama 3.1(Grattafiori 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib5))、Gemma(Team 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib6))、DeepSeek-R1-Qwen(DeepSeek-AI,2025 (https://arxiv.org/html/2607.15380#bib.bib7))和 Qwen3(Team,2025 (https://arxiv.org/html/2607.15380#bib.bib8)))与已建立的单模态和多模态基线进行比较,以及当前临床实践中用于移植物衰竭预测的梯度提升系统。 我们的结果表明,所提出的序列化方法在所有任务上实现了与特定任务多模态基线相当或更优的性能。这些发现表明,统一的基于文本的表示可以作为专用多模态架构的有效替代方案,同时大幅降低系统复杂性。 这项工作的贡献如下: - • 用于 EHR 预测的统一多模态序列化。我们提出了一个通用框架,将异质的 EHR 数据(包括临床叙述和结构化变量)转换为与预训练语言模型兼容的单一文本表示,消除了对特定任务架构的需求。 - • 跨模型和领域的系统评估。我们比较了基于编码器和基于解码器的 LLM 微调在跨越重症监护、移植医学和急诊分诊的三个临床预测任务上的表现,证明了所提出方法的通用性。 - • 与临床基线的比较。我们表明,所提出的方法达到或超过了已建立的研究基线,并且优于当前临床实践中用于移植物衰竭预测的梯度提升系统,突显了其在现实世界临床应用中潜力。 ## 2 相关工作 ### 2.1 用于 EHR 预测的多模态融合架构 从异质 EHR 数据进行临床预测的主流范式是使用专用编码器处理每种模态,并通过显式融合机制组合表示。Rajkomar 等人(Rajkomar 等人,2018 (https://arxiv.org/html/2607.15380#bib.bib10))表明,对异质 EHR 数据进行深度学习可以优于传统的统计模型,Khadanga 等人(Khadanga 等人,2019 (https://arxiv.org/html/2607.15380#bib.bib12))建立了一个广泛使用的基线,通过单独的编码器将临床笔记与 ICU 时间序列结合用于 MIMIC-III 上的死亡率预测。Soenksen 等人(Soenksen 等人,2022 (https://arxiv.org/html/2607.15380#bib.bib11))通过 HAIM 对此进行了推广,通过后期融合整合了影像、表格、时间序列和文本模态。更近的工作追求了日益复杂的融合策略:基于超图的结构化数据与 LLM 导出的文本嵌入融合(Cui 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib29));基于证据理论的证据驱动融合(Ruan 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib30));多智能体架构,其中特定模态的 LLM 代理在预测前总结输入(Gao 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib31));以及跨特定模态编码器的层级融合(Kim 等人,2026 (https://arxiv.org/html/2607.15380#bib.bib32))。与我们的方法更接近的是 EHR2Path(Pellegrini 等人,2026 (https://arxiv.org/html/2607.15380#bib.bib43)),它将纵向记录转换为统一的文本表示,但仍然依赖一个专门构建的总结模块来压缩长患者历史,并且目标是轨迹模拟而非直接结果预测。尽管性能强劲,但这些方法有一个共同的局限性:即使是其中最具泛化性的,如 HAIM 和 MoMA,仍然需要为每种新数据类型设计一个特定模态的编码器、代理或压缩机制,这需要大量的工程努力,且不容易跨任务泛化。最近的一篇范围综述(Ben-Miled 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib34))强调了大多数融合架构的手工定制性质是可扩展临床部署的主要障碍。 ### 2.2 基于 LLM 的结构化与临床数据序列化 预训练语言模型通过领域适配的编码器(如 BioClinicalBERT(Alsentzer 等人,2019 (https://arxiv.org/html/2607.15380#bib.bib19))、BioBERT(Lee 等人,2020 (https://arxiv.org/html/2607.15380#bib.bib20))和 GatorTron(Yang 等人,2022 (https://arxiv.org/html/2607.15380#bib.bib35)))以及最近的大规模生成模型(Med-PaLM(Singhal 等人,2023 (https://arxiv.org/html/2607.15380#bib.bib22))在医学考试上达到了接近临床医生的性能,GPT-4 在医学挑战问题上显示了强劲结果(Nori 等人,2023 (https://arxiv.org/html/2607.15380#bib.bib23)))推动了临床 NLP 的进展。在这些进展基础上,越来越多的工作直接在序列化的结构化数据上微调 LLM。CPLLM(Ben Shoham 和 Rappoport,2024 (https://arxiv.org/html/2607.15380#bib.bib36))在文本序列化的 EHR 代码上微调 Llama2,并在疾病和再入院预测上优于 Med-BERT,而无需领域特定的预训练;Hegselmann 等人(Hegselmann 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib38))表明,序列化结构化记录的 LLM 嵌入在多个任务上达到或超过了专门的 EHR 基础模型。在临床领域之外,LIFT(Dinh 等人,2022 (https://arxiv.org/html/2607.15380#bib.bib25))和 TabLLM(Hegselmann 等人,2023 (https://arxiv.org/html/2607.15380#bib.bib24))表明,在序列化的表格行上微调 LLM 可以匹配通用表格分类和回归的梯度提升模型;Fang 等人(Fang 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib42))的近期调查综合了基于序列化的方法在表格数据预测、生成和理解任务中的有效性。在急诊护理环境中,Lee 等人(Lee 和合作者,2024 (https://arxiv.org/html/2607.15380#bib.bib45))引入了 MEME,它将多模态表格 EHR 数据转换为合成的临床伪笔记,并在急诊科决策支持任务上优于传统机器学习、EHR 基础模型和 GPT-4 提示。相关工作进一步将 LLM 微调扩展到纵向和时间临床推理:DT-GPT(Makarov 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib39))微调 LLM 以预测临床变量轨迹,无需架构修改;TIMER(Cui 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib40))对 LLM 进行指令调优以进行跨多次就诊记录的时间推理;Wu 等人(Wu 等人,2024 (https://arxiv.org/html/2607.15380#bib.bib37))使用 MIMIC-Instr 数据集引入了开放式 EHR 问答的指令调优。 这些研究共同确立了序列化是结构化或基于代码的 EHR 数据与预训练语言模型之间的有效接口,并且对序列化输入进行微调可以在没有领域特定预训练或架构更改的情况下达到或超过专门的基线。然而,在每种情况下,模型都只在单一信息源上训练——结构化代码、表格特征或生成的指令-响应对——而不是表征真实世界 EHR 预测任务的自由文本临床叙述与结构化测量的组合。与此同时,最近的证据表明,这个差距不能简单地通过提示通用 LLM 来弥合。El Khettari 等人(El Khettari 和合作者,2026 (https://arxiv.org/html/2607.15380#bib.bib51))发现,临床文本和结构化变量的监督多模态融合优于基于 LLM 的方法,后者在跨模态和解码策略上表现不一致。Yildiz 等人(Yildiz 等人,2025 (https://arxiv.org/html/2607.15380#bib.bib41))进一步强调了 LLM 在临床预测中的开放性方法论挑战,包括时间-事件建模、校准和外部验证。这些发现共同促使我们专注于对统一文本序列化进行 LLM 的监督微调,而非零样本或少样本提示,作为弥合多模态差距的更有前景的路径。与上述所有工作相比,我们的工作是在一个单一的序列化序列上微调预训练 LLM,该序列联合编码了结构化和非结构化的患者信息,并直接在三个不同的预测任务上针对特定任务的多模态融合基线和临床梯度提升系统评估这种方法。 表 1:评估中使用的数据集、输入模态和预测任务概览。 ## 3 数据集和任务 在本研究中,我们在三个不同的临床预测任务上评估我们提出的方法。每个数据集在多模态学习中提出了独特的挑战,需要综合非结构化的临床叙述与结构化的电子健康记录(EHR)数据。所选择的任务涵盖了各种临床环境,包括重症监护、长期门诊监测和应急响应。
相似文章
语言模型作为接口,而非预言机:用于儿童阑尾炎的混合LLM-ML系统
本文介绍了ClaMPAPP,一种混合架构,使用LLM作为接口从临床叙述中提取特征,然后将这些特征传递给XGBoost分类器进行儿童阑尾炎诊断,展示了相比端到端LLM基线更高的鲁棒性和安全性。
LLM4EHR:通过大型语言模型对齐临床时间序列与医疗事件序列
LLM4EHR 提出了一种临床基础模型,该模型通过领域自适应的大语言模型和正则化对比目标,在时间上对齐电子健康记录(EHR)时间序列与医疗事件序列,从而提升下游预测任务的性能。
ClinicalMC:面向大语言模型的多疗程临床决策基准
ClinicalMC是一个基准,旨在评估大语言模型在多疗程临床决策中的表现,包含中文和英文数据集以及一个多智能体评估框架。
在标准化病例中评估大语言模型在动态临床决策中的表现
研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。
从结构化临床数据预测心血管风险的大语言模型
本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。