训练大型语言模型预测临床事件

arXiv cs.LG 论文

摘要

本文通过将按时间排序的临床笔记转换为预测示例,将前瞻性学习扩展到临床事件预测。在120B模型上使用LoRA适配器改善了校准性能,并在留出问题上优于GPT-5。

arXiv:2605.12817v1 公告类型:新 摘要:纵向临床笔记包含患者随时间演变的丰富证据,但将这些信号转化为临床预测的训练监督仍然具有挑战性。我们将前瞻性学习扩展到临床预测,通过将按时间排序的MIMIC-III笔记转换为示例,这些示例包括过去的患者背景、关于可能出现的未来事件的自然语言问题以及从后续文档中解析出的标签。这一过程从702次入院中产生了6,900个预测示例,涵盖药物、手术、器官支持、微生物学和死亡率。在这些示例上训练的小型LoRA适配器比提示基础模型有所改进,将预期校准误差从0.1269降低到0.0398,Brier分数从0.199降低到0.145,同时在留出问题上的点估计略优于GPT-5。该方法能够从纵向笔记中利用可复用的临床预测监督,无需手工构建的结构化特征或特定终点的分类器。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:19

# 训练大型语言模型以预测临床事件
来源:https://arxiv.org/html/2605.12817
###### 摘要

纵向临床记录包含了患者随时间演变的丰富证据,但将这些信号转化为临床预测的训练监督信号仍然具有挑战性。我们将预见性学习扩展到临床预测领域,通过将按时间排序的 MIMIC-III 记录转化为示例,每个示例包含患者过往背景、一个关于未来可能事件的自然语言问题,以及从后续文档中解析出的标签。这一过程从 702 次入院记录中产生了 6,900 个预测示例,涵盖药物、手术、器官支持、微生物学和死亡率。在这些示例上训练的一个小型 LoRA 适配器,相较于提示基础模型有显著改进,将 ECE 从 0.1269 降低至 0.0398,Brier 评分从 0.199 降至 0.145,并且在保留问题上略微优于 GPT-5 的点估计。该方法能够从纵向记录中生成可复用的临床预测监督信号,无需手工设计的结构化特征或特定终点的分类器。

## 1 引言

临床决策通常依赖于根据不完整且不断更新的信息来预测患者病情将如何演变。电子健康记录包含了患者状态、治疗反应和临床医生评估的纵向证据,但其中大量信号以自由文本记录的形式存在,而非固定的结构化变量或静态标签。

在本工作中,我们将先前关于预见性学习的工作 (Turtelet al., 2026b) 扩展至临床事件预测。关键观察在于,较早的记录定义了预测时刻已知的信息,而较晚的文档则记录了患者病情的演变以及发生的结局。我们的主要贡献是一个端到端的框架,用于将原始的、按时间排序的电子病历记录转化为临床预测模型。我们通过从 MIMIC-III 记录构建按时间顺序的轨迹、采样预测时间点、生成关于未来可能事件的自然语言问题,并利用后续的临床证据来解析这些事件来实现这一想法。

这个过程产生了特定事件的预测示例,包含部分患者病史、一个关于未来可能结局的问题,以及从后续临床记录中解析出的标签。由于问题以自然语言表达,同一轨迹可以支持跨药物、手术、器官支持、微生物学结果和死亡率的异构预测,而无需特定终点的分类器。

然后,我们利用这种纵向监督信号,通过一个小型 LoRA 适配器适配一个开源的 120B 参数语言模型,产生了一个专门的概率性临床预测模型,而无需进行全参数微调。在 MIMIC-III 上的回顾性演示中,适配后的模型显著优于提示基础模型,并在相同基准设置下略微超过 GPT-5 的点估计结果。

## 2 相关工作

### 2.1 纵向电子病历预测

大量工作利用电子健康记录来预测死亡率、再入院、诊断进展和未来的临床事件。早期方法依赖于结构化变量和手工设计的风险评分,而近期工作则直接使用序列模型和 Transformer 来建模患者历史。BEHRT (Liet al., 2020) 将 Transformer 架构应用于纵向电子病历记录进行疾病预测,Med-BERT (Rasmyet al., 2021) 从结构化患者轨迹中学习上下文表示。更近期的一些患者时间线系统通过更丰富的时间建模扩展了这一方向:Foresight 2 (Kraljevicet al., 2024) 利用生物医学概念提取从 MIMIC-III 记录构建患者时间线,并微调开源模型以进行诊断预测、药物推荐和风险预测;而 GRAIL (Qu and Färber, 2026) 则利用层次化嵌入和 LLM 重排序,基于 MIMIC-IV 的结构化患者历史研究轨迹预测。

这些方法展示了随时间对患者建模的价值,但通常依赖于结构化代码、提取的生物医学概念或下一个事件预测,而非基于原始临床叙述的明确自然语言问题。这之所以重要,是因为大量临床相关信号存在于非结构化笔记中——细微的评估、不断演变的推理以及难以轻松量化的发现。

### 2.2 用于临床记录的语言模型

另一条工作路线直接将语言模型应用于临床文本。ClinicalBERT (Huanget al., 2019) 表明,在临床记录上训练的领域适配 Transformer 可以改善下游医院预测任务,如再入院和表型分类。更广泛地说,医生和护理记录包含未被结构化变量完全捕捉的预测信息。

大多数基于记录的系统将文档视为用于分类、提取或摘要的静态输入。相比之下,我们的设置将临床记录视为一个不断演变的记录:模型看到的是到预测时间点为止已记录的文档,并预测稍后才被记录下来的结局。

### 2.3 预见性学习

本工作建立在预见性学习 (Turtelet al., 2026b) 框架之上,该框架训练模型仅利用预测时间点可用的信息进行概率预测,其监督信号来自后续实际发生的结局。该框架的先前应用已证明其在预测 SEC 风险 (Turtelet al., 2026a) 和供应链中断 (Turtelet al., 2026c) 方面的效用,表明基于时间的监督信号能够支持在复杂、真实世界的领域中进行预测,在这些领域中,未来的结局必须从不断变化的文本和结构化证据中推断得出。

我们将该框架应用于临床叙述,通过从 MIMIC-III 记录构建患者轨迹,从这些轨迹生成预测问答对,并微调模型以产生校准的临床预测。总体而言,先前的工作表明,结构化电子病历历史、临床记录和特定任务的微调各自都能改善医疗预测,而近期预见性学习的应用则表明,模型可以通过跨领域的、基于结果分辨率且具有时间基础的示例来学习预测行为。我们的贡献在于将这些想法结合到临床环境中:将非结构化的临床叙述转化为具有时间基础的问答对,并训练模型仅利用患者轨迹中每个时间点可用的信息来预测未来结局。

## 3 数据与问题设定

图 1 总结了数据构建和评估流程。从带有时间戳的临床记录开始,我们构建患者轨迹,采样预测时间点,根据这些时间点可用的记录生成预测问题,利用后续临床证据解析结局,并将生成的示例用于模型训练和评估。

见图注图 1:临床预测流程。### 3.1 数据来源与轨迹构建

我们的分析使用了 MIMIC-III v1.4,这是一个通过 PhysioNet 提供、供经过资质认证的研究使用的去标识化重症监护数据集 (Johnsonet al., 2016)。根据所需的 PhysioNet 认证和 MIMIC 数据使用条款获得了访问权限。所有基于模型的 MIMIC-III 记录处理,包括问题生成、标签解析、评估和训练,均在确认符合相关数据使用要求的提供者和环境中进行。

MIMIC-III 包含医院入院记录、ICU 住院记录、人口统计信息、诊断、手术、药物、实验室测量值、图表事件以及纵向临床记录。对于每次医院入院,我们通过按时间戳对所有可用的自由文本记录进行排序,构建一个按时间顺序排列的患者轨迹。这些记录包括护理文档、医生病程记录、会诊记录、放射学解读、出院小结和其他叙述性记录。由此产生的轨迹代表了患者在入院过程中不断演变的临床记录:较早的记录捕捉了当时已知的信息,而较晚的记录则记录了随后的干预措施、结局和临床进展。为了保持时间的真实性,轨迹严格按时间戳顺序构建。

### 3.2 问题构建

我们通过随机选择一个严格早于记录出院时间的时间节点,将每个回顾性患者轨迹转化为预测示例。截至该时间节点可用的记录定义了预测背景,而出院信息及后续临床证据则被排除在模型输入之外,仅用于结局解析。

对于每个轨迹,我们使用 Gemini 2.5 Flash 生成多个临床上有意义的预测问题,这些问题仅基于该时间节点之前的可用文档。模型被指示询问在同一入院期间剩余时间内可能发生的未来事件,例如用药启动、手术、器官支持、实验室或微生物学发现以及死亡率。问题生成模型不会接收到时间节点后的记录或出院文档。然后,使用时间节点后的文档单独解析生成的问题,无法分配支持的二元标签的问题将被排除。

由此产生的问题针对的是入院剩余时间内记录的、可观察的未来事件,包括药物或治疗启动、手术和器官支持、实验室或微生物学结果以及死亡率。代表性示例如下:

- • 患者在此次入院期间是否会开始接受静脉血管活性药物?
- • 患者在此次入院期间是否会接受浓缩红细胞输血?
- • 患者在此次入院期间是否会接受肾脏替代治疗(透析)?
- • 患者在此次医院入院期间是否会被宣告死亡?
- • 患者在此次入院期间是否需要气管插管进行机械通气?
- • 患者在此次入院期间的痰培养是否会显示出病原菌或真菌阳性?

### 3.3 标签解析与预测任务

每个生成的问题仅使用同一入院中时间节点后的文档进行解析,包括可用的出院文档。Gemini 2.5 Flash 根据未来的记录是否包含足够证据表明所询问的事件发生在预测时间之后、出院之前,来分配一个二元标签。

由于问题生成和标签解析发生在轨迹分割点的两侧,每个示例都基于一个现实的设定:问题仅基于预测时间点可用的信息,答案仅根据后续临床证据确定。这避免了前瞻性偏差,并反映了我们希望模型学习的场景。

形式化地,对于患者 ii、分割时间点 tt 以及未来临床事件 ee,我们定义

yi,t,e=1\{
事件 e 发生在 t 之后且出院之前
}\.y_{i,t,e}=\mathbf{1}\{\text{事件 } e \text{ 发生在 } t \text{ 之后且出院之前}\}.模型被训练来估计

P(yi,t,e=1∣轨迹i,≤t).P\left(y_{i,t,e}=1\mid\mathrm{轨迹}_{i,\leq t}\right).也就是说,在给定截至分割时间点可用的临床记录的情况下,指定临床事件在入院后期发生的概率。模型输出一个介于 0 和 1 之间的数值概率,并可以选择性地提供基于观察轨迹的自然语言推理。

为了具体说明该设定,表 1 展示了一个基于数据集中使用的事件类型的简化合成示例。该示例仅供说明之用,不复制 MIMIC-III 中任何实际的患者文本,以符合数据使用协议。

表 1:合成的具有时间基础的临床预测示例。
### 3.4 数据集统计与划分

最终数据集由从具有足够纵向文档的随机抽取的医院入院记录中生成的预测问题组成。该数据集代表了可用的基于记录的监督信号的一个采样子集,而非穷举枚举:相同的流程可以通过对更多入院样本进行采样、在每个轨迹中选择额外的分割时间点或为每个分割点生成更多问题来生成更多示例。我们纳入了至少包含九条带时间戳记录且有记录出院时间的入院记录,以确保每个轨迹包含足够的纵向背景和一个明确定义的用于标签解析的终点。对于每个纳入的入院记录,我们构建一个按时间顺序的轨迹,在出院前选择一个分割时间点,从轨迹的已观察部分生成多个预测问题,并使用剩余的后续记录分配标签。

我们在入院级别划分数据集,以确保没有入院记录出现在多个划分中。保留的测试集包含 500 个问题,所有剩余问题用于训练。最终数据集包含 702 个入院级别的轨迹和 6,900 个问题,平均每个轨迹有 9.8 个问题,正标签率为 25%。

表 2:数据集摘要。

## 4 模型

### 4.1 学习框架与架构

我们将临床事件预测形式化为条件概率预测。给定预测时间点可用的临床记录和一个关于未来临床事件的自然语言问题,模型估计该事件在入院后期发生的概率。

我们的基础模型是 gpt-oss-120b,一个 120B 参数的纯解码器语言模型。我们使用低秩适配(LoRA,秩 r=32)对其进行适配,冻结基础权重,仅训练特定于任务的适配器参数。训练通过 Lightning Rod SDK 进行,该 SDK 支持多种后端训练引擎。在本工作中,我们使用 Tinker 作为后端。这使得我们能够在无需全参数微调的情况下,高效地专门化到临床预测任务。

每个输入包含一个任务指令、预测时间点可用的按时间顺序的患者记录,以及预测问题。输入被截断至最大上下文长度 16,000 个 token,当可用记录超过此限制时,保留最近的临床文档。模型输出一个介于 0 和 1 之间的数值概率,解释为所查询事件在预测时间点之后、出院之前发生的估计可能性。

由于每个患者记录可以与多个特定事件的问题配对,同一个模型可以预测异构的结局,包括用药启动、手术、器官支持、微生物学结果和死亡率。因此,该模型并非作为每个终点的单独分类器进行训练,而是作为一个通用的事件条件预测模型。这种通用设计也赋予了对输入上下文变化的鲁棒性:模型能够适应长度、文档风格和可用信息均不同的记录,而无需固定或标准化的输入格式。

### 4.2 训练目标与优化

相似文章

大型语言模型作为统一多模态学习器用于临床预测

arXiv cs.AI

该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。

将未来行为预测作为学习任务

arXiv cs.AI

本文提出了 Behavior Forecasters,一种从推理轨迹中预测 LRM 未来行为(如答案一致性和输入敏感性)的学习方法,以更低的成本超越了 GPT-5.4 和 Claude Opus 4.6。

将预测未来行为作为一项学习任务

Hugging Face Daily Papers

本文提出训练行为预测器,从单条推理轨迹预测大型推理模型的输出,在计算成本更低的情况下优于GPT-5.4和Claude Opus-4.6等大型语言模型,绕过了传统的可解释性方法。