基于患者轨迹的强化学习在电子健康记录基础模型中的临床推理应用
摘要
本文提出了一种强化学习微调框架,通过将电子健康记录基础模型视为基于患者轨迹的生成策略来增强其临床推理能力,结果显示强化学习微调提升了性能,并使较小模型在数据有限场景下能够超越较大模型。
arXiv:2609.12277v1 公告类型:新
摘要:电子健康记录(EHR)基础模型在纵向患者轨迹上训练,在多种临床预测任务中表现出色。然而,它们的临床推理能力受限于在有限和不完整的EHR数据上的下一个令牌预测。为了解决这个问题,我们提出了一种强化学习(RL)微调框架,将EHR基础模型视为基于患者轨迹的生成策略。我们将常见的临床预测问题(如医院再入院)形式化为事件条件化、时间窗口化的推理任务。然后,我们设计了时间感知、rollout敏感的奖励来考虑有限的rollout长度和时间不确定的结果。我们发现,RL微调始终优于预训练骨干网络和强基线。值得注意的是,它使较小模型在数据有限的情况下能够超越较大的预训练模型,并在任务间引发正迁移。进一步分析表明,RL微调模型生成的轨迹与真实情况在结构和语义上更一致,并具有更高的下游效用。
查看缓存全文
缓存时间: 2026/09/14 08:39
# 基于患者轨迹的强化学习在EHR基础模型临床推理中的应用
来源:https://arxiv.org/html/2609.12277
本研究于微软研究院实习期间完成。###### 摘要
基于纵向患者轨迹训练的电子健康记录(EHR)基础模型在各类临床预测任务中展现出优异性能。然而,其临床推理能力仍受限于在有限且不完整的EHR数据上进行的下一个令牌预测。为此,我们提出一个强化学习微调框架,将EHR基础模型视为患者轨迹上的生成策略。我们将常见临床预测问题(如再入院)形式化为事件条件化、时间窗口化的推理任务,并设计时间感知、 rollout 敏感的奖励机制,以应对有限的 rollout 长度和时间上不确定的结局。实验表明,强化学习微调持续优于预训练骨干网络和强基线模型。值得注意的是,该方法使较小模型在数据受限场景中超越大型预训练模型,并在不同任务间诱导正向迁移。进一步分析显示,强化学习微调模型生成的轨迹在结构和语义上更贴合真实数据,且具有更强的下游实用价值。
††workshop:Machine Learning for Health \(ML4H\) 2026††proceedings:: Submitted to ML4H 2026:\\mlhtrackname††workshop:Machine Learning for Health \(ML4H\) 2026###### 关键词
强化学习,临床推理,EHR基础模型
## 1引言
大规模EHR数据集(Johnson等人,2016 (https://arxiv.org/html/2609.12277#bib.bib16);Johnson等人,2023 (https://arxiv.org/html/2609.12277#bib.bib17))涵盖了不同医疗场景和时间跨度的丰富患者信息。近期研究开发了EHR基础模型(McDermott等人,2023 (https://arxiv.org/html/2609.12277#bib.bib22);Yang等人,2023 (https://arxiv.org/html/2609.12277#bib.bib43);Renc等人,2024 (https://arxiv.org/html/2609.12277#bib.bib25);Renc等人,2025 (https://arxiv.org/html/2609.12277#bib.bib26);Jing等人,2026 (https://arxiv.org/html/2609.12277#bib.bib14)),这些模型将患者病史表示为时间有序的事件序列,并通过下一个令牌预测预训练Transformer模型。通过将异质临床事件建模于统一的自回归框架中,这些模型在多种下游临床任务中取得了优异表现。
尽管存在这些进展,仍面临若干挑战。首先,EHR基础模型常受数据可得性限制(Zhang等人,2025 (https://arxiv.org/html/2609.12277#bib.bib45)),在固定临床数据集下,模型规模扩展的收益逐渐递减。其次,仅依靠下一个令牌预测对于需要长期推理的临床任务效率较低。这些局限性因患者时间线的不完整性和不规则性而加剧——临床相关事件可能缺失(Getzen等人,2023 (https://arxiv.org/html/2609.12277#bib.bib4);Gurupur等人,2025 (https://arxiv.org/html/2609.12277#bib.bib10)),破坏时间依赖关系,阻碍对临床有意义动态的学习。这促使我们探索超越下一个令牌预测的后训练策略,以更好地支持临床推理。
为应对这些挑战,我们提出通过强化学习微调患者轨迹来提升EHR基础模型的临床推理能力。我们将预训练的EHR基础模型视为模拟未来患者轨迹的生成策略,并利用可验证的任务特定奖励对其针对临床有意义的结局进行优化。我们将常见临床预测问题(包括再入院、ICU再入院和住院患者死亡率)形式化为纵向患者轨迹上的事件条件化、时间窗口化推理任务。然而,一个关键挑战在于:临床任务基于真实时间窗口定义,而EHR基础模型在有限令牌长度约束下运行。为弥合这一不匹配,我们引入时间感知、rollout敏感的框架。我们过滤训练轨迹中结局超出支持rollout长度或随访不足的情况,并排除在令牌预算内结果仍不确定的生成rollout。对于合格rollout,我们仅基于规定时间窗口内的结局分配可验证奖励。这使得强化学习微调无需强迫过早下结论或扭曲预训练轨迹分布。
我们验证了强化学习微调能有效提升EHR基础模型在多种设定下的临床推理性能。在单任务设定中,强化学习微调模型持续优于其预训练骨干和强基线,且较小模型在有限数据下能超越大型预训练模型。在多任务设定中,联合微调多个临床推理任务能在不同任务间诱导正向迁移。进一步分析显示,强化学习微调模型生成的患者轨迹在结构和语义上更贴合真实轨迹,且将这些轨迹作为简单、可解释分类器的输入时,能提供更强的下游预测效用。综上所述,我们证明采用时间感知、rollout敏感奖励的强化学习微调能增强EHR基础模型的临床推理能力和实际效用。
我们的主要贡献包括:
- •提出采用时间感知、rollout敏感奖励的患者轨迹强化学习微调方法,用于EHR基础模型的临床推理。
- •证明强化学习微调能在数据受限场景下优于模型规模扩展,而多任务强化学习可进一步诱导临床任务间的正向迁移。
- •展示强化学习微调模型生成的轨迹更贴合真实数据,且具有更强的下游预测效用。
## 2相关工作
#### EHR基础模型。
大规模EHR数据库(Johnson等人,2016 (https://arxiv.org/html/2609.12277#bib.bib16);Johnson等人,2023 (https://arxiv.org/html/2609.12277#bib.bib17))的日益普及,推动了纵向临床数据基础模型的发展。这些模型通常使用基于Transformer(Vaswani等人,2017 (https://arxiv.org/html/2609.12277#bib.bib37))的编码器(Wornow等人,2023 (https://arxiv.org/html/2609.12277#bib.bib41);Steinberg等人,2024 (https://arxiv.org/html/2609.12277#bib.bib35))或解码器(McDermott等人,2023 (https://arxiv.org/html/2609.12277#bib.bib22);Yang等人,2023 (https://arxiv.org/html/2609.12277#bib.bib43);Renc等人,2024 (https://arxiv.org/html/2609.12277#bib.bib25);Renc等人,2025 (https://arxiv.org/html/2609.12277#bib.bib26);Waxler等人,2025 (https://arxiv.org/html/2609.12277#bib.bib39);Jing等人,2026 (https://arxiv.org/html/2609.12277#bib.bib14))将患者病史表示为异质临床事件的时间有序轨迹(Arnrich等人,2024 (https://arxiv.org/html/2609.12277#bib.bib1))。其中,ETHOS(Renc等人,2024 (https://arxiv.org/html/2609.12277#bib.bib25);Renc等人,2025 (https://arxiv.org/html/2609.12277#bib.bib26))通过生成模拟预测未来临床进程,并在多种临床任务中表现出良好的泛化能力。后续工作通过多模态融合(Kraljevic等人,2024 (https://arxiv.org/html/2609.12277#bib.bib19))、改进rollout估计(Solo等人,2026 (https://arxiv.org/html/2609.12277#bib.bib34))和分词(Guo等人,2026 (https://arxiv.org/html/2609.12277#bib.bib8))、规模分析(Zhang等人,2025 (https://arxiv.org/html/2609.12277#bib.bib45))以及任务特定预测或决策优化(Chandak等人,2026 (https://arxiv.org/html/2609.12277#bib.bib3);Pickard等人,2026 (https://arxiv.org/html/2609.12277#bib.bib24))扩展了该范式。然而,EHR轨迹常不完整且观察不规则(Getzen等人,2023 (https://arxiv.org/html/2609.12277#bib.bib4);Gurupur等人,2025 (https://arxiv.org/html/2609.12277#bib.bib10)),这可能破坏时间依赖并限制下一个令牌预训练的效果。因此,我们探索通过强化学习微调直接优化轨迹级临床推理。
#### 用于临床推理的强化学习。
强化学习已成为在基础模型中诱导推理能力的常见微调策略,通常通过PPO(Schulman等人,2017 (https://arxiv.org/html/2609.12277#bib.bib27))、GRPO(Shao等人,2024 (https://arxiv.org/html/2609.12277#bib.bib29))和DAPO(Yu等人,2025 (https://arxiv.org/html/2609.12277#bib.bib44))等策略梯度方法实现。在医疗领域,近期研究将领域特定适配和基于强化学习的对齐应用于医学大语言模型,以提升临床推理能力(Singhal等人,2023 (https://arxiv.org/html/2609.12277#bib.bib32);Singhal等人,2025 (https://arxiv.org/html/2609.12277#bib.bib33);Huang等人,2025 (https://arxiv.org/html/2609.12277#bib.bib11);Lin等人,2025 (https://arxiv.org/html/2609.12277#bib.bib20);Sellergren等人,2025 (https://arxiv.org/html/2609.12277#bib.bib28);Gu等人,2026 (https://arxiv.org/html/2609.12277#bib.bib6);Wei等人,2026 (https://arxiv.org/html/2609.12277#bib.bib40))。这些模型在临床问答和EHR推理任务中展现了优异性能(Jin等人,2019 (https://arxiv.org/html/2609.12277#bib.bib13);Jin等人,2021 (https://arxiv.org/html/2609.12277#bib.bib12);Khandekar等人,2024 (https://arxiv.org/html/2609.12277#bib.bib18);Zuo等人,2025 (https://arxiv.org/html/2609.12277#bib.bib46))。在此基础上,我们在强化学习微调中引入时间感知、任务可验证的奖励,以使EHR基础模型的rollout与临床有意义的推理目标对齐。
![[未标注图像]](https://arxiv.org/html/2609.12277v1/pipeline.png)
## 3方法
基于第3.1节(https://arxiv.org/html/2609.12277#S3.SS1)的预备知识,我们在第3.2节(https://arxiv.org/html/2609.12277#S3.SS2)讨论临床推理任务,并在第3.3节(https://arxiv.org/html/2609.12277#S3.SS3)形式化时间感知、rollout敏感的奖励函数。图展示了我们的强化学习微调流程。
### 3.1预备知识
#### EHR基础模型。
给定EHR语料库 \(\mathcal{D}\)(Johnson等人,2023 (https://arxiv.org/html/2609.12277#bib.bib17)),我们首先将来自异构关系表的带时间戳条目按时间顺序排列所有与每位患者相关的临床事件,转换为患者轨迹。形式上,遵循Renc等人(2024)(https://arxiv.org/html/2609.12277#bib.bib25),我们将患者轨迹表示为令牌序列 \(\tau=\left(x_{1},\dots,x_{|\tau|}\right)\)。该序列包含(1)医疗事件令牌,(2)编码事件间经过时间的令牌,以及(3)捕获静态或上下文信息的辅助令牌。随后,参数为 \(\theta\) 的EHR基础模型通过最小化负对数似然在这些轨迹上自回归预训练:
\[\ell_{\text{PT}}=-\mathbb{E}_{\tau\sim\mathcal{D}}\left[\sum_{t=1}^{|\tau|}\log p_{\theta}(x_{t}\,|\,x_{<t})\right].\]
#### 强化学习微调。
带有可验证奖励的强化学习(RLVR)(Guo等人,2025a (https://arxiv.org/html/2609.12277#bib.bib7))依赖任务可验证的奖励函数,这在结果和约束通常可客观衡量的临床场景中尤为适用。在我们设定中,将预训练的EHR基础模型视为患者轨迹上的随机策略 \(\pi_{\theta}\),其中一次 rollout \(\hat{\tau}\) 对应于基于观测轨迹 \(\tau\) 生成未来患者轨迹。我们的目标是最大化生成轨迹的期望奖励 \(\mathbb{E}_{\hat{\tau}\sim\pi_{\theta}}\left[R(\hat{\tau})\right]\),其中 \(R(\cdot)\) 编码任务特定目标。本研究采用GRPO(Shao等人,2024 (https://arxiv.org/html/2609.12277#bib.bib29))及其裁剪代理损失:
\[\ell_{\text{GRPO}}=-\mathbb{E}\!\left[\sum_{t}\min\!\left(r_{t}(\theta)\hat{A},\operatorname{clip}\!\left(r_{t}(\theta),1\pm\epsilon\right)\hat{A}\right)\right],\]
其中 \(r_{t}(\theta)=\pi_{\theta}(x_{t}\mid x_{<t})/\pi_{\theta_{\mathrm{old}}}(x_{t}\mid x_{<t})\),且 \(\hat{A}\) 通过同一上下文多次rollout奖励的组归一化估计。我们还考虑了DAPO(Yu等人,2025 (https://arxiv.org/html/2609.12277#bib.bib44)),它通过非对称裁剪和信息rollout组的动态采样扩展了该框架。
### 3.2临床推理任务
许多临床预测问题(Renc等人,2024 (https://arxiv.org/html/2609.12277#bib.bib25);Renc等人,2025 (https://arxiv.org/html/2609.12277#bib.bib26))可形式化为患者轨迹上的事件条件化、时间窗口化推理任务。每个任务由(1)锚点事件 \(x\),(2)未来目标事件 \(x^{\*}\),(3)时间范围 \(W\) 定义。对于EHR基础模型,我们通过从锚点事件rollout未来轨迹并汇总随机rollout中的任务特定结果来获得预测。我们使用三个代表性任务实例化该框架:
- •30天医院再入院(Shulan等人,2013 (https://arxiv.org/html/2609.12277#bib.bib31);Tang等人,2023 (https://arxiv.org/html/2609.12277#bib.bib36)):以出院为锚点,检查30天内是否再次入院。
- •2年ICU再入院(Lin等人,2019 (https://arxiv.org/html/2609.12277#bib.bib21);Carvalho等人,2023 (https://arxiv.org/html/2609.12277#bib.bib2)):以ICU出院为锚点,检查两年内是否再次入住ICU。
- •2年住院患者死亡率(Pang等人,2022 (https://arxiv.org/html/2609.12277#bib.bib23);Wang等人,2026 (https://arxiv.org/html/2609.12277#bib.bib38)):以入院为锚点,检查出院前两年内是否死亡。
### 3.3时间感知、rollout敏感的奖励
将强化学习微调应用于EHR基础模型的一个关键挑战是:时间窗口化的临床推理任务与有限、不规则的患者轨迹之间的不匹配。这些任务基于明确的时间范围 \(W\) 定义,但观测到的EHR轨迹和模型生成的rollout可能无法提供足够的时间证据来确定目标事件 \(x^{\*}\) 是否在此时间窗口内发生。对于观测轨迹,时间窗口 \(W\) 内的目标事件可能超出基础模型支持的最大rollout长度 \(H\),导致rollout溢出;同时患者记录可能在 \(W\) 之前结束,导致随访不完整。对于生成轨迹,rollout可能在到达 \(x^{\*}\) 或完整时间范围之前耗尽 \(H\),使结果不确定而非负面。因此,我们区分训练数据过滤和rollout奖励分配,以明确处理这些情况。
#### 训练数据过滤。
给定包含锚点事件 \(x\) 的患者轨迹 \(\tau\),我们用 \(t\) 和 \(t^{\*}\) 分别表示 \(x\) 和 \(x\) 之后首次出现 \(x^{\*}\) 的索引,其中 \(t^{\*}=\infty\)相似文章
强化学习用于大型语言模型的寻求证据诊断推理
本文提出了一种基于强化学习的框架,用于利用大型语言模型进行寻求证据的诊断推理。经过强化学习训练的7B模型在多语言临床咨询任务中优于更大的模型,表明专门的强化学习可以提炼高水平的临床推理。
面向临床智能体的世界反馈:在FHIR环境中诊断强化学习
本文研究了在FHIR环境中为临床协议执行任务使用来自世界反馈的强化学习,识别了诸如高静默完成上限和零梯度任务等结构性障碍,并引入了具有更低上限的MedAgentBench-v3。它表明,由于这些障碍,纯强化学习表现不如基于规则的SFT,并提出了一种结合SFT+RL的方法。
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
训练大型语言模型预测临床事件
本文通过将按时间排序的临床笔记转换为预测示例,将前瞻性学习扩展到临床事件预测。在120B模型上使用LoRA适配器改善了校准性能,并在留出问题上优于GPT-5。
从静态风险到动态轨迹:迈向世界模型启发的临床预测
本综述论文提出了一个用于临床AI中干预感知疾病轨迹建模的统一框架,通过整合治疗混杂反馈和信息性观察模式来解决静态预测的失败。