基于患者感知采样的电子健康记录基础模型预训练
摘要
提出了患者采样方法,这是一种用于电子健康记录基础模型的预训练序列构建方法,在MIMIC-IV数据集上相比标准全局流基线提升了下游任务性能,强调了序列构建在自回归健康模型中的重要性。
arXiv:2607.22114v1 公告类型:新
摘要:电子健康记录的自回归基础模型通常继承自语言建模的预训练方法,其中患者轨迹被连接成单个标记流,并从该流中采样窗口。在电子健康记录数据中,这一选择至关重要:窗口可能混合多个患者,且记录更长的患者贡献更多优化更新,可能引入偏差。我们提出了患者采样,一种预训练序列构建方法,允许我们控制训练信号在患者之间的分布。我们将该方法与标准方法(称为全局流)进行比较。我们展示了具有可控权重的随机患者采样在真实世界电子健康记录数据上提升了性能。在MIMIC-IV v2.2和v3.1的下游临床任务中,患者采样在宏观AUROC和AUPRC指标上优于全局流基线。这些结果表明,训练和验证序列构建是自回归电子健康记录基础模型中重要且未被充分探索的设计选择。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 基于患者感知采样的电子健康记录基础模型预训练
来源:https://arxiv.org/html/2607.22114
###### 摘要
电子健康记录(EHRs)的自回归基础模型通常继承自语言建模的预训练方法,其中患者轨迹被拼接成单个词元流,并从该流中采样窗口。在EHR数据中,这一选择影响重大:窗口可能混合多个患者,且记录更长的患者贡献更多优化更新,可能引入偏差。我们提出患者采样(Patient Sampling),一种预训练序列构建方法,允许我们控制训练信号在患者之间的分布。我们将此方法与标准方法(我们称之为全局流,Global Stream)进行比较。我们表明,具有可控制权重的随机患者采样在真实世界EHR数据上提升了性能。在MIMIC-IV v2.2和v3.1的下游临床任务中,患者采样在宏观AUROC和AUPRC上优于全局流基线。这些结果将训练和验证序列构建确定为自回归EHR基础模型中重要且未被充分探索的设计选择。
机器学习、预训练、自回归、健康、医学、ICML
## 1 引言
电子健康记录(EHRs)的自回归基础模型将每个患者病史表示为可变长度的离散词元序列,并使用下一个词元预测目标进行训练。最近的研究表明,这些模型可以通过从观察到的患者病史模拟未来轨迹来支持零样本临床预测(Renc 等,2024 (https://arxiv.org/html/2607.22114#bib.bib9); Kraljevic 等,2024 (https://arxiv.org/html/2607.22114#bib.bib36))。
当前的EHR预训练方法在很大程度上继承了语言建模中的序列构建策略。在标准设置中,患者轨迹被拼接成一个全局词元流,并从中采样固定长度的训练窗口。在EHR数据中,这不仅仅是效率选择:一个窗口可能包含来自多个患者的事件,并且记录更长的患者在训练期间贡献更多的优化更新。这在我们的设置中尤其相关,其中患者轨迹长度高度不相等,形成如图3 (https://arxiv.org/html/2607.22114#S2.F3)所示的对数正态分布。
参见图注 图 1: EHR 数据集的玩具示例,表示为可变长度词元序列 \(D_i\)。彩色框表示 EHR 词元,黑色边框框表示序列结束词元。在本工作中,我们研究了预训练序列构建的替代方法。我们确定了三种不同的方法,分别称为全局流(Global Stream)、患者分块(Patient Chunks)和患者采样(Patient Sampling)。
保持词元化和模型架构固定,我们将标准全局流方法与患者感知的替代方法进行比较,这些方法保留了患者边界并改变了训练信号在患者之间的分布。在 MIMIC-IV v2.2 和 v3.1(Johnson 等,2023b (https://arxiv.org/html/2607.22114#bib.bib39), 2024 (https://arxiv.org/html/2607.22114#bib.bib10), a (https://arxiv.org/html/2607.22114#bib.bib11))中,我们发现患者采样在整体下游性能上优于全局流基线,同时提高了宏观 AUROC 和宏观 AUPRC。我们的发现凸显了预训练序列构建方法的影响,据我们所知,这是首次在自回归健康基础模型背景下探索这一设计选择的工作。
## 2 背景
参见图注 图 2: 本工作中考虑的数据集构建比较。左侧的 *全局流* 从全局拼接的词元流中形成训练窗口。*患者分块* 构建确定性的患者内窗口。*患者采样* 首先采样一个患者,然后仅从该患者中采样一个窗口。不同颜色表示不同患者,灰色框表示填充。自回归建模最近已成为 EHR 数据的一种有前景的范式,其中患者病史被表示为词元化事件序列。图1 (https://arxiv.org/html/2607.22114#S1.F1) 通过一个玩具词元化 EHR 数据集说明了这一设置。
### EHR 基础模型
最近的工作已将自回归或生成式预训练应用于纵向 EHR 数据。ETHOS(Renc 等,2024 (https://arxiv.org/html/2607.22114#bib.bib9))及其后续 ETHOS-ARES(Renc 等,2025 (https://arxiv.org/html/2607.22114#bib.bib38))将 EHR 数据转换为词元化的患者时间线,训练 GPT-2(Radford 等,2019 (https://arxiv.org/html/2607.22114#bib.bib7))风格的模型进行下一个词元预测,并通过从临床预测点展开未来事件来评估模型,从而获得下游任务的零样本预测。Foresight(Kraljevic 等,2024 (https://arxiv.org/html/2607.22114#bib.bib36))使用生成式预训练 Transformer 对患者时间线进行建模,该模型结合结构化 EHR 数据和自由文本来预测未来的临床概念和结果。CoMET(Waxler 等,2025 (https://arxiv.org/html/2607.22114#bib.bib37))证明了具有下一个词元预测目标的自回归医学事件预训练可以扩展到更大的模型和数据集,并具有可预测的缩放规律。这些工作共同确立了将患者时间线上的自回归预训练作为 EHR 基础建模的可行方法,但并未明确将预训练序列构建作为主要设计变量进行研究。
参见图注 图 3: MIMIC-IV v2.2 训练集中患者词元序列长度的分布,x轴采用对数刻度。
### 序列组成
序列组成的影响已在语言模型预训练中进行了探索。Zhao 等人(2024 (https://arxiv.org/html/2607.22114#bib.bib2))表明,将不相关的文档拼接成固定长度序列可能会引入令人困惑的跨文档上下文,损害语言建模和下游性能。他们证明,文档内掩码和基于检索的相关文档打包都能提升性能。类似地,上下文内预训练(Shi 等人,2024 (https://arxiv.org/html/2607.22114#bib.bib40))表明,重新排序文档使得每个上下文窗口包含语义相关的材料,可以提升需要跨文档边界进行更强上下文推理的任务。这些发现激励了在 EHR 建模中研究序列组成,其中患者轨迹在长度上高度不等,标准序列构建可能进一步加剧这种不平衡。
| 方法 | 数据集 | | MIMIC-IV v2.2 + ED v2.2 | | MIMIC-IV v3.1 + ED v2.2 | | | | | | | |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 训练 | 验证 | \(\alpha\) | ICU 死亡率 | ICU 再入院 | ICU 死亡率 | ICU 再入院 | 宏观 |
| | | | AUROC | AUPRC | AUROC | AUPRC | AUROC | AUPRC | AUROC | AUPRC | AUROC | AUPRC |
| 全局流 | 全局流 | – | 0.878 | 0.434 | 0.725 | 0.383 | 0.843 | 0.428 | 0.703 | 0.380 | 0.787 | 0.406 |
| 全局流 | 患者分块 | – | 0.866 | 0.428 | 0.717 | 0.389 | 0.852 | 0.439 | 0.712 | 0.382 | 0.786 | 0.410 |
| 患者分块 | 患者分块 | – | 0.865 | 0.357 | 0.664 | 0.313 | 0.832 | 0.327 | 0.662 | 0.334 | 0.756 | 0.332 |
| 患者采样 | 患者分块 | 0 | 0.885 | 0.432 | 0.726 | 0.392 | 0.851 | 0.437 | 0.701 | 0.372 | 0.791 | 0.408 |
| | | 0.2 | 0.848 | 0.350 | 0.721 | 0.382 | 0.839 | 0.402 | 0.690 | 0.365 | 0.774 | 0.375 |
| | | 0.4 | 0.882 | 0.443 | 0.728 | 0.399 | 0.834 | 0.405 | 0.696 | 0.372 | 0.785 | 0.405 |
| | | 0.6 | 0.884 | 0.456 | 0.730 | 0.405 | 0.850 | 0.446 | 0.706 | 0.381 | 0.792 | 0.422 |
| | | 0.8 | 0.845 | 0.378 | 0.725 | 0.397 | 0.821 | 0.379 | 0.707 | 0.376 | 0.775 | 0.383 |
| | | 1 | 0.863 | 0.416 | 0.733 | 0.407 | 0.848 | 0.435 | 0.719 | 0.399 | 0.791 | 0.414 |
表 1: 不同预训练数据构建在 MIMIC-IV v2.2 + ED v2.2 和 MIMIC-IV v3.1 + ED v2.2 上对 ICU 死亡率和 ICU 再入院任务的比较。结果以 AUROC 和 AUPRC 报告。最后一列宏观表示所有四个报告任务设置的平均值,每个指标列中的最佳值以粗体显示。
## 3 方法
我们考虑一个包含 \(N\) 个患者的数据集 \(\mathcal{D} = \{ x^{(i)} \}_{i=1}^{N}\),其中患者 \(i\) 由一个 EHR 词元序列表示:
\(x^{(i)} = \left( x^{(i)}_1, \dots, x^{(i)}_{L_i} \right)\),且 \(L_i\) 是患者 \(i\) 的序列长度。遵循先前自回归 EHR 建模的工作,我们在长度为 \(S\) 的固定长度词元窗口上训练一个仅解码器 Transformer,目标为下一个词元预测。
我们比较了几种构建训练和验证 *窗口* \(w = (w_1, \dots, w_S)\) 的策略。窗口是构成单个数据点的词元序列。
### 全局流 (Global Stream)。
我们的基线遵循自回归预训练中使用的标准全局流构建。我们将所有患者序列拼接成一个流:
\(z = x^{(1)} \| x^{(2)} \| \cdots \| x^{(N)}\),总长度 \(T = \sum_{i=1}^{N} L_i\)。给定步长 \(r\),我们定义有效起始索引集合:
\(\mathcal{T}_{\mathrm{GS}} = \{ 1, 1+r, 1+2r, \dots, t_{\max} \}, \quad t_{\max} \leq T - S + 1\). 每个窗口为 \(w^{(t)} = (z_t, \dots, z_{t+S-1}), \quad t \in \mathcal{T}_{\mathrm{GS}}\). 这种构建简单高效,但单个窗口可能包含来自多个患者的词元。
### 患者分块 (Patient Chunks)。
为了保留患者边界,我们建议在每个患者序列内独立构建窗口。对于患者 \(i\),我们定义一组确定性的分块起始索引:
\(\mathcal{B}_i = \{ 1, 1+S, 1+2S, \dots \} \cap \{ 1, \dots, L_i \}\),然后我们添加一个右对齐到序列末尾的最终分块:
\(b_{i,\mathrm{end}} = \max(1, L_i - S + 1)\),并将其添加到起始索引集合 \(\mathcal{B}_i \leftarrow \mathcal{B}_i \cup \{ b_{i,\mathrm{end}} \}\)。每个窗口为:
\(w^{(i,b)} = \left( x^{(i)}_b, \dots, x^{(i)}_{\min(L_i, b+S-1)} \right), \quad b \in \mathcal{B}_i\). 长度小于 \(S\) 的窗口被右填充到长度 \(S\),填充的目标位置从损失中排除并被掩码掉。与全局流不同,患者分块始终产生包含来自单个患者词元的窗口。
### 患者感知采样 (Patient-Aware Sampling)。
接下来,我们介绍一种随机构建方法,将 *患者* 和 *窗口* 选择解耦,以控制训练期间损失信号的分布。由于非确定性性质,此构建仅用于训练。
对于每个患者 \(i\),令 \(\mathcal{W}^{(i)}\) 表示构建窗口的有效起始索引集合。我们首先根据以下概率采样一个患者:
\(p_{\alpha}(i) = \frac{|\mathcal{W}^{(i)}|^{\alpha}}{\sum_{j=1}^{N} |\mathcal{W}^{(j)}|^{\alpha}}\),其中 \(\alpha \in [0,1]\) 控制训练期间患者的权重。当 \(\alpha = 0\) 时,患者被均匀采样;当 \(\alpha = 1\) 时,患者按其包含的有效窗口数量成比例采样,即一个患者可能拥有的词元窗口数量是另一个患者的两倍,则其采样频率也会翻倍。
给定一个采样到的患者 \(i\),我们然后从以下集合中均匀采样一个起始索引:
\(\mathcal{W}^{(i)} = \{ 1-S, 2-S, \dots, L_i - 2 \}\). 我们将提议的起始索引裁剪到第一个有效词元 \(\tilde{s} = \max(1, s)\)。这种起始索引的选择允许患者轨迹中的词元以更广泛的左侧上下文长度范围出现,而不是系统性地欠采样早期位置¹。给定 \((i, \tilde{s})\),得到的窗口为 \(x^{(i)}_{\tilde{s}:\tilde{s}+S-1}\),必要时右填充到长度 \(S\)。
¹由于需要输入和目标,第一个和最后一个词元仍然比内部词元略微欠采样,但我们认为这种影响是最小的。
全局流可能跨越患者边界并引入长轨迹偏差,患者分块保留了患者边界但仍保留了这种不平衡,而患者采样在保留边界的同时,使患者上的训练分布可以在患者均匀采样和长度加权采样之间平滑变化。每种方法在图2 (https://arxiv.org/html/2607.22114#S2.F2) 中可视化。
## 4 实验与结果
表 2: 全局流与患者采样 (\(\alpha=0.6\)) 在 MIMIC-IV v2.2 + ED v2.2 和 MIMIC-IV v3.1 + ED v2.2 数据集上的 ICU 死亡率、ICU 再入院、ICU 入院和医院死亡率任务比较。结果以 AUROC 和 AUPRC 报告,宏观列报告每个数据集版本内四个任务的平均值。每列的最佳值以粗体显示。
### 实验设置。
我们使用从 MIMIC-IV 派生的两个词元化 EHR 数据集评估第 3 节 (https://arxiv.org/html/2607.22114#S3) 中介绍的方法:版本 2.2 (Johnson 等,2023b (https://arxiv.org/html/2607.22114#bib.bib39)) 和版本 3.1 (Johnson 等,2024 (https://arxiv.org/html/2607.22114#bib.bib10)),两者均通过 PhysioNet (Goldberger 等,2000 (https://arxiv.org/html/2607.22114#bib.bib12)) 访问。在两种设置中,我们还包括急诊科模块 MIMIC-IV-ED 版本 2.2 (Johnson 等,2023a (https://arxiv.org/html/2607.22114#bib.bib11))。每个数据集按患者分为 80% 训练集、10% 验证集和 10% 测试集。
我们使用单个 NVIDIA GH200 训练一个 6 层 GPT-2 模型 (Radford 等,2019 (https://arxiv.org/html/2607.22114#bib.bib7)),序列长度 \(S = 2048\)。每 10K 训练步骤评估一次验证损失,并选择验证损失最低的检查点用于下游评估。由于患者分块是确定性的,并且两种患者感知方法均基于单患者窗口,因此我们使用患者分块作为患者分块和患者采样训练数据集的验证数据集。对于全局流,我们报告使用全局流和患者分块作为验证数据集的结果。我们使用 Renc 等人 (2025 (https://arxiv.org/html/2607.22114#bib.bib38)) 的展开框架评估以下临床任务的下游性能:ICU 死亡率、ICU 再入院、ICU 入院和医院死亡率。完整的训练和评估细节见附录 A (https://arxiv.org/html/2607.22114#A1)。
参见图注 图 4: 与全局流基线相比,不同 \(\alpha\) 值的患者采样模型在 ICU 死亡率(MIMIC-IV v2.2)上的 \(\Delta\) 正得分。正得分是模拟以正确结束词元终止的分数,delta 正得分是相对于全局流基线测量的。数据点按真实序列的词元数量分组。
### 主要结果。
我们首先在 ICU 死亡率和 ICU 再入院任务上评估每种方法,以 0.2 为增量扫描患者采样的 \(\alpha\) 值。结果如表 1 (https://arxiv.org/html/2607.22114#S2.T1) 所示。我们发现患者分块并未优于全局流基线,这表明仅保留患者边界是不够的。\(\alpha = 0.6\) 的患者采样在两个数据集的两个任务中均取得了最强的宏观性能,因此我们选择该模型进行更广泛的评估。
表 2 (https://arxiv.org/html/2607.22114#S4.T2) 显示了在医院死亡率和 ICU 入院任务上的进一步评估结果。我们在医院死亡率任务上观察到性能提升。相似文章
MedPMC:一种为基础模型扩展高保真医疗多模态数据的系统框架
MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。
利用基于Mamba架构的表征改进纵向数据的患者亚型分类
本文提出了一种自监督的基于Mamba的模型,从电子健康记录中学习有效的表征以改进患者亚型分类,在真实世界数据集上展示了优于基线模型的性能。
关于时间序列预训练中归纳偏差的作用:以临床时间序列学习通用表征的案例研究
本文研究了临床数据时间序列预训练中归纳偏差的作用,提出了PathoFM——一种以编码器为中心的Transformer,在多变量步态窗口上进行了预训练。研究比较了不同的预训练目标,发现以动力学为中心的混合目标在分类和回归任务中实现了最均衡的迁移效果。
身体活动为广谱健康预测实现可扩展的基础建模
StepFM是一个基础模型,仅使用计步器数据进行广谱健康预测,为高频传感器模型提供了保护隐私且可扩展的替代方案。
CGM-JEPA:通过预测性自监督预训练学习一致的连续血糖监测表征
介绍 CGM-JEPA,这是一种针对连续血糖监测数据的自监督预训练框架,通过掩码潜在预测和分布目标提升了跨模态及跨队列的性能。