按需导入:学习何时以及如何用外部知识增强EHR图谱

arXiv cs.LG 论文

摘要

本文介绍了ReTA,一个基于强化学习的框架,用于动态增强电子健康记录(EHR)图谱与外部知识图谱(KG),以改善诊断和死亡率等预测任务。

arXiv:2609.01839v1 Announce Type: new 摘要:电子健康记录(EHRs)的纵向预测受限于患者轨迹的稀疏性和不规则性,而利用外部知识图谱(KGs)进行知识增强为缓解这些问题提供了一种有前景的方法。然而,大多数现有方法执行固定的、与上下文无关的拓扑增强,无论患者状态如何演变,都添加相同的KG节点和边。我们提出了ReTA,一个基于强化学习的动态拓扑增强框架,将KG导入视为每次就诊时的、预算感知的策略。ReTA首先构建一个离线精炼的基于KG的模板池,然后学习一个策略,从三个选项中选择每次就诊的一个增强动作:软导入,丰富节点特征而不修改图拓扑;硬导入,将一个紧凑的KG子图嫁接到就诊图上以创建消息传递捷径;跳过,当基础编码器已经置信时,不进行增强。为了稳定学习,ReTA采用一个解耦编码器,在单独的通道中处理语义和结构信号,并通过自适应门控进行融合。在MIMIC-III和MIMIC-IV上进行的诊断预测、死亡率和再入院实验表明,ReTA始终优于强大的基线,同时保持高效,能够在数据集和知识图谱之间迁移,并产生可解释的增强模式。在稀疏监督下的稳健增益凸显了ReTA动态决策导入知识的优势,在控制成本的同时提高了准确性。
查看原文
查看缓存全文

缓存时间: 2026/09/03 06:11

# 学习何时以及如何使用外部知识源增强电子健康记录图谱
来源:https://arxiv.org/html/2609.01839

## 导入所需内容:学习何时以及如何使用外部知识增强电子健康记录图谱

Mohsen Nayebi Kerdabadi† Dongjie Wang† Mei Liu‡ Zijun Yao†††

†美国堪萨斯大学电气工程与计算机科学系,††通讯作者
‡美国佛罗里达大学健康结局与生物医学信息学系
邮箱:{chenchen, mohsen.nayebi, wangdongjie, zyao}@ku.edu,[[email protected]](mailto:[email protected])

###### 摘要
基于电子健康记录(EHR)的纵向预测受限于患者轨迹的稀疏性和不规则性,利用外部知识图谱(KG)进行知识增强提供了一种有望缓解这些问题的方法。然而,大多数现有方法执行的是固定的、与上下文无关的拓扑增强,即无论患者状态如何演变,都添加相同的KG节点和边。我们提出了**ReTA**,一个基于强化学习的动态拓扑增强框架,将KG导入建模为逐次就诊、预算感知的策略。ReTA首先构建一个离线精炼的、基于KG的模板池,然后学习一种策略,每次就诊从三个选项中选择一个增强操作:**软导入**,通过丰富节点特征而不修改图拓扑;**硬导入**,将一个紧凑的KG子图嫁接到就诊图上以创建消息传递捷径;以及**跳过**,当基础编码器已足够自信时,不进行增强。为了稳定学习,ReTA采用了一个分离编码器,在独立的通道中处理语义和结构信号,并通过自适应门控进行融合。在MIMIC-III和MIMIC-IV数据集上,针对诊断预测、死亡率和再入院任务的实验表明,ReTA始终优于强大的基线方法,同时保持高效,能够跨数据集和知识图谱迁移,并产生可解释的增强模式。在稀疏监督下的稳健增益凸显了ReTA动态决策导入知识的优势,提高了准确性同时控制了成本。

## 1 引言
大量的电子健康记录(EHR)使得广泛的医疗预测任务成为可能,从死亡率风险估计到疾病进展建模(Choi等,2016;Ma等,2017;Choi等,2017;Luo等,2020)。然而,EHR中的患者级轨迹(例如,每次就诊的医疗代码)通常是稀疏和不规则的(Rasmy等,2021),这使得数据驱动的方法难以捕捉复杂的临床模式,如合并症、并发症级联和器官系统相互作用。医疗领域中建立的知识图谱(KG),如PrimeKG(Chandak等,2023),提供了经过临床验证的概念和关系,可以补充原始的就诊数据。因此,拓扑增强,即将KG衍生的结构注入EHR就诊图,已成为学习知识增强患者表征的一种有前景的策略(Liu等,2020)。

尽管前景广阔,现有的KG增强拓扑增强方法通常表现出三个局限性:
1. **静态性**:增强通常由固定的、与上下文无关的规则驱动,这些规则使用预定义的KG邻域扩展每个EHR代码,并在所有患者和就诊中应用相同的扩展。这种静态扩展可能会检索到弱相关的概念,稀释患者特异性信号,并增加消息传递成本(Xu等,2023;Jiang等,2024;Zhu等,2024)。
2. **无预算**:大多数方法不对KG增强施加资源预算。没有预算控制,昂贵的策略(例如,硬性结构注入)可能占主导地位,而更轻量级的替代方案或完全放弃不被系统地利用,导致过度增强,放大了噪声(Liu等,2024;Zhang等,2024)。
3. **单次完成**:增强通常针对整个轨迹一次性完成,而不是在每次就诊时做出自适应决策。因此,注入的知识可能无法反映不断变化的患者状态。例如,一个从慢性糖尿病管理转变为急性脓毒症的患者,在每个阶段需要不同的关系上下文,但单次方法在整个过程中应用相同的扩展(Ye等,2021;Wang等,2025)。

在这项工作中,我们提出了**ReTA**,一个动态、有预算且自适应的框架,它基于每个患者不断演变的历史执行就诊级KG增强。ReTA将患者进展过程中的KG注入制定为三步的序列决策问题。

图1:就诊级KG注入的两种增强模式。**软导入**通过语义嵌入丰富EHR概念而不修改就诊图结构,而**硬导入**通过添加KG衍生的节点和边来增强拓扑结构。

- **步骤1:** 我们离线构建一个经过质量过滤的知识库。每个医学概念通过LLM提炼成一个紧凑的模板(一个语义定义配对一个结构级联),并基于PrimeKG进行锚定,然后聚类以去除冗余。在每次就诊时,通过结合代码级相似性和轨迹级上下文检索出前K个最相关的模板。
- **步骤2:** 我们引入一个预算感知的增强操作空间(图1)。**软导入**丰富节点特征而不修改图拓扑。**硬导入**将一个紧凑的KG子图嫁接到就诊图上,创建新的消息传递路径。**跳过**则在基础编码器已足够自信时,不进行就诊增强。强化学习策略在每次就诊时选择一个操作,在患者轨迹中平衡预测增益与增强成本。
- **步骤3:** 因为软导入和硬导入产生异构信号,我们将编码解耦为语义通道和结构通道,并通过一个自适应门控融合,选择性地组合互补证据。

我们在MIMIC-III(Johnson等,2016)和MIMIC-IV(Johnson等,2023)数据集上,针对三个临床任务(诊断预测、住院死亡率和30天再入院)评估了ReTA。ReTA在所有评估任务上均以显著优势超越了强大的基线方法,且推理成本更低。消融研究(§3.3)解析了知识库和策略决策的影响,证明动态决定是否以及如何增强每次就诊,在准确性和延迟方面都优于传统增强策略。此外,增强模式在就诊级别是可解释的,并且随着监督变得稀疏,性能增益逐渐扩大。最后,该框架展示了跨临床编码系统的强泛化能力,跨数据集的迁移性能超过了最强基线在数据集内的结果。

## 2 方法论

参考标题图2:ReTA概述。(1)每个医学概念被提炼成一个KG锚定的模板,并聚类到一个精炼的池中。(2)策略从检索到的候选模板中为每次就诊选择一个操作。(3)编码器在分离的通道中处理语义和结构信号,然后将它们融合用于预测。

### 2.1 问题设定
##### 预测任务
设 $\mathcal{C}_{\mathrm{dx}}$ 表示ICD-9/10中所有唯一诊断代码的集合。患者轨迹 $\mathbf{V}=\{V_{1},\dots,V_{T}\}$ 是按时间顺序排列的医院就诊序列,其中每次就诊 $V_{t} \subseteq \mathcal{C}_{\mathrm{dx}}$ 记录了在时间 $t$ 观察到的诊断代码。我们以临床分类软件(CCS)类别的粒度预测下一次就诊的诊断,CCS将细粒度的ICD代码分组为有临床意义的表型,并保持ICD-9和ICD-10队列的标签空间一致。设 $\mathcal{A}$ 表示CCS标签空间。给定历史 $V_{1:t}$,模型输出 $\hat{\mathbf{y}}_{t+1}\in[0,1]^{|\mathcal{A}|}$,即就诊 $t+1$ 的CCS类别概率向量。对于二元临床结果(死亡率、再入院),我们将多标签CCS头替换为单个sigmoid输出,并使用二元交叉熵训练,保持所有其他组件相同。

##### 就诊图
对于每次就诊 $V_{t}$,我们构建一个图 $G_{t}=(\mathcal{V}_{t},\mathcal{E}_{t})$,其节点是观察到的ICD代码及其CCS祖先(最多到层次 $h$ 级),边遵循这些节点之间的CCS层次结构,视为无向图用于消息传递(附录B.1)。我们使用PrimeKG(Chandak等,2023)的知识来增强这些就诊图,PrimeKG是一个精准医学知识图谱,整合了二十多种生物医学资源,具有丰富的病理生理和疾病并发症关系。ICD/CCS和PrimeKG词汇之间的桥接在§2.2.1中描述。图2展示了完整的流程。

### 2.2 知识库
逐次就诊的增强从预先构建的、有界的候选集中提取,比实时扩展开放式KG邻域更高效。我们离线构建一个可重用的知识模板池,其中每个模板将一个语义摘要与一个紧凑子图配对。

#### 2.2.1 LLM提炼与KG锚定
对于每个ICD代码及其映射的CCS类别,我们提示LLM根据该概念的规范文本描述,返回一个描述病理学的单句定义和一个列出下游并发症或合并症的临床级联。我们根据每个概念在PrimeKG中的邻域密度调整级联长度。KG邻居较少的概念接收到较长的级联(最多五个项目),以补偿稀疏的关系上下文,而邻域密集的概念接收到较短的级联(少至一个项目)。例如,对于覆盖度中等的糖尿病,典型的级联可能列出视网膜病变、神经病变和肾病。不提供患者级上下文,每个概念使用固定的解码参数独立处理(提示模板见附录B.2)。我们通过与ICD、CCS和PrimeKG词汇的精确匹配,将每个提及锚定到标准化的生物医学标识符,如果匹配失败,则回退到 $l_{2}$ 归一化名称嵌入之间高于阈值 $\tau_{\mathrm{map}}$ 的余弦相似度(Liu等,2021;Sung等,2020;Neumann等,2019)。这种相同的归一化在构建就诊图时(§2.1)也桥接了ICD和CCS概念到PrimeKG节点。对于每个概念,然后检索其PrimeKG邻域最多 $k$ 跳,并仅保留可在KG中验证的实体和链接(Soldaini和Goharian,2016)。所有过滤仅使用外部资源和固定的代码描述。除了诊断词汇库,池的构建不涉及患者轨迹、结果、划分或队列统计(阈值和诊断见附录B.3和B.5)。

#### 2.2.2 模板聚类
我们通过聚类压缩和去重锚定输出。每个概念文本(由其定义与其级联拼接而成)使用ClinicalBERT(Alsentzer等,2019)进行嵌入,并在余弦距离下使用凝聚聚类进行分组,切割阈值为 $\tau$。对于每个生成的聚类,我们计算一个质心,将其投影到模型嵌入空间,并 $l_{2}$ 归一化以获得模板向量 $\mathbf{p}_{k}\in\mathbb{R}^{d}$(详细信息见附录B.4)。全局池 $\mathcal{P}_{\mathrm{global}}=\{\mathbf{p}_{k}\}_{k=1}^{M}$ 包含 $M$ 个模板。因为级联长度随概念而异,模板在子图大小上有所不同,增强策略在选择操作时会考虑到这一点(§2.3)。

#### 2.2.3 历史感知检索
在每次就诊 $V_{t}$,我们使用当前就诊和患者的累积历史,从 $\mathcal{P}_{\mathrm{global}}$ 中检索一个候选子池。设 $s_{t}$ 表示在§2.3中定义的患者状态,该状态由过去的就诊摘要和当前就诊在任何增强之前的基础嵌入计算得出。我们通过结合代码级相似性项和轨迹级项来评分每个模板:
$$
\mathrm{Score}(V_{t},s_{t},\mathbf{p}_{k})=(1-\alpha)\max_{c_{i}\in V_{t}}\cos(\mathbf{e}_{c_{i}},\mathbf{p}_{k})+\alpha\cos(s_{t},\mathbf{p}_{k}),
\tag{1}
$$
其中 $\mathbf{e}_{c_{i}}\in\mathbb{R}^{d}$ 是代码 $c_{i}$ 的可学习嵌入,$\alpha$ 控制轨迹信号的权重。加法形式确保模板可以因为匹配当前诊断或符合患者累积的临床上下文而被检索到。我们保留前 $K$ 个模板作为候选子池 $\mathcal{P}^{(t)}_{\mathrm{sub}}$。

### 2.3 增强策略
沿轨迹的增强决策是相互依赖的,因为早期操作重塑了中间表示,并限制了在后续就诊时有益的操作。我们按时间顺序逐次就诊做出这些决策,将该过程制定为用强化学习训练的序列决策问题。患者轨迹较短(中位数2-3次就诊),因此策略在检索到的模板上执行短视域、成本感知的路由,而不是长期规划。

#### 2.3.1 状态与操作
状态 $s_{t}$ 总结了到就诊 $t$ 为止的患者历史。设 $\mathbf{v}_{t}\in\mathbb{R}^{d}$ 是编码器在增强之前基于基础图对就诊 $V_{t}$ 的摘要(§2.4)。我们用一个GRU(Chung等,2014)压缩过去的就诊以形成 $s_{t}=\mathrm{GRU}(\mathbf{v}_{1:t-1})\oplus\mathbf{v}_{t}$,其中 $\oplus$ 表示拼接。离散操作空间由 $K$ 个模板-模式对加上一个单独的Skip操作组成,$\mathcal{O}^{(t)}=\big(\mathcal{P}^{(t)}_{\mathrm{sub}}\times\{0,1\}\big)\cup\{\mathrm{Skip}\}$。

相似文章

MiGHT-EHR:面向异质时序电子健康记录的多任务图变换器

arXiv cs.LG

本文介绍了MiGHT-EHR,一种针对异质时序EHR数据的多任务图变换器,联合建模临床实体、时间轨迹和任务依赖。在MIMIC-III和MIMIC-IV上,它在药物推荐、住院时长、死亡率和再入院预测方面均优于现有最先进方法。

将结构化生物医学知识注入语言模型:持续预训练与GraphRAG对比

arXiv cs.CL

# 将结构化生物医学知识注入语言模型:持续预训练与GraphRAG 来源:[https://arxiv.org/html/2604.16422](https://arxiv.org/html/2604.16422) ###### 摘要 将领域特定知识注入模型对于使语言模型(LMs)适应生物医学等专业领域至关重要。尽管目前大多数方法依赖于非结构化文本语料库,但本研究探讨了两种利用UMLS元术语表(Metathesaurus)中结构化知识的互补策略: