用于药物重定位候选物实用筛选的预训练医学表示

arXiv cs.LG 论文

摘要

本文提出了一种新的统一预训练框架,用于医学代码序列,能够捕获层次结构和复杂交互,并在临床事件预测和阿尔茨海默病的药物重定位案例研究中展示了优越的性能。

arXiv:2609.19865v1 公告类型:新 摘要:从电子健康记录和医疗索赔数据中的医学代码序列进行表示学习已在各种临床应用中取得成功,例如与疾病预测相关的应用。然而,将这种方法扩展到科学假说的发现仍存在重大挑战。一个原因是许多现有的基于BERT的模型未能充分捕获医学代码的层次结构以及诊断和治疗之间的复杂交互。为了解决这些限制,我们提出了一种新的统一预训练框架,显式地整合了层次子令牌聚合、部分掩码和交叉引用机制。所提出的模型在预训练目标和下游临床事件预测任务(包括痴呆发作和住院)上始终优于现有方法。我们还针对阿尔茨海默病进行了一项计算药物重定位案例研究。在假说生成步骤中,我们的方法以数据驱动的方式成功重新发现了已知的有前景的药物,而不依赖于文献等外部知识源。随后,在假说优先排序步骤中,我们引入了一种任务自适应表示方法,以减轻诊断向量中历史处方信息的过度编码,从而实现生成假说的稳健优先排序。本研究建立了一种基于观察关联的假说生成和优先排序的探索性筛选工作流程。重要的是,该框架并非旨在提供因果证据,而是旨在识别有前景的候选物以供后续严格的因果推断。总体而言,本研究表明,领域知情的表示学习与任务自适应表示控制相结合,可以实现一个实用的假说发现工作流程。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:08

# 用于药物重定位候选物实用筛查的预训练医疗表征
来源:https://arxiv.org/html/2609.19865
藤冈 悠平、舛�的 大太郎  
所属:Cancerscan Inc.,日本东京  
福�的 慎吾  
所属:京都大学,医学研究生院,日本京都  
所属:广岛大学,生物医学与健康科学研究生院,日本广岛

###### 摘要
从电子健康记录和医疗理赔数据中的医疗编码序列中学习表征,已在各种临床应用中取得成功,例如疾病预测。然而,将这种方法扩展到科学假设的发现仍存在重大挑战。一个原因是,许多现有的基于BERT的模型未能充分捕捉医疗编码的层级结构以及诊断和治疗之间的复杂交互。为了解决这些局限性,我们提出了一种新的统一预训练框架,该框架显式地整合了层级子词聚合、部分掩码和交叉引用机制。所提出的模型在预训练目标和下游临床事件预测任务(包括痴呆症发病和住院)上均持续优于现有方法。我们还进行了一项针对阿尔茨海默病的计算机模拟药物重定位案例研究。在假设生成步骤中,我们的方法无需依赖文献等外部知识源,以数据驱动的方式成功地重新发现了已知的有前景的药物(例如,匹伐他汀)。随后,在假设优先排序步骤中,我们引入了一种任务自适应表征方法,以减轻诊断向量中对历史处方信息的过度编码,从而实现对生成假设的稳健优先排序。本研究建立了一个基于观察性关联的假设生成与优先排序的探索性筛查工作流。重要的是,该框架并非旨在提供因果证据,而是为后续严格的因果推断识别有前景的候选物。总体而言,本研究表明,结合任务自适应表征控制的领域知情表征学习可以超越单一应用领域,实现一个实用的假设发现工作流。

###### 关键词:表征学习,医疗健康,药物重定位,自监督学习,假设生成

## 1 引言
### 1.1 背景
医疗理赔数据和电子健康记录中的医疗编码,如诊断、手术操作和处方药物,构成了丰富的临床信息来源。利用这些数据的机器学习方法已应用于各种医疗任务,包括疾病预测(Razavian et al., 2015 (https://arxiv.org/html/2609.19865#bib.bib19);Walsh et al., 2019 (https://arxiv.org/html/2609.19865#bib.bib26))、药物推荐(Shang et al., 2019 (https://arxiv.org/html/2609.19865#bib.bib21))和药物重定位(Zang et al., 2023 (https://arxiv.org/html/2609.19865#bib.bib29);Lee et al., 2025 (https://arxiv.org/html/2609.19865#bib.bib10))。最近,将BERT(Devlin et al., 2019 (https://arxiv.org/html/2609.19865#bib.bib4))应用于结构化医疗编码序列的兴趣日益增长。然而,直接采用标准BERT预训练方法面临几个挑战。首先,它常常无法捕捉医疗编码系统(例如ICD-10)固有的层级结构,以及诊断与治疗(手术操作和处方药物)之间的复杂关系(Fujioka et al., 2024 (https://arxiv.org/html/2609.19865#bib.bib6))。其次,标准的掩码语言建模对于细粒度的医疗编码效率低下。例如,仅糖尿病一个类别中就有大约50个不同的编码。要求模型预测如此具体的编码既增加了训练难度,又降低了泛化能力。因此,以往的研究未能充分解决这些挑战,从而未能有效利用医疗编码数据中包含的信息。

### 1.2 任务定义
我们使用医疗理赔数据和人口统计信息开发了一个表征学习模型,并通过三个任务评估其泛化能力和在假设发现中的应用潜力:(i)一个预训练任务,模型通过预测被掩码语言建模的目标诊断子词来学习表征;(ii)用于痴呆症发病和住院的临床事件预测任务,以评估泛化能力;(iii)一个药物重定位任务,使用预训练模型生成的向量表征,选择显示出与阿尔茨海默病(AD)保护性关联的候选药物(假设生成),并基于信号稳健性对其进行优先排序(假设优先排序)。

### 1.3 挑战
将标准BERT模型应用于医疗编码序列面临三大挑战:(i)缺乏层级信息建模,(ii)标准掩码语言建模对于细粒度医疗编码效率低下,以及(iii)缺乏诊断-治疗交互的显式建模范式。特别是,自注意力以统一方式处理诊断和治疗,这有可能模糊临床上重要的关系。此外,编码丰富临床信息的表征与适合假设筛查或确认性推断的表征之间存在张力。编码了历史处方信息的表征可以通过利用丰富的临床信息来增强信号检测(假设生成),但在基于倾向性评分等验证性分析中,却会损害其稳健性。

### 1.4 贡献
本研究通过显式考虑医疗编码序列特征的表征学习方法,做出了四项主要贡献:(i)我们提出了一种新的统一预训练框架,该框架整合了层级子词聚合以描绘医疗编码的层级结构、部分掩码以提高训练效率,以及交叉引用机制以建模诊断-治疗交互,从而提高了表征质量;(ii)我们证明了所提出的模型在临床事件预测任务中的有效性,在预测痴呆症发病和住院方面取得了优于现有基准的性能;(iii)我们展示了预训练表征能够通过重新发现有前景的AD候选药物(例如,匹伐他汀)来实现数据驱动的假设生成,而无需依赖文献等外部知识源;(iv)我们引入了一种任务自适应表征方法,该方法解决了面向检测和面向验证的表征之间的张力,实现了稳健的假设优先排序,并在昂贵的因果推断之前建立了一个有效的筛查工作流。

## 2 相关工作
Shang等人(Shang et al., 2019 (https://arxiv.org/html/2609.19865#bib.bib21))证明,利用图神经网络学习医疗编码的层级结构可以提高药物推荐模型的性能。我们通过Transformer架构内的层级子词聚合将这一见解纳入了我们的模型。现有的预训练模型,如BEHRT(Li et al., 2020 (https://arxiv.org/html/2609.19865#bib.bib11))、MED-BERT(Rasmy et al., 2021 (https://arxiv.org/html/2609.19865#bib.bib18))和ExBEHRT(Rupp et al., 2023 (https://arxiv.org/html/2609.19865#bib.bib20)),在医疗编码序列的表征学习方面取得了显著成功。然而,标准掩码语言建模对细粒度编码的低效性以及对诊断和治疗编码(手术操作和处方)之间复杂关系的建模问题仍然存在。最近,利用真实世界数据进行药物重定位受到了越来越多的关注(Zang et al., 2023 (https://arxiv.org/html/2609.19865#bib.bib29);Lee et al., 2025 (https://arxiv.org/html/2609.19865#bib.bib10))。虽然基于因果推断的方法很强大,但它们计算成本高昂,且难以扩展到大量候选药物。因此,在估计因果效应之前,对高效筛查方法以识别有前景候选物的需求日益增长。本研究提出了一个利用预训练学到的表征的药物重定位实用筛查框架,以降低整体分析成本。

## 3 方法
图1:我们提出的架构和方法概述。
### 3.1 预训练
图1(https://arxiv.org/html/2609.19865#S3.F1)展示了所提出方法的概述。
#### 3.1.1 层级子词聚合
为了利用医疗词元的层级结构,我们将每个词元划分为五个子词。每个子词被嵌入到一个向量表征中。模型使用Transformer编码器学习利用这五个子词之间的层级关系。
#### 3.1.2 部分掩码
从每个序列中随机选择15%的词元作为掩码语言建模的目标。如果序列过短且未选中任何词元,则随机选择一个词元以确保至少有一个掩码语言建模目标。然后,每个选定的词元根据其层级结构被分解为五个子词。对于这些子词,应用以下三种操作之一:部分掩码、完全掩码或不变,相应概率分别为80%、10%和10%。在部分掩码中,保留第一个子词,而第二至第五个子词被掩码。在完全掩码中,所有五个子词均被掩码。在不变的情况下,所有子词保持不变。模型被训练来预测第三个子词,它对应于层级的中层。现有的基准模型遵循标准的BERT掩码策略。掩码策略的概述见附录A(https://arxiv.org/html/2609.19865#A1)。

### 3.2 模型
#### 3.2.1 我们的预训练模型
我们的预训练模型旨在同时解决医疗词元的层级结构以及诊断和治疗之间的复杂关系问题。模型架构(图1 (https://arxiv.org/html/2609.19865#S3.F1))由五个模块组成,旨在处理月度医疗理赔和保险资格数据(每个模块的详细描述见附录B (https://arxiv.org/html/2609.19865#A2))。
(i)嵌入模块:每个医疗词元(诊断、手术操作和处方)根据其层级结构被分解为五个子词,每个子词然后被嵌入到向量中。性别词元以相同方式嵌入,而年龄通过单个线性层转换为向量。
(ii)医疗编码表征模块:对于每种类型的医疗子词序列,分别应用独立的Transformer编码器来执行层级子词聚合。每个子词表征利用自身及其所属医疗词元内相邻子词的信息进行更新。属于同一词元的更新后的子词表征随后被求和,形成诊断、手术操作和处方词元序列。对于诊断序列,性别和年龄向量被添加到每个表征中。
(iii)Transformer编码器模块:手术操作和处方词元向量被连接以形成治疗向量。然后,诊断和治疗序列由独立的Transformer编码器分别处理。
(iv)交叉引用模块:一种双向交叉注意力机制捕捉诊断和治疗之间的结构化交互,并精炼它们的向量表征。
(v)预测头:模型基于交叉引用模块中诊断词元最终隐状态的输出,预测被掩码语言建模的目标诊断子词。
#### 3.2.2 我们的微调模型
为了评估预训练表征的质量和泛化能力,我们开发了一个用于下游临床事件预测任务的微调模型,包括痴呆症发病和住院。模型的详细描述见附录C.1 (https://arxiv.org/html/2609.19865#A3.SS1)。

### 3.3 基准模型
我们将我们的方法与四个基线模型进行了比较:(i)BEHRT和(ii)MED-BERT,它们是基于自注意力的医疗编码序列代表性模型;(iii)我们的仅自注意力模型(Our (SA)),一个消融模型,旨在通过采用我们提出的方法(HSA和PM)在标准自注意力架构内,评估交叉引用机制的有效性;以及(iv)轻型梯度提升机(LGBM)(Ke et al., 2017 (https://arxiv.org/html/2609.19865#bib.bib9)),一个使用表格输入特征的梯度提升框架。详细的架构和输入配置见附录D (https://arxiv.org/html/2609.19865#A4)和E (https://arxiv.org/html/2609.19865#A5)。

### 3.4 任务自适应表征方法
任务自适应表征方法是一种推理时的表征控制策略,旨在解决诊断表征在假设生成和优先排序中适用性不同的问题。如1.3节(https://arxiv.org/html/2609.19865#S1.SS3)所述,包含了治疗历史的诊断表征对于生成反映更广泛临床背景的AD风险档案非常有用,因此对假设生成很重要。然而,在假设优先排序期间,这种表征可能会过度编码处方分配的倾向,从而可能以不利的方式影响倾向性评分估计和后续的优先排序分析。任务自适应表征方法通过基于分析阶段(即,候选药物选择或优先排序选定候选物)控制输入词元来解决这个问题。具体来说,在用于假设优先排序的表征推理过程中,当生成诊断向量时,对应于目标药物及其在同一解剖学治疗化学分类系统第二级内的相关药物的处方词元会被掩码。这种对向量表征的控制减少了对目标药物及其药理学邻近药物历史处方信息的获取,从而提高了处方组和对照组之间倾向性评分分布的重叠度。

### 3.5 药物重定位流程
我们利用真实世界数据设计了一个用于AD的药物重定位分析框架。
#### 3.5.1 时序观察性研究设计
我们的药物重定位分析遵循时序观察性设计。具体而言,使用2017年1月至12月的理赔数据,从预训练模型中提取诊断向量;这些向量用作估计预后评分(AD发病风险)和倾向性评分的协变量。2018年1月至12月的期间被定义为暴露评估窗口。对于每种药物,规律处方状态定义为在此期间至少六个月的月度理赔中有处方记录,并且这种特定药物的处方状态用作暴露指标。随访期从2019年1月至2020年12月,在此期间使用ICD-10代码F00和G30评估AD发病的发生。
#### 3.5.2 候选药物选择
通过两阶段程序选择AD预防的候选药物。
(i)基于预后评分的风险匹配

相似文章

基于患者感知采样的电子健康记录基础模型预训练

arXiv cs.LG

提出了患者采样方法,这是一种用于电子健康记录基础模型的预训练序列构建方法,在MIMIC-IV数据集上相比标准全局流基线提升了下游任务性能,强调了序列构建在自回归健康模型中的重要性。

基于LLM探针的主要ICD类别预测

arXiv cs.AI

本文提出了一种方法,利用冻结的医学大型语言模型(LLM)表示作为共享嵌入空间,从结构化和非结构化电子健康记录数据中预测主要ICD诊断类别,在MIMIC-IV上取得了优于基线方法的准确率,并展示了向MIMIC-III的迁移能力。