PiPMRE:基于语言模型的医学关系提取管道
摘要
PiPMRE是一种用于医学关系提取的新型管道框架,它使用关系生成器和过滤器来增强性能,在公共数据集上超越了先前的最先进方法。
arXiv:2609.02896v1 公告类型:新
摘要:医学关系提取(MRE)通常指从医学文本中联合提取实体及其关系,近年来受到了相当大的关注。先前的研究将MRE视为序列标注任务,这导致要么标注方案设计具有挑战性,要么由于医学实体之间复杂的关係而无法提取多个关系。在这项工作中,我们从语言学角度回顾了该任务,并提出了一种新的管道框架PiPMRE,该框架基于语言模型开发,以增强MRE性能。具体来说,PiPMRE由关系生成器和关系过滤器组成。给定一段文本,生成器首先生成多个关系三元组,然后过滤器对每个三元组进行评分,并仅保留通过阈值的三元组作为最终结果。实现PiPMRE不需要标注方案;相反,我们使用一个简单的模板来重新表述输入文本,确保实体和关系在上下文中按顺序生成。在两个公共数据集上的大量实验结果证明了PiPMRE的先进性。它平均提高了5.6个百分点的召回率和4.4个百分点的准确率,超越了先前的最先进方法。PiPMRE的优势在少样本设置中也得到了体现。
查看缓存全文
缓存时间: 2026/09/04 05:51
# PiPMRE:基于语言模型的医学关系抽取管道
来源:https://arxiv.org/html/2609.02896
段嘉欣 \(duanjx@stu\.pku\.edu\.cn\)
北京大学软件与微电子学院,北京,中国
卢丰宇 \(fengyul@stu\.pku\.edu\.cn\)
北京大学软件与微电子学院,北京,中国
刘俊飞 \(liujunfei@pku\.edu\.cn\)
北京大学软件与微电子学院,北京,中国
###### 摘要
医学关系抽取(MRE)旨在从医学文本中联合抽取实体及其关系,近年来受到了广泛关注。先前的研究将MRE视为序列标注任务,这导致要么标注方案设计困难,要么由于医学实体间复杂的关系而无法有效抽取多重关系。本文从语言学视角重新审视该任务,并提出了一个新颖的管道框架PiPMRE,该框架基于语言模型构建,旨在提升MRE性能。具体而言,PiPMRE由关系生成器和关系过滤器组成。给定一段文本,生成器首先生成多个关系三元组,然后过滤器对每个三元组进行评分,并仅保留超过阈值的结果作为最终输出。实现PiPMRE无需设计标注方案;相反,我们使用一个简单的模板对输入文本进行重构,同时确保实体和关系按上下文顺序生成。在两个公开数据集上的大量实验结果证明了PiPMRE的先进性。它在平均召回率和准确率上分别超越了先前最优方法5.6和4.4个百分点。PiPMRE的优越性在少样本设置中也得到了体现。
关键词:医学关系抽取;信息抽取;预训练语言模型;
9999脚注:预印本:本工作已被第47届认知科学协会年会论文集接受。
## 引言
医学关系抽取(MRE)旨在从非结构化的医学文本中联合抽取配对实体及其关系,形成格式如<>\((?, ?, ?)\)的关系三元组。这是构建知识密集型应用的基础步骤,例如医学对话系统(?, ?)、医学知识图谱补全(?, ?)、医学问答(?, ?)等,并且近年来受到了越来越多的关注。现有的MRE方法主要分为两类,将任务视为序列标注或序列到序列(Seq2Seq)标注问题。如图1所示(https://arxiv.org/html/2609.02896#Sx1.F1),序列标注方法(?, ?, ?, ?, ?)主要致力于标注方案的设计。在基础性工作(?, ?)中,研究人员模仿命名实体识别(NER)(?, ?)中使用的BIEO表示法,提出了BIEO-R-SO标注方案,其中标签表示实体间关系中主题/客体实体的开始/内部/结束标记。随后,? (?) 利用多组二进制序列标注重叠关系,而? (?) 则引入二叉树来标注医学文本中的树形关系结构。由于序列标注是机器学习社区长期研究的主题,这类方法得益于重用成熟的技术。然而,将模型预测的标签映射到关系三元组十分复杂,并且如何标注医学领域中数量庞大且错综复杂的术语和关系仍是一个未解决的问题。Seq2Seq方法(?, ?, ?)则学习在给定文本条件下生成线性化的关系三元组,其中主题、客体和关系按其在上下文中的位置排序。这些方法因避免了繁琐的标注工作而有所发展,但由于目标序列长度不确定(?, ?),它们在多重关系抽取方面受到限制。
参考标题图1:不同风格MRE方法的对比。第四行展示了(?, ?)中提出的标注方案,第六行展示了(?, ?)中的线性化关系三元组,最后一行展示了三元组文本化的一个示例。PC:病理分类。
在开放领域,近期提出的方法聚焦于预训练语言模型(PLMs)(?, ?, ?),并将关系抽取(RE)转化为一个基础的语言学问题,以促进激发PLM的参数知识。? (?) 将RE转化为掩码语言建模,? (?) 将RE转化为文本去噪,而? (?, ?) 则将RE转化为结构化抽取语言的生成。然而,尽管它们在短句语境中具有优势,但先前很少有研究探索它们在更复杂场景(尤其是在MRE中)的潜力。
在本文中,我们提出了PiPMRE,一种新颖的基于PLM的管道框架,旨在提升当前MRE的性能。具体而言,PiPMRE由一个关系生成器和一个关系过滤器组成。生成器由一个经过Seq2Seq文本填充(?, ?)预训练的Transformer模型驱动。为了匹配其预训练任务,我们重写了一个MRE实例(包括文本和关系三元组),将其转换为一个损坏的文本,并让生成器将关于实体和关系的损坏部分恢复为另一种格式化的文本。当管道运行时,生成器通过束搜索(?, ?)输出一组此类文本,然后过滤器对每个文本进行评分并与阈值ζ进行比较。得分高于阈值的文本被接受并映射回最终的关系三元组。因此,PiPMRE不仅可以将未知数量的关系抽取为固定长度的文本,还能利用大多数先前研究中丢弃的语义信息。超越结构主义,我们在两个连续阶段学习生成器:首先通过增量跨领域预训练向模型注入医学知识,然后通过偏好优化(?, ?)针对我们重构的MRE任务进一步微调它。我们还遵循对比学习(?, ?),使用成对边界损失训练过滤器,确保它理解阈值评分的含义。通过这种生成-过滤的工作流程和各组件的独立学习,PiPMRE能够自适应地为给定的医学文本决定多个关系三元组,无需设计复杂的标注方案或担心三元组重叠。
我们的主要贡献如下:
- • 我们为MRE提出了一种新颖的管道方法,该方法在多重关系抽取以及知识和语义感知方面均优于先前方法。
- • 我们分别为PiPMRE的生成器和过滤器设计了定制的学习范式。
- • 在两个公开MRE数据集上的大量实验结果表明,PiPMRE在全数据和少样本设置中均显著优于先前方法。我们还进行了消融研究,以测试影响PiPMRE性能的关键因素。
## 方法论
### 任务形式化
给定一个MRE数据集\(\mathcal{D}=\{\mathcal{X},\mathcal{T},\mathcal{E}\}\),其中第\(i\)个实例是一个文本(或句子)\(x_{i}\in\mathcal{X}\),包含\(n_{i}\)个医学实体\(e_{1},e_{2},\cdots,e_{n_{i}}\in\mathcal{E}\),且第\(j\)对实体\(e_{j}^{s},e_{j}^{o}\)具有\(m_{j}\)个关系\(r_{1},r_{2},\cdots,r_{m_{j}}\in\mathcal{T}\),则MRE的任务是从\(x_{i}\)中抽取所有三元组\((e_{j}^{s},e_{j}^{o},r_{k})\),其中\(i\in(0,|\mathcal{D}|),j\in(0,n_{i}),k\in(0,m_{j})\)。
数学上,这等价于建模以下求和条件概率:
\(\sum_{i=1}^{|\mathcal{D}|}\sum_{j=1}^{n_{i}}\sum_{k=1}^{m_{j}}\mathrm{P}((e_{j}^{s},e_{j}^{o},r_{k})|x_{i}).\)\((1)\)
在解决此问题时,我们不像工作(?, ?)那样枚举所有可能的三元组(这既琐碎又耗费内存);同时,我们也放弃将三元组线性化为单词序列(?, ?),因为其长度因实例而异。相反,我们将一个实例文本化为自然语言,然后损坏生成的实例,从而将MRE转换为一个易于用PLM处理的文本填充问题。
**三元组文本化**。我们使用一个简单的语言模式来表达MRE实例中涉及的关系三元组,其中实体类型也被考虑在内:
> The \{To\} \{Obj\} is the \{Rel\} of the \{Ts\} \{Sub\}.
在此模板中,\{Sub\}、\{Obj\}分别是主题和客体实体,\{Ts\}、\{To\}分别是主题和客体的类型,\{Rel\}是它们的关系,例如:
> <>→\\rightarrow 疾病 脑脊液循环 是 先天性脑积水 的 病理分类。
**实例重构**。然后我们将文本化的三元组附加到实例文本之后。因此,一个MRE实例被写成一个连贯的语言上下文,易于人类和语言模型理解,例如:
> 大多数先天性脑积水是非交通性脑积水,由脑脊液循环阻塞引起。疾病中的脑脊液循环是先天性脑积水的病理分类。
**实例损坏**。最后,我们在重构的实例中进行损坏。遵循(?, ?),我们将位于实体、实体类型和关系槽位的令牌跨度替换为不同的哨兵令牌,同时保持其余内容完整。一个处理后的实例如下模式:
> \{Text\}. The \[TO\] \[OBJ\] is the \[R\] of the \[TS\] \[SUB\]
其中\[OBJ\]、\[SUB\]、\[TO\]、\[TS\]和\[R\]是哨兵令牌。
基于以上基础,我们将MRE视为Seq2Seq文本填充,它在损坏的实例\(\tilde{x}\)条件下预测一组根据哨兵令牌指示的缺失槽位\(y\)。\(y\)是一个结构化的文本,由五个槽位及其在\(\tilde{x}\)中的上下文顺序组成:
> \[TO\] \{To\} \[OBJ\] \{Obj\} \[R\] \{Rel\} \[TS\] \{Ts\} \[SUB\] \{Sub\}
参考标题图2:我们的PiPMRE概述。\(\{\cdot\}\)定位待填充的槽位,\([\cdots]\)是特殊令牌,\[E\]被添加到文本末尾。
### 关系生成器
我们从T5(?, ?)开始构建PiPMRE的生成器——这是一个经过Seq2Seq文本填充预训练的Transformer模型,在抽取式语言任务上展现出显著能力。此外,我们执行增量跨领域预训练(ICPT)以向模型注入医学知识,然后根据我们的任务需求对其进行微调。
**增量预训练**。给定医学知识图谱\(\mathcal{G}\)中的一个实体\(e\),其*邻居*包括通过直接关系与\(e\)相连的实体,以及通过二跳关系与\(e\)相连的*间接邻居*\(\bar{\mathcal{E}}_{i}\)。基于此假设,可以轻松创建一个包含医学知识的语料库。对于\(\mathcal{G}\)中的每个\(e_{i}\),我们要求Llama3.1(?, ?)基于其一个邻居\(\bar{e}_{i}\)和一个间接邻居\(\tilde{e}_{i}\),通过以下提示生成一个句子:
> 考虑到\(\bar{e}_{i}\)是\(e_{i}\)的\(r_{1}\),且\(\tilde{e}_{i}\)是\(e_{i}\)的\(r_{2}\),请使用\(e_{i}\)、\(\bar{e}_{i}\)和\(\tilde{e}_{i}\)造一个句子。
我们以0.8的概率掩盖实体令牌,以0.2的概率掩盖其他令牌。然后,我们训练生成器在目标端恢复原始文本。在本工作中,我们使用CMeKG†††http://cmekg\.pcl\.ac\.cn/构建预训练语料库,该语料库广泛覆盖6,310种疾病、19,853种药物、1,237种诊疗技术以及超过30种常见关系。最终语料库包含269,930个句子,训练过程使用监督交叉熵损失。
**微调**。在微调期间,最大的挑战是保留预训练知识。得益于提示调优(?, ?)技术(在微调PLM时冻结所有预训练参数),此问题得到了极大缓解。注意生成器接收一个损坏的实例\(\tilde{x}\),目标是输出目标文本\(y\),其中包含\(\tilde{x}\)中缺失的槽位,并由哨兵令牌连接。它对以下概率进行建模:
\(P(y|\tilde{x};\theta)=\prod_{t=1}^{|y|}P(y_{t}|\tilde{x},y_{<t};\theta).\)
### 关系过滤器
关系过滤器旨在评估每个生成的文本是否正确。由于生成的文本是由槽位组成的自然语言,我们设计一个模板提示,要求过滤器判断这些槽位是否能形成一个属于原文的有效关系三元组。具体而言,我们使用以下模板对每个生成的文本进行格式化:
> \{Text\}. The \{Obj\} \[M\] \(is or isn't\) the \{Rel\} of the \{Sub\}\.
可以看到,我们在\(y^{*}\)中舍弃了实体类型槽位(在我们的初步实验证明其影响可忽略不计),并要求过滤器预测掩码令牌\[M\]是“是”还是“不是”。实际上,过滤器建模的是概率\(\mathrm{P}(\cdot|T[x,y^{*}])\),其中\(T[\cdot,\cdot]\)表示模板填充,而不是在给定的两个词之间做出绝对的二元选择。为了弥合这一差距,我们锐化过滤器的输出分布:
\(\mathrm{\hat{P}}(v_{i}|T[x,y^{*}])=\frac{\exp\left(\bar{v}_{i}/\tau\right)}{\sum_{k}^{N}\exp\left(\bar{v}_{k}/\tau\right)},\)\((7)\)
其中\(\tau<1\)是一个温度参数,\(\bar{v}_{i}\)是过滤器倒数第二层对应于词\(v_{i}\)的输出。
进一步,我们令\(f(x,y^{*})=\mathrm{\hat{P}}(is|T[x,y^{*}])\)量化使用\(y^{*}\)中的实体和关系槽位\(\{Sub\}^{*},\{Rel\}^{*},\{Obj\}^{*}\)来组合一个属于\(x\)的正确关系三元组的置信度。
基于以上描述,我们学习过滤器以根据生成器输出的有效性提供合理的评分。
输入一个实例\(x\),生成器的输出文本要么由黄金关系三元组中的元素组成,要么不是。我们将前者收集到\(\mathcal{T}_{x}^{+}\),后者收集到\(\mathcal{T}_{x}^{-}\)。直观地说,一个负例\(y_{i}^{-}\in\mathcal{T}_{x}^{-}\)可以通过用随机令牌或与实体/关系/实体类型相关的同类令牌替换\(y_{i}^{+}\in\mathcal{T}_{x}^{+}\)中的一个或多个槽位来轻松构造。
我们使用完形填空调优方法训练过滤器,即在过滤器输入文本的\{Text\}槽位后插入可学习的软令牌\(t_{1},t_{2},\cdots,t_{m}\)(具有可学习嵌入\(\psi\)),同时受对比学习(?, ?)启发,使用成对边界损失\(\mathcal{L}_{ctl}(\psi)\):
\(\sum_{i=1}^{|\mathcal{T}_{x}^{+}|}\max\left(\zeta-f_{\psi}(x,y_{i}^{+}),0\right)+\max\left(f_{\psi}(x,y_{i}^{-})-\zeta,0\right).\)
值得注意的是,\(\mathcal{T}_{x}^{-}\)在训练期间从\(\mathcal{T}_{x}^{+}\)动态导出,取决于实例\(x\),因此两个集合大小相同。\(\zeta\)是一个边界参数。
### 管道推理
PiPMRE的推理过程如图2所示(https://arxiv.org/html/2609.02896#Sx2.F2)。从模板化的实例开始,生成器首先产生一组候选输出,然后过滤器对每个输出进行评分并与边界\(\zeta\)比较以决定其正确性。
**调制解码**。由于自回归生成的随机性,生成的目标文本中的每个令牌都从生成器词汇表中条件采样,这可能导致生成无法匹配任何关系三元组的无效槽位。为了解决这个问题,我们借鉴了(?, ?, ?)的思想,并提出了一种*调制解码*机制。给定编码器的损坏实例\(\tilde{x}^{*}\)和解码器的起始令牌\[TO\],生成器采用束搜索(BS)(?, ?)来采样\(K\)个候选目标文本\(y_{1}^{*},y_{2}^{*},\cdots,y_{K}^{*}\)。对于每个候选文本,我们应用模板填充生成提示\(T[x,y_{k}^{*}]\),并使用过滤器计算其得分\(f_{\psi}(x,y_{k}^{*})\)。然后,我们选择得分最高的文本作为生成器的最终输出\(y\)。这种调制解码过程确保了生成的文本具有较高的正确性概率。
**流程**。给定一个输入文本\(x\),管道执行以下步骤:
1. **三元组文本化**:使用模板将潜在的关系三元组转换为自然语言描述。
2. **实例重构**:将文本化的三元组附加到原始文本,形成连贯的上下文。
3. **实例损坏**:使用哨兵令牌替换实体、类型和关系槽位,创建损坏的文本。
4. **关系生成**:生成器基于损坏的文本生成多个候选关系描述。
5. **关系过滤**:过滤器对每个候选描述进行评分,并选择得分最高的作为最终输出。
6. **三元组提取**:从最终输出的文本中提取关系三元组。
这种流程使PiPMRE能够自适应地处理复杂的医学关系抽取任务,无需预先定义复杂的标注方案或担心关系重叠问题。相似文章
基于大语言模型的少样本生物医学关系抽取:监督学习的可行替代方案?
本文研究了使用基于提示学习的大语言模型进行少样本生物医学关系抽取,比较了配对分类和联合生成两种方法。最佳模型实现了0.44的微F1值,显著优于此前的少样本结果,但仍低于监督基线。在宏F1值上,基于提示的方法在稀有关系类型上超越了监督基线,达到了0.45比0.38。
MedPMC:一种为基础模型扩展高保真医疗多模态数据的系统框架
MedPMC是一个自动化框架,将医学文献转化为用于基础模型的高保真多模态数据,在多个基准测试和临床场景中取得了显著改进。
ReaORE:大型推理模型驱动的推理引导渐进式开放关系抽取
提出了ReaORE,一个基于推理引导的开放关系抽取框架,通过从粗到细的推理逐步过滤和预测关系,在两个数据集上优于现有基线。
GLiNER-Relex:联合命名实体识别与关系提取的统一框架
GLiNER-Relex 是一个用于联合命名实体识别(NER)与关系提取(RE)的统一框架,利用共享的 Transformer 编码器实现零样本能力。该论文展示了模型在标准基准测试中具有竞争力的性能,并将其作为开源 Python 包发布。
用于模式约束临床信息抽取的检索增强型大语言模型
本文提出了一种模块化的检索增强生成(RAG)流水线,用于从护理人员与患者的对话转录中提取结构化临床观察结果,采用模式约束提示和第二遍审核,基于Llama和GPT骨干模型,取得了80.36%的F1分数。