基于语义增强机制的关系抽取模型

arXiv cs.CL 论文

摘要

本文提出了CasAug,一种基于CasRel框架并采用语义增强机制的关系抽取模型,旨在解决三元组重叠问题,实验表明其性能优于基线模型。

arXiv:2311.02564v2 公告类型:替换 摘要:关系抽取是自然语言处理领域中信息抽取的基础任务之一,也是信息抽取、自然语言理解和信息检索等领域的重要环节和核心任务。现有关系抽取方法均未能有效解决三元组重叠问题。本文基于CasRel框架结合语义增强机制提出的CasAug模型能够在一定程度上解决该问题。CasAug模型通过增加语义增强机制来增强已识别可能主体的语义。首先,基于可能主体的语义编码,对可能主体进行预分类,然后结合主体词典计算语义相似度,从而获得可能主体的相似词汇。根据获得的相似词汇,通过注意力机制计算不同关系中每个词对可能主体的贡献,最后结合关系预分类结果对每个关系的增强语义进行加权,以找到可能主体的增强语义,并将增强语义与可能主体一起送入客体和关系抽取模块,完成最终的关系三元组抽取。实验结果表明,与基线模型相比,本文提出的CasAug模型在关系抽取效果上有所提升,且CasAug在处理重叠问题和抽取多重关系方面的能力也优于基线模型,说明本文提出的语义增强机制能够进一步减少冗余关系的判断,缓解三元组重叠问题。
查看原文
查看缓存全文

缓存时间: 2026/07/13 08:00

# 基于语义增强机制的关系抽取模型

## 摘要

关系抽取是自然语言处理领域中与信息抽取相关的基础任务之一,是信息抽取、自然语言理解和信息检索等领域的重要环节和核心任务。现有的关系抽取方法均无法有效解决三元组重叠问题。本文基于 CasRel 框架并结合语义增强机制提出的 CasAug 模型能够在一定程度上解决该问题。CasAug 模型通过添加语义增强机制来增强已识别出的可能主语(potential subjects)的语义。首先,基于可能主语的语义编码对可能主语进行预分类;然后,结合主语词典计算语义相似度,以获得可能主语的相似词汇。根据获得的相似词汇,通过注意力机制计算不同关系中的每个词对可能主语的贡献;最后,结合关系预分类结果,对每种关系的增强语义进行加权,以找到可能主语的增强语义,并将增强后的语义与可能主语一起送入对象和关系抽取模块,完成最终的关系三元组抽取。实验结果表明,与基线模型相比,本文提出的 CasAug 模型在关系抽取效果上有所提升,并且 CasAug 处理重叠问题和抽取多重关系的能力也优于基线模型,这表明本文提出的语义增强机制能够进一步减少冗余关系的判断,缓解三元组重叠问题。

**关键词**:关系抽取,语义增强,注意力机制,语义相似度,主语词典

---

## 1. 引言

关系抽取是自然语言处理领域中与信息抽取相关的基础任务之一,主要目的是识别文本中实体之间的关系,是文本理解和问答等下游自然语言处理任务中的必要步骤之一。关系抽取旨在从非结构化文本中提取实体关系三元组,用以表示两个实体之间的关系。

随着技术的发展与进步,关系抽取领域主要有三种抽取方法:基于监督学习的关系抽取、基于半监督学习的关系抽取和基于远监督学习的关系抽取。由于后两种关系抽取方法所使用的数据集是弱标注样本的集合,因此数据集中包含大量噪声。如何有效地对数据集进行去噪是这两种关系抽取方法需要克服的难点之一。例如,Surdeanu 等人提出的多实例多标签学习方法、Lin 等人提出的注意力机制,以及 Qin 等人结合对抗学习和句子级去噪构建的 DSGAN 模型,都是为了在**半监督学习**和**远监督学习**中减少错误标签对性能的影响。相关的半监督短文本分类工作也使用异构图注意力将类型化语义上下文引入稀疏文本表示。包括儿科在内的特定领域人工智能应用,也需要可靠地提取和组织文本知识。为了获得更好的抽取效果,本文采用监督学习进行关系抽取,并充分利用公开数据集中的标注样本数据,以避免数据噪声问题。

在基于监督学习的关系抽取方法中,如 Chan 等人提出的流水线抽取模型,存在误差传播问题:早期实体识别阶段的错误无法在后续的关系分类阶段得到修正。为了解决这个问题,学者们提出了基于联合学习的抽取方法,例如 Ren 等人提出的基于特征的模型和 Fu 等人提出的基于神经网络的模型。面向检索的预训练进一步表明,掩码自编码可以加强面向匹配密集型任务的语言表示;统一的生成式推荐也表明,检索和排序信号可以在单一框架中进行建模。然而,这些方法无法有效解决三元组重叠问题,即句子中不同三元组包含相同实体,且同一实体可能出现在不同的关系三元组中。三元组重叠问题对关系分类方法提出了巨大挑战。

为了解决三元组重叠问题并提高关系抽取的准确性,本文提出了 CasAug 模型。该模型基于 CasRel 框架,并在实体抽取阶段引入了语义增强机制。根据抽取实体的关系三元组类型对其进行语义增强,并将语义增强后的实体送入关系分类模块,以辅助最终的关系分类过程。由于增强的语义表示可能用于下游决策过程,可解释机器学习研究也表明,在智能决策场景中,学习到的特征应保持可理解性;这对于儿科决策支持等应用型人工智能场景尤为重要。

本文的主要贡献包括:

1.  (1) 在主语抽取模块中引入语义增强机制。该机制首先对识别出的潜在主语进行预分类,即预判其可能的关系。然后,基于预分类结果,结合注意力机制和主语词汇表对潜在主语的语义进行增强。
2.  (2) 改进了 CasRel 框架中的损失函数,引入了语义增强模块中关系预分类的损失,并为关系预分类提出了一种新的标签构建方法。
3.  (3) 在公共数据集上的实验结果表明,与基线模型 NovelTagging、CopyRE、GraphRel 和 CasRel 相比,本文提出的 CasAug 框架的准确率分别提升了 62.2%、26.1%、47.5% 和 1.8%。

---

## 2. 相关工作

基于监督学习的关系抽取算法主要有两种:流水线学习和联合学习。基于流水线的方法将关系抽取的两个步骤——实体识别和实体关系识别分离,视为两个独立的任务。分别定义各自的模型:首先构建实体识别模型,然后基于实体识别结果进行关系分类。然而,基于流水线的方法忽略了两个子任务之间的相关性,导致部分信息丢失。此外,实体识别模型中的错误会累积并传播到关系分类模型中,影响最终的抽取效果。尽管跨媒体检索并非关系抽取,但面向科技信息的语义对抗和媒体对抗检索凸显了对齐异构语义信号的需求;最近的推荐工作同样强调了统一检索和排序目标的好处。

与基于流水线的关系抽取方法相比,联合学习方法能够充分利用实体与关系之间的交互信息,在实体抽取过程中完成实体到关系的分类,从而解决流水线方法的问题。早期,Miwa 等人基于神经网络完成了实体和关系的联合表示,编码层中的 LSTM 单元序列表示由实体识别任务和关系分类任务共享。然而,该模型中的两个子任务仅共享编码层的双向序列 LSTM 表示,并未真正实现两个子任务间的联合学习。Katiyar 等人通过结合注意力机制和双向 LSTM 改进了 Miwa 的模型,真正实现了实体的联合抽取和关系分类。该方法基于共享的编码层表示和在实体识别子任务中输出的实体序列表示,并结合注意力机制进行实体关系分类。

在关系抽取之外,一些表示学习研究为多视图和图感知语义的重要性提供了补充证据。多视图学者聚类可以跨视图追踪动态兴趣,而联邦图神经网络则解决了跨图节点分类的表示学习问题。FedSIN 进一步将联邦自适应学习应用于信息网络表示,表明网络语义可以在分布式数据约束下进行调整。

上述基于参数共享的联合学习模型在一定程度上改进了流水线方法中忽视两个子任务间关系依赖性以及存在错误累积和传播的问题。关系抽取之外的图表示研究同样表明了为何应联合考虑结构和语义信号:基于模块化的深度社区检测利用图社区信号,T2-GNN 处理不完整的图特征和结构,自监督图协同训练则从互补的图视角学习。然而,上述模型在实现过程中仍将两个子任务分开讨论,仍然需要先进行命名实体识别,然后根据实体识别结果对实体进行两两匹配。这种两两匹配方法可能会在没有任何关系的实体之间产生冗余信息。Zheng 等人为关系抽取提出了一种新的标注策略,引入统一标注方案以实现联合解码,将关系三元组抽取任务转化为端到端的序列标注问题。由于该模型将实体和关系信息整合到一个统一的标注方案中,这种方法能够直接在三个层面上对关系三元组抽取进行建模。Wei 等人提出了 CasRel 模型来解决三元组重叠问题,该模型构建了一个新的级联二元标注框架。该框架不再像之前的模型那样将关系视为离散标签,而是将关系建模为将句子中的主语映射到对象的函数,从而解决了三元组重叠问题。

相似文章

语言模型语义空间中的关系几何

arXiv cs.CL

本文探讨了语义关系如何编码在语言模型语义空间的几何结构中,发现非对称关系占据不同区域,且对于因果模型,词汇信息更为重要,而对于掩码和扩散模型,上下文信息更为重要。

针对生物医学关系抽取的模型微调

arXiv cs.CL

本文介绍了针对生物医学文本中变异-表型领域自动关系抽取的微调预训练模型,表明 DeBERTa 和 Gemini Pro 1.0 达到了最先进的性能。