基于本体的文档级关系提取结构化正则化方法

arXiv cs.CL 论文

摘要

本文提出了一种本体驱动的框架,用于量化并强制执行文档级关系提取数据集中的结构一致性,减少逻辑矛盾,并在使用远程监督数据时提高模型泛化能力。

arXiv:2608.20856v1 公告类型:新 摘要:文档级关系提取(DocRE)严重依赖昂贵的手工标注数据集,而像 DocRED distant 这样的大规模远程监督资源由于噪声问题尚未得到充分利用。我们发现,一个关键但被忽视的噪声来源在于关系三元组内的结构不一致性,包括违反本体约束和逻辑矛盾。 我们引入一种本体驱动的框架,用于量化并强制执行 DocRE 数据集中的结构一致性。我们的分析揭示了 DocRED distant 中存在大量结构噪声,并证明这些不一致性会传播到模型预测中。在训练期间强制执行结构良好性显著减少了逻辑矛盾,并一致地提高了泛化性能。这些发现确立了结构一致性作为 DocRE 中缺失的监督维度,并强调了结构正则化作为大规模利用远程数据的有效策略。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:27

# 本体驱动的文档级关系抽取结构正则化
来源: https://arxiv.org/html/2608.20856
Laura Menotti单位:意大利帕多瓦大学信息工程系\{name\.surname\}@unipd\.itStefano Marchesin单位:意大利帕多瓦大学信息工程系\{name\.surname\}@unipd\.itGianmaria Silvello单位:意大利帕多瓦大学信息工程系\{name\.surname\}@unipd\.it

###### 摘要

DocRE(文档级关系抽取)严重依赖昂贵的人工标注数据集,而*DocRED distant*等大规模远程监督资源由于噪声问题仍尚未得到充分利用。我们指出,一个关键但常被忽视的噪声来源在于关系三元组内部的结构不一致性,包括违反本体约束和逻辑矛盾。

我们引入了一个本体驱动的框架,用于量化并强制执行DocRE数据集中的结构一致性。我们的分析揭示了DocRED distant中存在大量结构噪声,并证明这种不一致性会传播到模型预测中。在训练过程中强制执行结构规范性显著减少了逻辑矛盾,并持续提升了泛化性能。这些发现将结构一致性确立为DocRE中一个缺失的监督维度,并突出了结构正则化作为大规模利用远程数据的有效策略。

## 1引言

DocRE(文档级关系抽取)旨在识别完整文档中实体对之间存在的所有语义关系。通过抽取关系三元组,DocRE能够构建知识图谱,为下游任务(如信息检索、问答、数据挖掘和推荐系统)提供结构化的、机器可读的知识4 (https://arxiv.org/html/2608.20856#bib.bib17)。因此,构建精确的知识图谱依赖于在高质量数据上训练出可靠的DocRE模型。

通用领域DocRE的参考基准是DocRED22 (https://arxiv.org/html/2608.20856#bib.bib2),它构建自维基百科文章。DocRED包含人工标注的数据集和一个大规模的远程监督数据集。人工标注部分遵循推荐-修订范式,包含5,053篇文档,分为3,053篇训练文档,以及开发集和测试集各1,000篇。相比之下,DocRED distant数据集包含101,873篇文档,通过远程监督(DS)进行标注,方法是将Wikidata三元组与维基百科文本对齐,并利用基于BERT的命名实体标注。

尽管远程监督能够实现大规模数据构建15 (https://arxiv.org/html/2608.20856#bib.bib8),但它依赖于一个强假设:如果一个知识图谱断言两个实体之间存在某种关系,那么每篇提及该实体对的文档都应表达该关系。这一假设引入了大量噪声。在DocRE中,问题更为严重,因为文档中共同出现的实体比同一句子中共同出现的实体更不可能表达真实关系。因此,大多数最先进模型主要依赖人工标注数据,或仅将远程数据用于预训练或知识蒸馏19 (https://arxiv.org/html/2608.20856#bib.bib5)。

近期分析进一步揭示了即使在人工标注的部分也存在标注问题。特别是,原始DocRED标注中约65%的正向关系缺失5 (https://arxiv.org/html/2608.20856#bib.bib9),这导致了ReDocRED的发布,这是对训练集和开发集的修订版本20 (https://arxiv.org/html/2608.20856#bib.bib10)。尽管现有的去噪方法试图通过不确定性估计18 (https://arxiv.org/html/2608.20856#bib.bib6)或针对长尾关系的主动学习14 (https://arxiv.org/html/2608.20856#bib.bib12)来缓解远程监督噪声,但它们主要关注语义正确性和基于模型的伪标签细化。

与以模型为中心的去噪策略相反,我们采用*以数据为中心*的方法,专注于提升训练数据本身的质量。我们认为,除了语义噪声之外,DocRE数据集在抽取的三元组中存在*结构不一致性*,例如违反本体约束、缺失逆关系、非对称矛盾和基数冲突。111我们使用术语结构一致性来表示在本体施加约束下RDF三元组的规范性,而非完全的本体可满足性。这些不一致构成了一种先前被忽视的监督噪声来源,可能在模型训练过程中传播。

具体而言,我们利用OWL(Web本体语言)的形式语义,通过定义对实体类型和关系的显式结构约束来操作化结构一致性。我们的方法评估关系三元组在本体公理下的*规范性*,并量化了DocRED和ReDocRED中的结构违规,特别强调DocRED distant数据集。

我们表明,结构噪声在远程监督数据中比在人工标注数据中更为普遍。具体而言,与ReDocRED人工训练集相比,DocRED distant数据集中包含的无效三元组多出三倍,缺失的逆关系近五倍,非对称不一致性多出两倍。这些发现表明,结构不一致性构成了一种系统性的噪声来源,可能在训练过程中传播,损害模型学习和生成规范三元组的能力。为缓解此影响,我们引入了一个轻量级、与模型无关的*预处理流程*,在训练前强制执行结构一致性。该流程清洗并增强数据集,而不改变模型架构、损失函数或推理过程,确保与现有DocRE系统(无论是基于序列还是基于图)无缝集成。

我们证明,强制执行本体一致性起到了一种结构正则化的作用,提升了预测的一致性和泛化能力。我们的主要贡献是:(1) 我们提出了一个本体驱动的框架,利用OWL约束严格诊断DocRE数据集中的本体级结构一致性;(2) 我们首次深入定量研究了DocRED distant及其去噪变体中的结构不一致性,揭示了大量未被报告过的违规情况;(3) 我们证明,作为预处理步骤强制执行结构规范性,能显著减少模型预测中的逻辑矛盾,并持续提升最先进DocRE模型的泛化性能25 (https://arxiv.org/html/2608.20856#bib.bib4);11 (https://arxiv.org/html/2608.20856#bib.bib3)。

我们将完整的分析和清洗框架作为开源发布。222https://github.com/mntlra/DocRE-StructuralConsistency该工具包兼容任何采用DocRED格式的数据集,并包含我们开发的基于本体的规则,同时允许定义其他自定义约束。

本文其余部分组织如下。第2节 (https://arxiv.org/html/2608.20856#S2)回顾了关于远程去噪和约束关系抽取的先前工作。第3节 (https://arxiv.org/html/2608.20856#S3)定义了我们分析中使用的结构规则。第4节 (https://arxiv.org/html/2608.20856#S4)评估了DocRED和ReDocRED的结构一致性,并检验了无效三元组的主要成因。第5节 (https://arxiv.org/html/2608.20856#S5)研究了结构噪声在训练期间如何影响DocRE模型。最后,第6节 (https://arxiv.org/html/2608.20856#S6)总结全文。

## 2相关工作

远程监督通过将文本中的实体对与参考知识图谱中的三元组对齐,实现了大规模关系抽取15 (https://arxiv.org/html/2608.20856#bib.bib8)。尽管高效,但这种范式由于文本与知识图谱事实之间的启发式对齐而引入了噪声监督。

为了解决这个问题,许多工作为DocRE提出了去噪策略。21 (https://arxiv.org/html/2608.20856#bib.bib7)引入了一个多任务框架,结合了指称-实体匹配和事实对齐。18 (https://arxiv.org/html/20856#bib.bib6)提出了一种不确定性引导的标签去噪方法,使用蒙特卡洛丢弃法过滤低置信度伪标签。14 (https://arxiv.org/html/2608.20856#bib.bib12)开发了一个针对改善长尾关系预测的主动学习流程。

这些方法主要关注通过基于模型的细化来提高远程标签的语义可靠性。相反,我们的工作针对一个互补且很大程度上未被探索的维度:关系三元组在本体施加约束下的结构一致性。

逻辑规则已被探索用于DocRE以增强关系预测。17 (https://arxiv.org/html/2608.20856#bib.bib21)引入了一个概率框架,将逻辑规则学习为潜在变量,并通过期望最大化算法进行优化。23 (https://arxiv.org/html/20856#bib.bib11)提出了一个二级推理框架,利用第一阶段的预测作为上下文信号来推断相邻实体之间的额外关系。24 (https://arxiv.org/html/2608.20856#bib.bib22)开发了GREP,它建模实体对之间的相互依赖性以捕获细粒度的推理模式。这些方法在预测过程中融入了逻辑或推理机制,专注于改进语义推理。相反,我们的工作涉及一个互补的维度:三元组在本体施加约束下的结构规范性,这独立于模型架构或推理策略。

基于约束的方法也被探索用于句子级关系抽取,以在远程监督下提高性能。9 (https://arxiv.org/html/2608.20856#bib.bib18)利用实体类型信息引入细粒度的类型约束用于关系预测。6 (https://arxiv.org/html/2608.20856#bib.bib20)将Freebase实体描述作为背景知识融入,以指导注意力机制并提高抽取准确性。8 (https://arxiv.org/html/2608.20856#bib.bib19)提出了一个由实体类型约束构建的*约束图*,在约束感知注意力模块内提供额外的监督信号。尽管这些方法整合外部知识以指导句子级推理,但它们尚未扩展到DocRE,也未显式强制执行本体级的结构一致性。

## 3方法

给定文档d和实体集合E=\{ei\}i=1nE=\\\{e\_\{i\}\\\}\_\{i=1\}^\{n\},每个实体ei∈Ee\_\{i\}\\in E关联一组指称Mi=\{mi,j\}j=1kiM\_\{i\}=\\\{m\_\{i,j\}\\\}\_\{j=1\}^\{k\_\{i\}\},其中kik\_\{i\}表示ei在d中出现的次数。DocRE的任务是为实体对\(es,eo\)\(e\_\{s\},e\_\{o\}\)从R∪\{na\}\\mathcal\{R\}\\cup\\\{\\texttt\{na\}\\\}中预测一个关系子集,其中s,o∈\{1,...,n\}s,o\\in\\\{1,\\dots,n\\\}且s≠os\\neq o。这里,R\\mathcal\{R\}是预定义的语义关系集合,na表示不存在关系,es,eoe\_\{s\},e\_\{o\}分别表示主语和宾语实体。333我们采用DocRED的约定,使用*主语*和*宾语*来表示RDF三元组⟨s,p,o⟩中的第一和第二个参数,而非句法角色。我们不是将这些预测视为独立的分类决策,而是将DocRE解释为构建一个侧重于由OWL公理诱导的局部规范性条件的知识图谱。这一视角使我们能够检测到标准训练目标不可见的结构不一致。

### 3\.1无效三元组

实体ei的每个指称mi,j被分类到特定类型中,类型集合为命名实体类型T=\{PER, ORG, LOC, TIME, NUM, MISC\}\\mathcal\{T\}=\\\{\\text\{PER, ORG, LOC, TIME, NUM, MISC\}\\\}。例如,指称“*法国*”被分类为LOC∈T\\text\{LOC\}\\in\\mathcal\{T\}。由于集合中的所有指称(例如Mi)都指代同一实体ei,我们可以假设整个集合的类型标注是一致的;因此,我们使用第一个指称作为代表,即t⁡\(ei\)=t⁡\(mi,1\)t\(e\_\{i\}\)=t\(m\_\{i,1\}\)。

在此背景下,实体对\(es,eo\)\(e\_\{s\},e\_\{o\}\)及其预测的关系r∈Rr\\in\\mathcal\{R\}构成一个RDF三元组⟨s,p,o⟩\\langle s,p,o\\rangle,其中s=ess=e\_\{s\}是主语,p=rp=ris是谓词,o=eoo=e\_\{o\}是宾语。除了简单的三元组抽取,我们可以利用OWL为实体集E和关系集R\\mathcal\{R\}定义形式语义。每个关系r∈Rr\\in\\mathcal\{R\}可以被视为一个具有特定定义域和值域约束的owl:ObjectProperty。具体而言,对于三元组⟨es,r,eo⟩\\langle e\_\{s\},r,e\_\{o\}\\rangle要语义有效,实体类型必须满足:t⁡\(es\)∈dom\(r\)且t⁡\(eo\)∈ran\(r\)t\(e\_\{s\}\)\\in\\text\{dom\}\(r\)\\quad\\text\{且\}\\quad t\(e\_\{o\}\)\\in\\text\{ran\}\(r\),其中dom\(r\)、ran\(r\)⊆T\\text\{dom\}\(r\),\\text\{ran\}\(r\)\\subseteq\\mathcal\{T\}是关系r允许的主语和宾语类型。

违反这些约束的三元组被视为定义本体内的*无效三元组*。通过将R\\mathcal\{R\}视为一组受限属性而非任意标签,我们可以过滤噪声并提高抽取文档图的逻辑一致性。

DocRED中的每个关系都映射到一个Wikidata属性。444例如,属性P26(*配偶*)的元数据可在以下地址获取:https://www.wikidata.org/wiki/Property:P26。因此,我们利用Wikidata属性描述来识别每个属性的定义域(元数据字段“主语类型约束”)和值域(“值类型约束”),如果存在的话。我们还使用ReDocRED训练数据集20 (https://arxiv.org/html/2608.20856#bib.bib10)来提取每个关系主语和宾语实体最常见的类型,并将其包含在定义域和值域中。为避免标准过于严格,所有关系的定义域和值域都包含实体类型“MISC”。例如,关系P19(*死亡地点*)的定义域为“PER\|\|MISC”,值域为“LOC\|\|MISC”。

###### 定义3\.1(无效三元组)。

设es,eo∈Ee\_\{s\},e\_\{o\}\\in E是一对具有关联类型t⁡\(es\)、t⁡\(eo\)∈Tt\(e\_\{s\}\)、t\(e\_\{o\}\)\\in\\mathcal\{T\}的实体,r∈Rr\\in\\mathcal\{R\}是一个关系;如果主语实体类型或宾语实体类型未包含在属性的定义域或值域中,即t⁡\(es\)∉dom\(r\)∨t⁡\(eo\)∉ran\(r\)t\(e\_\{s\}\)\\notin\\text\{dom\}\(r\)\\quad\\lor\\quad t\(e\_\{o\}\)\\notin\\text\{ran\}\(r\),则称关系r对该对(es,eo)是*无效的*。

对于关系r在实体对(es,eo)上无效的三元组⟨es,r,eo⟩\\langle e\_\{s\},r,e\_\{o\}\\rangle称为*无效三元组*。例如,⟨Emily \(PER\),P19,1987 \(TIME\)⟩\\langle\\text\{Emily \(PER\)\},\\text\{P19\},\\text\{1987 \(TIME\)\}\\rangle是一个无效三元组,因为宾语实体类型(TIME)不被关系P19(*死亡地点*)允许,因为TIME∉ran\(P19\)\\text\{TIME\}\\notin\\text\{ran\}\(\\text\{P19\}\)。每个关系的定义域和值域列表见附录C (https://arxiv.org/html/2608.20856#A3)的表8 (https://arxiv.org/html/2608.20856#A3.T8)和表9 (https://arxiv.org/html/2608.20856#A3.T9)。

### 3\.2缺失逆关系

OWL中的逆属性允许对实体实例之间的双向关系进行形式化定义。在每个文档级抽取的图中,我们对逆关系采用局部封闭世界假设:如果文档中两个实体之间存在关系r,则其声明的逆关系也应存在于抽取的图中。我们识别

相似文章

基于语义增强机制的关系抽取模型

arXiv cs.CL

本文提出了CasAug,一种基于CasRel框架并采用语义增强机制的关系抽取模型,旨在解决三元组重叠问题,实验表明其性能优于基线模型。

一种面向异构文档知识图谱构建的本体引导、去重感知抽取层

arXiv cs.AI

本文介绍了一个生产级抽取层,利用本地托管的经过调优的Qwen大语言模型,将异构文档转换为与本体对齐的知识图谱,并采用本体引导的提示、多阶段去重和基于嵌入的解析。在情报语料上的评估表明,搜索召回率从约70%提升到95%,且没有错误合并。