DiffIE:基于扩散的开放信息抽取
摘要
DiffIE引入了一种基于扩散的开放信息抽取方法,该方法使用随机反向扩散生成多个候选三元组,在CaRB和BenchIE等基准测试中达到最先进的性能。
arXiv:2609.02315v1 Announce Type: new
摘要: 一个句子通常表达多个有效的关系三元组,这使得开放信息抽取(OpenIE)本质上是一个多输出任务。现有的神经网络系统通过自回归生成来处理这个问题,这种方式灵活但速度慢且容易产生冗余;或者通过固定槽预测,这种方式高效但将抽取预算与训练耦合。我们引入了DIFFIE,它将条件离散扩散的随机性本身视为抽取机制:独立的反向扩散轨迹在每个词元的角色标签上生成一个候选三元组池,这些三元组在宽松匹配下聚类并排序以形成输出。池的大小和返回的抽取数量都是推理时的选择,将抽取预算与训练解耦,并将测试时计算暴露为一个可调轴。DIFFIE在CaRB (1-1)的F1和AUC上达到了新的最先进水平,并在BenchIE中超越了最强的基于规则的系统(ClausIE);它在标准CaRB和WiRe57评估中也保持竞争力,在报告所有四个基准测试的系统中给出了最佳平均分。消融实验表明,在我们的设置中,均匀离散扩散优于吸收状态扩散,并且一个匹配的非扩散随机标记器无法复现其增益。我们的结果表明,扩散随机性是处理具有多个有效输出的结构化预测任务的有效机制。
查看缓存全文
缓存时间: 2026/09/03 05:53
# DiffIE:基于扩散的开放信息抽取
来源:https://arxiv.org/html/2609.02315
Konstantin Fedorov affiliation:俄罗斯科学院西伯利亚分院系统动力学与控制理论研究所 affiliation:ITMO大学AI人才中心 Valentin Malykh affiliation:MWS AI affiliation:俄罗斯科学院可信人工智能研究中心 affiliation:IITU大学 通讯邮箱:k\.fedorov@innopolis\.university
###### 摘要
单个句子通常表达多个有效的关系三元组,这使得开放信息抽取本质上是一个多输出任务。现有的神经网络系统通过自回归生成处理此问题,该方法灵活但速度慢且易产生冗余;或通过固定槽位预测,该方法高效但将抽取预算与训练过程耦合。我们提出DiffIE,它将条件离散扩散的随机性本身作为抽取机制:对每个词元的角色标签进行独立的反向扩散轨迹,生成候选三元组池,随后通过宽松匹配进行聚类并排序以形成输出。候选池大小和返回的抽取数量均为推理时选择,将抽取预算与训练解耦,并将测试时计算量作为一个可调节的维度。DiffIE在CaRB(1\-1)上取得了新的最先进水平,在F1和AUC指标上均表现最佳,并在BenchIE上超越了最强的基于规则的系统(ClausIE);它在标准CaRB和WiRe57评估中也保持竞争力,在报告所有四个基准测试的系统中获得了最佳平均分数。消融实验表明,在我们的设置中,均匀离散扩散优于吸收态扩散,且匹配的非扩散随机标注器无法重现其增益。我们的结果表明,扩散随机性是处理具有多个有效输出的结构化预测任务的有效机制。
1\. 仅编码句子一次 她乘坐南行的火车 编码器 2\. 采样 n 条反向扩散轨迹(关于标签) y1\(T\)y\_\{1\}^\{\(T\)\}y1\(T−1\)y\_\{1\}^\{\(T\-1\)\}⋯\\cdotsy1\(t\)y\_\{1\}^\{\(t\)\}⋯\\cdotsy1\(1\)y\_\{1\}^\{\(1\)\}y1\(0\)y\_\{1\}^\{\(0\)\}OBRSORRBSOBR⋯\\cdotsSBBOBO⋯\\cdotsSROOBBSRBOBB 随机初始标签 最终去噪标签 反向扩散:y\(T\)→y\(0\)y^\{\(T\)\}\\rightarrow y^\{\(0\)\} 3\. 构造候选三元组 4\. 聚合三元组 B 背景 S 主体 R 关系 O 客体
图1:DiffIE推理概述。以同一句子为条件的多条反向扩散轨迹产生候选三元组,其中可能包含重复和噪声输出。宽松聚合对候选三元组进行聚类并返回排名靠前的抽取结果。
## 1引言
开放信息抽取旨在从自然语言文本中提取无模式的关系三元组(主体, 关系, 客体),其中单个句子通常表达多个不同的事实。现有的神经方法分为自回归序列生成器和序列标注模型,前者灵活但速度慢且易产生冗余,后者高效但通常每次仅产生一个三元组。DetIE采用受目标检测启发的架构,在单次前向传播中预测固定数量 N 的候选三元组,证明了非自回归多三元组抽取的可行性;其权衡在于 N 在训练时固定,当目标基数改变时模型必须重新训练。
我们提出 DiffIE,一个基于条件离散扩散的非自回归序列标注模型。DiffIE 不解码单个标签序列,而是利用反向扩散过程的随机性:n 条独立的去噪轨迹产生一个基于样本的有效标签序列候选池,宽松匹配抽取器将其聚合成最终的三元组集合。由于 n 在推理时设定,它同时充当一个可调节的计算质量轴:更多样本以更高的推理成本扩展候选池。返回的抽取集合大小同样是推理时的选择,因此可以在不重新训练的情况下针对不同语料库重新调整抽取预算。
我们的贡献包括:(1) 首次将离散扩散语言模型应用于开放信息抽取,将其表述为条件序列标注;(2) 一种基于样本的聚合推理机制,配以针对开放信息抽取基准真值多参考特性的宽松匹配抽取器,将抽取预算与训练解耦;(3) 经验性地证明,在极小词汇表规模下,均匀噪声离散扩散优于吸收态扩散;(4) 设计了一个匹配的非扩散随机标注器控制组,确定反向扩散(而非重复采样和聚类)是性能提升的来源;(5) 报告了最佳的 CaRB (1\-1) F1 和 AUC 以及 BenchIE F1,超越了先前的神经网络系统和在 BenchIE 上最强的基于规则的基线。
## 2相关工作
### 2.1神经网络开放信息抽取
#### 序列标注方法
将抽取视为词元级标注,通常采用 BIO 风格的方案。OpenIE6 用二维迭代网格标注替代平面标注,以捕获不连续片段和重叠关系;SpanOIE 先检测谓词片段,然后对其论元进行分类。与我们工作最相关的是 DetIE,它采用受目标检测启发的表述,在单次前向传播中输出固定数量 N 的三元组候选,并在训练时进行二分图匹配。我们的方法属于这一类,但用推理时从概率模型采样替代了训练时的固定预算(§3)。
#### 序列生成方法
将开放信息抽取表述为自回归的文本到文本生成。早期工作引入了编码器\-解码器复制机制;IMoJIE 迭代地生成抽取,每个抽取都以先前生成的抽取为条件。更新的系统包括基于 T5 的表述以及用于减少缺失和冗余三元组的双重学习。CycleOIE 引入了一种低资源训练框架,其整理的 LSOIE\-examples 子集被用作我们的训练语料。生成方法灵活,但需付出自回归推理成本,且容易产生冗余抽取,这促使了像 DetIE 这样的非自回归替代方案,我们的方法就是其中之一。
#### 低资源开放信息抽取。
CycleOIE 认为神经网络开放信息抽取仍严重依赖大型标注语料库,并通过两种提示策略整理了小型的、由 GPT 标注的训练集,报告了少样本示例变体的更强结果。我们使用这个 lsoie\-examples 子集作为我们的训练来源,后续分析了增加原始 LSOIE 数据是否有帮助。
#### 与大型语言模型提示的关系。
近期工作直接提示大型语言模型执行开放信息抽取;此类系统是自回归的,在语料库规模下成本高昂,且对抽取分布的控制有限。DiffIE 仅编码每个句子一次,并将测试时计算量作为一个可调节的轴,因此其成本可以在训练后设定,而非由解码器固定(§6.2)。
### 2.2离散扩散语言模型
文本扩散模型分为空间变体和离散空间变体,前者将离散词元嵌入连续潜在空间并在该空间扩散;后者直接在分类词汇表上定义加噪过程。D3PM 建立了离散扩散框架,提供多种转移矩阵选择,其中吸收态和均匀破坏是最广泛使用的两种。MDLM 简化了吸收态扩散,并与 SEDD 和 LLaDA 一起,确立了离散扩散作为自回归语言建模的可行替代方案。
两种表述的相对性能取决于词汇表大小:研究表明,均匀噪声扩散在小词汇表语言建模上可以匹配或超越吸收态扩散,这与吸收态通常更强的普遍假设相反。我们包含四个符号的标签词汇表是此情况的一个极端实例;我们实现了这两种方法并在 §6.3 中报告了比较结果。
### 2.3扩散用于结构化预测
先前基于扩散的结构化自然语言处理方法要么在连续空间操作,要么假设固定的关系模式,使其不兼容无模式、多抽取的开放信息抽取。与我们工作最接近的是 DiffusionSL,它通过*比特标签转换器*执行序列标注,该转换器将每个标签编码为比特模式并在比特空间应用连续高斯扩散;它在任务上进行评估,其中每个句子只有一个最佳标签序列,并从单条轨迹解码。DiffIE 在三个方面有所不同:我们直接使用基于四个符号标签词汇表的分类离散扩散;我们在推理时绘制 n 条轨迹并进行聚合,将样本多样性视为捕获多个有效抽取的机制;并且我们引入了特定任务的抽取器(§3.4),以适应开放信息抽取基准真值的多参考特性。
### 2.4开放信息抽取评估基准
开放信息抽取的评估因单个句子允许存在许多有效抽取且表面形式变化很大而变得复杂,基准测试在参考构建和匹配方式上也存在差异。
#### CaRB 和 CaRB (1\-1)。
CaRB 提供了 1,282 个句子的人工抽取结果,使用允许部分得分的词元级匹配器。标准匹配器允许一对多对齐,按词元重叠评分,这奖励了那些产生过长抽取、一次性覆盖许多标准词元的系统。CaRB (1\-1) 通过匈牙利算法强制执行一对一匹配,被广泛认为是更可靠的抽取质量度量。
#### BenchIE。
BenchIE 用*事实同义词集*替代了按三元组的标准标注——即同一底层事实的所有可接受表面形式的详尽聚类——并应用严格的同义词集级匹配。因为得分需要命中一个事实而非其片段,BenchIE 通过过度抽取来取巧的难度大大增加。
#### WiRe57。
WiRe57 是一个较小的基准(57 个句子),包含人工整理的、高精度的参考答案,提供了一个补充性的完整性检查。
#### 基准选择。
我们在所有四个基准上评估 DiffIE,将 CaRB (1\-1) 和 BenchIE 视为更严格的抽取质量指标。这套基准涵盖了从宽松到严格的整个匹配谱,使我们能够刻画我们方法的优势所在。
## 3方法
我们将开放信息抽取表述为基于词元标签序列的条件离散扩散。给定一个输入句子,我们的模型学习逆转一个离散破坏过程,该过程将随机标签序列映射到基准标签序列。在推理时,我们利用这个反向过程的随机性:通过从同一句子绘制许多独立的去噪轨迹,我们获得一个基于样本的有效标签序列候选池,然后将其聚合成最终的(主体, 关系, 客体)三元组集合。
### 3.1问题表述
令 x=\(x1,...,xL\)x=\(x\_\{1\},\\ldots,x\_\{L\}\) 表示包含 L 个词元的输入句子。遵循先前开放信息抽取的序列标注表述,我们将抽取表示为标签序列 y=\(y1,...,yL\)y=\(y\_\{1\},\\ldots,y\_\{L\}\),其中每个 yi∈V=\{B,S,R,O\}y\_\{i\}\\in\\mathcal\{V\}=\\\{B,S,R,O\\\} 为第 i 个词元分配一个角色——背景、主体、关系或客体。单个标签序列精确编码一个三元组,在当前的采样后构造步骤中,我们通过恢复各角色标签的最长连续片段来获取主体、关系和客体跨度。
与 DetIE 不同,DetIE 同时预测固定数量 N 的三元组并在训练时通过二分图匹配解决多抽取问题;也不同于 IMoJIE,它自回归地生成三元组,我们的表述是*每个前向采样产生一个标签序列*。多抽取通过在推理时进行重复的随机采样来恢复(§3.4)。
### 3.2架构
DiffIE 由两个组件组成:一个预训练的 Transformer 编码器和一个小型随机初始化的扩散去噪器。概述如图 1 所示。
#### 编码器。
我们使用预训练的 Transformer 编码器 Enc\(⋅\)\\mathrm\{Enc\}\(\\cdot\) 将输入句子映射到上下文化的词元嵌入 henc∈RL×dh^\{\\text\{enc\}\}\\in\\mathbb\{R\}^\{L\\times d\}。根据微调配置,一些较低的编码器层可能会被冻结,而其余层与去噪器联合微调。
#### 去噪器。
去噪器是一个小型 Transformer,仅具有自注意力机制,并从头开始训练。在去噪步骤 t,它接收当前的带噪标签序列 y\(t\)y^\{\(t\)\},将其嵌入为 htag∈RL×dh^\{\\text\{tag\}\}\\in\\mathbb\{R\}^\{L\\times d},并将编码器上下文投影到相同维度。条件化是通过拼接相似文章
DiffImaginE:用Diffusio想象验证实体类型
DiffImaginE是一篇研究论文,提出了一种基于扩散的多模态命名实体识别验证器,用条件潜扩散推理取代确定性想象,以实现更稳健的实体类型验证。
DiffRetriever:基于扩散语言模型的并行代表性令牌检索
本文介绍了 DiffRetriever,这是一种利用扩散语言模型并行生成多个代表性令牌以实现高效信息检索的方法,在速度和准确率上均优于自回归基线方法。
CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference
CORA-Diff is a training-free method that accelerates diffusion language model inference by using native confidence and persistence signals to accept residual positions early, skipping redundant dense denoising passes while preserving task quality.
通过填充提取扩散语言模型中的训练数据
本文介绍了infilling extraction(填充提取)方法,这是一种通过使用任意二进制掩码从扩散语言模型中提取训练数据的新方法,表明此类模型比之前认为的更容易受到记忆化攻击。
DiffusionBench:扩散变换器的全面评估
研究人员引入了NanoGen,一个用于训练和评估扩散变换器的统一框架,并提出了DiffusionBench,一个结合了ImageNet类别条件和文本到图像生成的全面基准,以更好地评估生成建模的进展。