基于嵌入的神经回归用于知识图谱中的数值属性预测

arXiv cs.LG 论文

摘要

本文提出了LitEm,一个神经回归模型,它使归纳式知识图谱嵌入模型能够预测数值属性,在基准测试中取得了优异结果,并引入了一个协同训练框架以提升性能。

arXiv:2608.26729v1 Announce Type: new 摘要:近年来,归纳式知识图谱嵌入模型已被应用于链接预测和查询回答等任务。尽管知识图谱通常包含丰富的数值属性,但大多数嵌入模型忽略了它们,这限制了它们表示具有多样信息的真实世界知识图谱的能力。在这项工作中,我们提出了一种神经回归模型(LitEm),它使归纳式知识图谱嵌入模型能够预测知识图谱中的数值属性。实验结果表明,LitEm在FB15K-237、YAGO15K、DB15K和Mutagenesis数据集的大部分属性上取得了最佳或次佳的结果。此外,我们提出了一个协同训练框架,将最先进的归纳式知识图谱嵌入模型与LitEm联合训练,这主要提高了双线性模型的链接预测性能,同时使它们能够预测数值属性。另外,字面感知评估表明,协同训练帮助模型以“字面感知”的方式编码和利用属性信息,这表明观察到的性能提升不仅仅是因为额外的参数。我们公开发布实现代码:https://github.com/dice-group/dice-embeddings。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:43

# 基于嵌入的知识图谱数值属性神经回归预测
来源:https://arxiv.org/html/2608.26729
###### 摘要

近年来,转导式知识图谱嵌入模型已应用于链接预测和查询回答等任务。尽管知识图谱通常包含丰富的数值属性,但大多数嵌入模型忽略了它们,这限制了它们表征具有多样化信息的真实世界知识图谱的能力。本研究提出了一种神经回归模型(LitEm),使转导式知识图谱嵌入模型能够预测知识图谱中的数值属性。实验结果表明,LitEm在FB15K-237、YAGO15K、DB15K和Mutagenesis数据集的大多数属性上取得了最佳或次佳结果。此外,我们提出了一个协同训练框架,将最先进的转导式知识图谱嵌入模型与LitEm联合训练,这主要提升了双线性模型的链接预测性能,同时使其能够预测数值属性。此外,字面感知评估表明,协同训练有助于模型以“字面感知”的方式编码和利用属性信息,这表明观察到的增益并不仅仅是由于增加参数所致。我们的实现已公开发布于 https://github.com/dice-group/dice-embeddings。

###### 关键词:

知识图谱 嵌入 属性预测

## 1 引言

知识图谱以结构化的方式表示现实世界中的实体及其关系,支持知识表示、信息检索以及搜索引擎、药物发现、自然语言处理和推荐系统等领域的决策制定[28 (https://arxiv.org/html/2608.26729#bib.bib28)]。DBpedia[16 (https://arxiv.org/html/2608.26729#bib.bib24)]、Freebase[3 (https://arxiv.org/html/2608.26729#bib.bib2)]和YAGO[19 (https://arxiv.org/html/2608.26729#bib.bib3)]等公开可用的通用知识图谱存储了关于实体及其关系的大规模现实世界知识。然而,许多现有知识图谱存在不完整性,这限制了它们因缺失事实而支持推理任务的能力[18 (https://arxiv.org/html/2608.26729#bib.bib25)]。

链接预测被广泛用于通过推断实体之间缺失的链接来解决知识图谱中的不完整问题[4 (https://arxiv.org/html/2608.26729#bib.bib13), 22 (https://arxiv.org/html/2608.26729#bib.bib14)]。知识图谱嵌入模型将实体和关系表示在向量空间中,并以最先进的性能执行链接预测。文献中提出了众多知识图谱嵌入方法[4 (https://arxiv.org/html/2608.26729#bib.bib13), 27 (https://arxiv.org/html/2608.26729#bib.bib17), 22 (https://arxiv.org/html/2608.26729#bib.bib14), 20 (https://arxiv.org/html/2608.26729#bib.bib16), 6 (https://arxiv.org/html/2608.26729#bib.bib19), 8 (https://arxiv.org/html/2608.26729#bib.bib18)],但它们仅依赖实体之间的关系信息,而忽略了字面量(文本描述、日期时间值、数值、度量、图像和其他属性数据),这些信息本可以丰富实体表示[11 (https://arxiv.org/html/2608.26729#bib.bib4)]。特别是,数值字面量已被广泛用于提高链接预测性能[21 (https://arxiv.org/html/2608.26729#bib.bib11), 25 (https://arxiv.org/html/2608.26729#bib.bib9), 15 (https://arxiv.org/html/2608.26729#bib.bib8), 13 (https://arxiv.org/html/2608.26729#bib.bib20)]以及复杂查询回答[9 (https://arxiv.org/html/2608.26729#bib.bib10)]等其他任务。这些方法要么修改评分函数,要么在训练过程中融入字面量以进行数值属性填补和链接预测。先前的工作表明,预训练的知识图谱嵌入已经编码了预测数值属性所需的大部分信息,而无需修改嵌入结构[26 (https://arxiv.org/html/2608.26729#bib.bib7)]。我们在此基础上提出了一种方法,该方法从预训练的嵌入中学习属性表示,并且无需更改知识图谱嵌入的评分函数,使其能够同时为任何转导式知识图谱嵌入模型预测和增强数值属性。我们的方法在设计上与模型无关,可以在转导设置中与现有知识图谱嵌入模型配对使用,无需修改其评分函数,即可同时增强和预测数值属性。在本工作中,我们做出了以下贡献:

- 提出LitEm,一种从预训练嵌入预测数值属性的神经回归模型。
- 设计了一个框架,将知识图谱嵌入模型与LitEm协同训练,以联合预测和增强数值属性。
- 引入了基于梯度的动态加权机制来平衡知识图谱和字面量损失。
- 将DB15K和Mutagenesis重新用作数值字面量预测的基准,并首次报道了两者的结果。

## 2 背景

### 2.1 知识图谱

知识图谱是一个结构化网络,将现实世界中的实体表示为节点,其关系表示为边,以三元组的形式传递信息[12 (https://arxiv.org/html/2608.26729#bib.bib12)]。除了关系三元组,知识图谱还包含将实体与其属性值相关联的三元组。虽然存在多种关于知识图谱的定义,但我们考虑的知识图谱定义为 G := {(h, r, t)} ∪ {(e, a, v)} ⊆ E × R × E ∪ E × A × V,其中 E, R 和 A 分别表示实体、关系和属性的集合,V ⊂ ℝ 表示实数的一个子集[23 (https://arxiv.org/html/2608.26729#bib.bib23), 15 (https://arxiv.org/html/2608.26729#bib.bib8), 9 (https://arxiv.org/html/2608.26729#bib.bib10)]。关系三元组表示为 (h, r, t),其中 h, t ∈ E 且 r ∈ R。类似地,属性(数值)三元组表示为 (e, a, v),其中 e ∈ E,a ∈ A 表示一个数值属性,v ∈ V。例如,(Berlin, CapitalOf, Germany) 是一个关系三元组,而 (Berlin, hasPopulation, 3,960,000) 是一个属性(字面量)三元组的示例。

### 2.2 转导式知识图谱嵌入

知识图谱嵌入模型将实体和关系表示在向量空间中,便于下游任务,如链接预测[8 (https://arxiv.org/html/2608.26729#bib.bib18)]和神经推理[9 (https://arxiv.org/html/2608.26729#bib.bib10)]。知识图谱嵌入模型通常使用参数化评分函数形式化,即 φ_Θ: E × R × E → ℝ,其中参数 Θ 通常包括实体嵌入 E ∈ ℝ^{|E|×d_e} 和关系嵌入 R ∈ ℝ^{|R|×d_r},以及其他可学习组件[8 (https://arxiv.org/html/2608.26729#bib.bib18)],其中 ℝ 表示 d 维向量空间,d ∈ ℕ, d > 0;这里实体和关系共享相同的嵌入维度 d。嵌入方法在表示关系的方式上各不相同:TransE[4 (https://arxiv.org/html/2608.26729#bib.bib13)] 将其表示为加法平移,DistMult[27 (https://arxiv.org/html/2608.26729#bib.bib17)] 通过乘法评分函数,ComplEx[22 (https://arxiv.org/html/2608.26729#bib.bib14)] 在复数值空间中以捕获非对称性,RotatE[20 (https://arxiv.org/html/2608.26729#bib.bib16)] 在复空间中表示为旋转,QMult 和 OMult[6 (https://arxiv.org/html/2608.26729#bib.bib19)] 作为 DistMult 和 ComplEx 的四元数和八元数扩展,DualE[5 (https://arxiv.org/html/2608.26729#bib.bib15)] 通过对偶四元数,以及 Keci[8 (https://arxiv.org/html/2608.26729#bib.bib18)] 在 Clifford 代数中。

### 2.3 字面量嵌入模型

字面量嵌入模型通过学习数值属性的嵌入来扩展知识图谱嵌入方法,在表示空间中捕获实体的实值属性。然而,大多数现有方法并未利用转导式知识图谱嵌入模型来联合学习属性表示和预测数值。令 a ∈ A 表示实体 e ∈ E 的一个数值属性,令 v ∈ V 表示其关联的数值。字面量嵌入模型定义评分函数 φ'_{Θ'}: E × A → ℝ,其中参数 Θ' 通常包括属性嵌入 A ∈ ℝ^{|A|×d_a},d_a 表示字面量嵌入的维度。预测的数值由 v̂ = φ'_{Θ'}(e, a) 给出。

## 3 相关工作

关于知识图谱中数值属性的先前工作大致可分为属性预测和字面量感知嵌入方法。对于数值属性预测,Tay 等人[21 (https://arxiv.org/html/2608.26729#bib.bib11)]在共享嵌入空间中联合学习关系网络和属性网络,Kotnis 和 García-Durán[14 (https://arxiv.org/html/2608.26729#bib.bib5)]提出了基于回归和传播的基线(LR, NAP, LR++, NAP++, GLOBAL, LOCAL),Bayram 等人[1 (https://arxiv.org/html/2608.26729#bib.bib6)]引入了 MrAP,它在多关系邻域上传播属性值,而 Xue 等人[26 (https://arxiv.org/html/2608.26729#bib.bib7)]将基于图的方法与预训练语言模型结合用于掩码数值预测(KGE-Reg)。其他方法直接将字面量纳入知识图谱嵌入模型:TransEA[25 (https://arxiv.org/html/2608.26729#bib.bib9)]联合优化关系和属性嵌入,KBLRN[10 (https://arxiv.org/html/2608.26729#bib.bib1)]在专家乘积框架中结合关系、潜在和数值特征,LiteralE[15 (https://arxiv.org/html/2608.26729#bib.bib8)]通过可学习的门控将字面量注入实体嵌入,KGA 将字面量离散化为链接到实体的数值分箱,将其暴露给标准知识图谱嵌入模型[23 (https://arxiv.org/html/2608.26729#bib.bib23)],以及 ReaLitE[13 (https://arxiv.org/html/2608.26729#bib.bib20)]用字面量信息丰富关系嵌入以进行链接预测。LitEm 与这些方法在修改内容上有所不同。KGE-Reg 在语言模型上预测掩码值,而 LitEm 直接从冻结的实体嵌入通过门控残差网络进行回归,并且与 Tay 等人的多任务设置不同,它没有向知识图谱嵌入模型添加辅助目标。LiteralE 也使用门控,但它在知识图谱嵌入训练期间应用于实体嵌入,而 LitEm 则对已有的嵌入进行属性预测。然后,LitEm 将此解码器与模型无关的协同训练配对,仅通过字面量损失更新这些嵌入,保持知识图谱嵌入评分函数不变。

## 4 字面量嵌入模型

在本节中,我们介绍字面量嵌入,一种神经嵌入回归模型,它学习表示并预测知识图谱中与实体相关的数值属性。该模型使用实体的预训练嵌入作为输入特征,并执行回归以预测知识图谱中存在的不同属性的数值。给定属性三元组 (e, a, v) ∈ G,其中 e ∈ E 且 a ∈ A,模型以实体-属性对 (e, a) 作为输入,并使用公式 1 中定义的回归函数进行训练,以预测关联的数值 v。

LitEm_base(e, a) = W₂ · (ReLU(W₁ · [e, a] + b₁) + [e, a]) + b₂  (1)
我们将公式 1 称为基础模型,其中 e ∈ E 和 a ∈ A 分别表示实体 e 和属性 a 的嵌入,并共享相同的嵌入维度 d。在此公式中,属性嵌入 a 是可训练参数,而实体嵌入 e 来自预训练的知识图谱嵌入模型,默认情况下是固定的(可选在 LitEm 训练期间更新)。模型首先连接实体和属性嵌入 [e, a],应用线性变换(W₁ ∈ ℝ^{2d×2d}, b₁ ∈ ℝ^{2d})后接 ReLU 激活,并通过残差连接添加原始输入。然后,所得表示通过第二线性层(W₂ ∈ ℝ^{1×2d}, b₂ ∈ ℝ)投影到标量输出。为了有选择地融入字面量信息,我们受 [15 (https://arxiv.org/html/2608.26729#bib.bib8)] 启发,进一步用门控残差机制扩展模型,允许模型控制残差连接的贡献。完整的 LitEm(e, a) 模型由公式 2 定义。

z = ReLU(W₁ · [e, a] + b₁)
[ u ; g ] = W_res · [z, [e, a]] + b_res
LitEm(e, a) = W₂ · (u ⊙ σ(g)) + b₂  (2)
门控机制将连接向量 [z, [e, a]] 通过参数 W_res ∈ ℝ^{4d×4d} 和 b_res ∈ ℝ^{4d}(因为 [e, a] 和 z ∈ ℝ^{2d})投影,将结果拆分为值 u 和门控 g。然后通过逐元素乘法(用 ⊙ 表示)对值进行调制,其中 σ 表示 sigmoid 激活函数。

### 4.1 将字面量信息融入知识图谱嵌入

算法 1:嵌入模型与 LitEm 的联合训练
1: 输入:三元组 G = {(h, r, t)} ∪ {(e, a, v)},标签 q ∈ {0, 1} 用于关系三元组;学习率 γ_KGE, γ_LitEm,轮数 n,批次大小 b,模型 KGE, LitEm
2: 初始化:θ = {θ_KGE, θ_LitEm}
3: for epoch = 1 to n do
4:     for mini-batch B = {(h, r, t)} of size b do
5:         h, r, t ← KGE_θ(h, r, t)

相似文章

DEL:大型语言模型数值学习的数字熵损失

arXiv cs.CL

本文提出数字熵损失(DEL),一种用于大型语言模型数值学习的新型损失函数。它重新定义了熵优化,以提高数字级预测精度并处理浮点数,在数学推理基准上持续优于现有方法。