知识图谱嵌入的模式过度泛化

arXiv cs.CL 论文

摘要

本文提出了PogRE方法,通过使用密集线性变换来解决知识图谱嵌入中的模式过度泛化问题,从而在标准基准数据集上提升链接预测性能。

arXiv:2609.03487v1 公告类型:新 摘要:知识图谱嵌入(KGE)通过将实体和关系投影到低维向量空间,展示了其在预测知识图谱(KGs)中缺失链接的有效性。KGE模型有效捕获知识图谱中固有的推理模式(如对称性/反对称性、反转和组合)至关重要。尽管最近的KGE模型在建模这些多样模式方面表现出强大能力,但它们受到模式过度泛化带来的固有局限,即仅从单个模式实例学习到的嵌入不可避免地将该模式泛化到所有相关实例,也就是普遍泛化模式。为解决此问题,我们提出PogRE(模式过度泛化鲁棒嵌入),这是一种简单但有效的方法,利用密集线性变换和复合操作进行关系表示。我们的理论分析表明,密集线性变换允许模式随着在模式中观察到更多三元组而逐渐变得普遍。此外,在观察到d+1个线性独立实体(d+1表示实体维度)后,线性变换保证了模式在所有相关实例上的普遍泛化。在三个标准基准数据集上的实验结果表明,PogRE在链接预测方面优于现有的最先进KGE模型。此外,我们的实证结果表明,PogRE有效解决了过度泛化的负面影响。
查看原文
查看缓存全文

缓存时间: 2026/09/04 06:00

# 知识图谱嵌入的模式过度泛化
来源:https://arxiv.org/html/2609.03487
Kangil Kim††thanks:通讯作者。附属机构:人工智能研究生院,光州科学技术院,邮箱:[email protected], [email protected]

###### 摘要
知识图谱嵌入(KGE)通过将实体和关系投影到低维向量空间,在预测知识图谱(KGs)中缺失链接方面展现了其有效性。对于KGE模型而言,有效捕获KGs固有的推理模式(patterns)至关重要,例如对称/反对称、反转和组合。尽管近期的KGE模型在建模这些多样模式方面表现出强大能力,但它们受限于源自模式过度泛化的内在局限性。在此局限性中,仅从单一模式实例学习的嵌入不可避免地将该模式泛化到所有相关实例,即普遍泛化该模式。为解决此问题,我们提出了PogRE(模式过度泛化鲁棒嵌入),一种利用密集线性变换和复合操作进行关系表示的简单但有效的方法。我们的理论分析表明,密集线性变换允许模式随着在该模式中观察到更多三元组而逐渐变得普遍。此外,在观察到 d+1 个线性无关的实体(d+1 表示实体维度)后,该线性变换保证了模式在所有相关实例上的普遍泛化。在三个标准基准数据集上的实验结果表明,PogRE在链接预测上优于现有的最先进KGE模型。此外,我们的实证结果表明,PogRE有效解决了过度泛化的负面影响。

## 1 引言
知识图谱(KGs)以三元组 (h,r,t) 的形式存储大量人类知识,其中 h 和 t 代表头实体和尾实体,r 表示实体间的关系。KGs 已在各种下游任务中证明了其有效性 [sui2025fidelis; ma-et-al-2025-large-language-models-meet]。然而,现实世界中的KGs,如 Freebase [bollacker2008freebase] 和 WordNet [miller1995wordnet],即使规模很大,仍然存在不完整性 [bordes2013translating]。为解决此问题,知识图谱嵌入(KGE),即将实体和关系表示在低维向量空间中,已被广泛研究为一种预测缺失链接的有效方法。

KGE 的一个根本挑战在于有效捕获 KGs 固有的推理模式(patterns),例如对称/反对称、反转和组合。为此,现有工作专注于设计特定的评分函数来捕获这些模式。例如,TransE [bordes2013translating] 将关系表示为平移以建模反转和组合,而 RotatE [sun2019rotate] 则采用旋转来捕获对称/反对称、反转和组合。PairRE [chao2021pairre] 和 CompGCN [ge2023compounding] 利用缩放和复合算子来有效建模更多模式,包括子关系以及复杂关系。

尽管这些模型在捕获各种模式方面能力强大,但现有的 KGE 模型倾向于过度泛化它们观察到的模式。特别是,一旦模型观察到一个模式,它就会在整个图中普遍泛化该模式,即使该模式仅由少量观察到的三元组支持。因此,图中局部有效的模式被视为普遍有效。我们将此现象称为过度泛化,它会导致错误的预测。

为解决此问题,我们提出了一种简单但有效的方法 PogRE,以防止局部有效的模式被普遍泛化。PogRE 使用密集线性变换和复合操作进行关系表示,其中线性变换被分解为一个特定于关系的正交矩阵和一个共享的上三角矩阵。该框架在理论上保证了:仅由少量观察到的三元组支持的模式将被局部泛化,同时确保任何由足够观察到的三元组支持的模式,当模式表示为连接的关系路径时,都会在整个图中普遍泛化。

我们的贡献如下:
- • 我们引入了模式过度泛化现象,即现有 KGE 模型中,仅由少量观察到的三元组支持的模式被普遍泛化到整个图中。
- • 我们提出了一种新颖的 KGE 方法——模式过度泛化鲁棒嵌入(PogRE),并从理论上保证其有效解决过度泛化问题。特别是,PogRE 允许任何表示为连接关系路径的模式,随着在该模式中观察到更多三元组而逐渐变得普遍。此外,当观察到足够的三元组时,PogRE 保证该模式在所有相关实例上的普遍泛化。
- • 在三个基准数据集上的实验结果表明,PogRE 在链接预测上持续优于基线 KGE 模型,并有效解决了过度泛化的负面影响。

## 2 背景
#### 知识图谱嵌入
给定实体集合 E 和关系集合 R,一个 KG 可以定义为事实三元组的集合 G = { (h,r,t) | h,t ∈ E, r ∈ R },其中 h 和 t 是头实体和尾实体,r 是关系。KGE 将 E 和 R 映射到低维向量空间,并定义一个评分函数来衡量三元组的合理性。基于距离的模型(DBMs)被训练为最小化事实三元组 (h,r,t) 的距离,同时最大化由随机替换头实体 h 或尾实体 t 为 E 中其他实体而生成的损坏负三元组 (h',r,t) 或 (h,r,t') 的距离。PairRE [chao2021pairre] 是 DBMs 的一个代表模型,其评分函数定义如下:

f_r(h,t) = ‖ h ∘ r^H − t ∘ r^T ‖,  (1)

其中 h,t,r^H,r^T ∈ ℝ^d,∘ 表示哈达玛积,‖·‖ 是向量范数。

基于张量分解的模型(TDMs)被训练为最大化通过头实体 h、关系 r 和尾实体 t 的多线性积计算出的事实三元组的分数(或语义相似度),同时最小化负三元组的分数。DistMult [yang2015embedding] 是 TDMs 的一个代表模型,其评分函数定义如下:

f_r(h,t) = ⟨h,r,t⟩ = ∑_{i=1}^d h_i r_i t_i,  (2)

其中 h,r,t ∈ ℝ^d,⟨·,·,·⟩ 表示逐元素乘积之和。

#### 推理模式
推理模式(patterns)被广泛用于分析 KGE 的泛化能力。一个模式记为 ψ ⇒ φ,其主体 ψ 和头 φ 是由数据中观察到的实体和关系组成的三元组集合。例如,对于关系 r_1, r_2, r_3 ∈ R,一个组合模式定义为 r_1(X,Y) ∧ r_2(Y,Z) ⇒ r_3(X,Z)。该模式意味着如果主体在图中,则头也在图中 [pavlovicexpressive]。

## 3 问题
### 3.1 问题表述
#### 模式实例
我们进一步将模式实例定义为模式 ψ ⇒ φ 的实例化。对于关系 r_1, r_2, r_3 ∈ R 的组合模式,一个模式实例 ψ_1 ⇒ φ_1 表达为 r_1(e_x, e_y) ∧ r_2(e_y, e_z) ⇒ r_3(e_x, e_z),其中 r_1(e_x, e_y) ∧ r_2(e_y, e_z) 对应主体实例 ψ_1,r_3(e_x, e_z) 对应头实例 φ_1,且 e_x, e_y, e_z ∈ E。

#### 模式过度泛化
尽管诸如 TransE [bordes2013translating]、RotatE [sun2019rotate]、PairRE [chao2021pairre] 和 CompGCN [ge2023compounding] 等知名 KGE 模型通过建模多种模式展示了强大的泛化能力,但它们受限于源自模式过度泛化的内在局限性。模式过度泛化是指模型在图 G 中观察到一个模式实例 (ψ_1 ⇒ φ_1) 后,将该模式泛化到图中出现的每一个主体实例;例如,如果主体 ψ_2 出现在图 G 中,模型就会推断对应的头 φ_2 也必然存在(即 ψ_2 ⇒ φ_2)。这个问题产生的原因在于现有模型被训练为普遍泛化模式。我们形式化定义模式过度泛化现象以及局部模式和普遍模式如下:

模式过度泛化:模型在没有足够证据的情况下,将局部模式泛化到所有未见三元组,即模型将局部模式视为普遍模式。
• 局部模式:ψ_i ∈ G_o ⇒ φ_i ∈ G_p (其中 G_p ⊂ G_u 且 G_p ≠ G_u)
• 普遍模式:ψ_i ∈ G_o ⇒ φ_i ∈ G_p (其中 G_p = G_u)
对于给定的实例化关系集 {r_i}_{i=1}^n。
其中:
G_o : {f | f 是在给定 KG 中观察到的三元组集合}
G_p : {f | f 是 ψ_i ∈ G_o 或对应于 ψ_i 的 φ_i,且 φ_i 语义正确。}
G_u : {f | f 是 ψ_i ∈ G_o 或对应于 ψ_i 的 φ_i}  (3)

尽管该现象可以作为 KGE 中的关键归纳偏置,但在没有足够证据的情况下普遍泛化局部模式,会通过向嵌入注入错误信息而导致错误的预测。

### 3.2 原因与证据
#### 问题为何出现?
原因是模式条件仅依赖于 KGE 方法中的关系嵌入。这种与实体无关的模式条件使得模型能够将局部模式泛化到未见三元组。例如,在完全训练以满足图 G 中所有三元组的公式 (1) 的 PairRE 中,如果主体实例 (e_{x_1}, r_1, e_{y_1}), (e_{y_1}, r_2, e_{z_1}) ∈ G 和头实例 (e_{x_1}, r_3, e_{z_1}) ∈ G,我们有:
e_{x_1} ∘ r_1^H = e_{y_1} ∘ r_1^T  ∧  e_{y_1} ∘ r_2^H = e_{z_1} ∘ r_2^T  (4)
∧  e_{x_1} ∘ r_3^H = e_{z_1} ∘ r_3^T
⇒  r_1^T ∘ r_2^T ∘ r_3^H = r_1^H ∘ r_2^H ∘ r_3^T

在此模式条件下,如果观察到一个新的主体实例 (e_{x_2}, r_1, e_{y_2}), (e_{y_2}, r_2, e_{z_2}),且满足:
e_{x_2} ∘ r_1^H = e_{y_2} ∘ r_1^T  ∧  e_{y_2} ∘ r_2^H = e_{z_2} ∘ r_2^T  (5)
那么模型保证:
e_{x_2} ∘ r_3^H = e_{z_2} ∘ r_3^T,  (6)
从而导致模型将对应的头视为对每个相同模式的新主体实例都有效。这一现象在图 1 (https://arxiv.org/html/2609.03487#S3.F1) 中进一步说明,模型将模式普遍泛化到每个主体实例。然而,并非所有 KGs 中的模式都是普遍有效的,特别是那些模式实例很少的模式^1。

图 1:局部和普遍模式的示意图,以及过度泛化的过程和示例。现有模型因将局部模式视为普遍模式而遭受过度泛化。该示例显示一个局部模式被普遍泛化,导致错误预测。
(a) 由稀少模式实例支持的局部模式的直方图。左图和右图的关系集分别为 (film/written_by, actor/film, film/prequel) 和 (film/director, film/prequel, actor/film)。
(b) 由许多模式实例支持的普遍模式的直方图。左图和右图的关系集分别为 (actor/film, film/country, people/nationality) 和 (people/place_of_birth, location/country, people/nationality)。

图 2:不同关系集 (r_1, r_2, r_3) 的嵌入差异 Δ = r_1^T ∘ r_2^T ∘ r_3^H - r_1^H ∘ r_2^H ∘ r_3^T 的直方图。# of PI 表示模式实例的数量。(r_1, r_2, r_3) 从 FB15k-237 中检索。

图 3:图 2(a) (https://arxiv.org/html/2609.03487#S3.F2.sf1) 中介绍的局部模式的模式实例和主体实例数量。

#### 实证证据
然而,现有的 KGE 模型忽略了局部模式和普遍模式之间的区别,无论其频率如何,都将其观察到的所有模式视为普遍有效。图 2 (https://arxiv.org/html/2609.03487#S3.F2) 显示了嵌入差异 Δ = r_1^T ∘ r_2^T ∘ r_3^H - r_1^H ∘ r_2^H ∘ r_3^T 的直方图,该差异见公式 (4) (https://arxiv.org/html/2609.03487#S3.E4)。Δ 的元素接近零表明模型将给定的关系集 (r_1, r_2, r_3) 视为有效模式,因此模型将该模式普遍泛化到每个主体实例。图 2(a) (https://arxiv.org/html/2609.03487#S3.F2.sf1) 和 2(b) (https://arxiv.org/html/2609.03487#S3.F2.sf2) 显示,对于局部模式和普遍模式,Δ 的元素都集中在零附近,这表明模型无论实例频率如何,都将两者都识别为有效的组合模式。这从经验上证明,即使支持实例稀少,PairRE 也被训练为将局部模式当作普遍模式进行泛化。

尽管局部模式仅由少量模式实例支持,但它们通常拥有大量的主体实例。图 3 (https://arxiv.org/html/2609.03

相似文章

CORE:用于知识图谱补全的循环正交体关系嵌入

arXiv cs.LG

本文介绍了 CORE,这是一种新的知识图谱补全模型,通过在环面流形上使用循环正交体关系嵌入来解决基于区域的模型中的边界约束问题。实验表明,该模型在链接预测任务中表现出具有竞争力的性能。

面向大规模动态图的可扩展高效联合脉冲嵌入预测架构

arXiv cs.LG

提出 SG-JEPA,一种面向大规模动态图的联合脉冲嵌入预测架构,该架构沿时间维度将节点划分为上下文集和目标集,以学习预测性嵌入,在节点分类上取得有竞争力的性能,同时可扩展到拥有1300万条边的图,并避免了复杂的自监督机制。