BoxLitE: 基于凸优化的忠实知识库嵌入

arXiv cs.AI 论文

摘要

介绍了BoxLitE,这是一种针对DL-LiteH的知识库嵌入模型,利用凸优化实现弱忠实嵌入。论文表明,对于任何可满足的DL-LiteH知识库,都存在具有理想忠实性性质的BoxLitE嵌入。

arXiv:2605.23937v1 公告类型: 新 摘要: 知识库(KB)嵌入旨在结合经典知识图谱嵌入的能力,对事实(ABox)中的信息进行泛化,同时利用本体语言(TBox)表示的概念知识。近年来,多位作者探索了将概念映射到向量空间中凸区域的思想。这对于表示TBox中常见的层次结构非常有用,因为更一般的概念可以映射到更大的区域,包含那些与更具体概念相关的区域。然而,凸性的优势在实际学习任务中很少被充分利用。本文介绍了BoxLitE,一种针对DL-Lite$^{\mathcal{H}}$的知识库嵌入模型,支持凸优化。我们证明,对于任何可满足的DL-Lite$^{\mathcal{H}}$知识库,都存在一个BoxLitE嵌入,该嵌入是一个弱忠实模型。作为概念验证,我们展示了如何将知识库嵌入任务表述为凸优化问题,并如何获得具有此类理想忠实性性质的嵌入。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:00

# BoxLitE:基于凸优化的忠实知识库嵌入  
来源:https://arxiv.org/html/2605.23937  

Hesham Morgan² · Ana Ozaki³ · Aleksandar Pavlović⁴ · Emanuel Sallinger²  

**所属机构**  
1 日本统计数理研究所  
2 奥地利维也纳工业大学  
3 挪威奥斯陆大学  
4 奥地利维也纳应用科学大学  

**邮箱**  
[email protected], [email protected], [email protected], [email protected], [email protected]  

###### 摘要  
知识库嵌入旨在将经典知识图谱嵌入的泛化能力(即泛化事实ABox中的信息)与本體语言(TBox)中的概念知识结合起来。近年來,多位研究者探索将概念映射到向量空间中的*凸区域*。这一方法有助于表示本體中常见的层级结构,因为更一般的概念可映射至较大的区域,从而包含与更具体概念相关的区域。然而,凸性在实际学习任务中很少被充分利用。本文提出BoxLitE,一个针对DL-LiteH的、支持凸优化的知识库嵌入模型。我们证明,对于任何可满足的DL-LiteH知识库,存在一个BoxLitE嵌入,它是一个弱忠实模型。作为概念验证,我们展示了如何将知识库嵌入任务表述为凸优化问题,以及如何获得具有理想忠实性属性的嵌入。  

## 1 引言  
知识库嵌入将知识图谱嵌入的归纳推理能力(用于链接预测)与本體中的逻辑表达式(用于演绎推理)相结合(Bourgaux等,2024(https://arxiv.org/html/2605.23937#bib.bib64))。近年來,多位研究者探索将知识库中的概念映射到向量空间中的区域(Gutiérrez-Basulto和Schockaert,2018(https://arxiv.org/html/2605.23937#bib.bib44);Pavlović和Sallinger,2023a(https://arxiv.org/html/2605.23937#bib.bib76);Pavlović等,2025(https://arxiv.org/html/2605.23937#bib.bib49);Morgan等,2026(https://arxiv.org/html/2605.23937#bib.bib78))。基于区域的嵌入对知识库至关重要,因为其能自然表示层级结构:更一般的概念可映射至较大的区域,从而包含与更具体概念相关的区域。尽管在知识库嵌入中,概念通常被映射到*凸区域*(如球体、方框和锥体)(Kulmanov等,2019(https://arxiv.org/html/2605.23937#bib.bib63);Abboud等,2020(https://arxiv.org/html/2605.23937#bib.bib21);Xiong等,2022(https://arxiv.org/html/2605.23937#bib.bib75);Pavlović和Sallinger,2023b(https://arxiv.org/html/2605.23937#bib.bib48);Lütfü Özçep等,2020(https://arxiv.org/html/2605.23937#bib.bib37)),但凸性在实际学习任务中很少被充分利用。尽管凸性并不等同于“容易”,但它带来了许多理论和实践上的优势,特别是:所有局部最小值都必须是全局最小值。在凸性下,针对许多类凸问题存在高效算法,例如线性规划和二阶锥规划(Nesterov和Nemirovskii,1994(https://arxiv.org/html/2605.23937#bib.bib26);Ben-Tal和Nemirovski,2001(https://arxiv.org/html/2605.23937#bib.bib25))。  

对于以描述逻辑表达的知识库,大多数基于区域嵌入的文献聚焦于`EL`本體语言(Yang等,2025(https://arxiv.org/html/2605.23937#bib.bib18);Jackermeier等,2024(https://arxiv.org/html/2605.23937#bib.bib70);Lacerda等,2024a(https://arxiv.org/html/2605.23937#bib.bib67);Xiong等,2022(https://arxiv.org/html/2605.23937#bib.bib75);Kulmanov等,2019(https://arxiv.org/html/2605.23937#bib.bib63);Mondal等,2021(https://arxiv.org/html/2605.23937#bib.bib46);Peng等,2022(https://arxiv.org/html/2605.23937#bib.bib51);Lacerda等,2024b(https://arxiv.org/html/2605.23937#bib.bib74)),部分考虑`ALC`(Lütfü Özçep等,2020(https://arxiv.org/html/2605.23937#bib.bib37);Leemhuis等,2022(https://arxiv.org/html/2605.23937#bib.bib40))。然而,在实际应用中,大规模知识库中的本體倾向于使用DL-LiteH本體语言的特征(Artale等,2009(https://arxiv.org/html/2605.23937#bib.bib1)),因其简单而多功能的表达能力,且计算复杂度低(Artale等,2009(https://arxiv.org/html/2605.23937#bib.bib1))。尽管使用广泛,但仅有少数工作研究了知识库嵌入语境下的DL-Lite家族逻辑(Li等,2022(https://arxiv.org/html/2605.23937#bib.bib73);Imenes等,2023(https://arxiv.org/html/2605.23937#bib.bib41);Bourgaux等,2021(https://arxiv.org/html/2605.23937#bib.bib47)),且没有提供基于区域的嵌入实现。  

本文提出BoxLitE,一个针对DL-LiteH本體、支持凸优化的知识库嵌入模型。我们特别研究了优化任务中的*弱忠实模型*概念(Lütfü Özçep等,2020(https://arxiv.org/html/2605.23937#bib.bib37);Bourgaux等,2024(https://arxiv.org/html/2605.23937#bib.bib64))。该概念指出,嵌入中成立的公理*与知识库一致*,并且*知识库的蕴涵在嵌入中成立*。具体而言:  

- • 我们选择DL-LiteH本體语言,以利用凸优化的优势;  
- • 我们设计、实现并评估BoxLitE,一种支持凸优化的知识库嵌入方法;  
- • 我们证明每个可满足的DL-LiteH都有BoxLitE嵌入,该嵌入是弱忠实模型;  
- • 我们引入了一种基于存在概念的新型高效负采样形式;  
- • 与常用的无约束优化方法不同,我们的BoxLitE方法能够*使用凸约束*强制TBox公理,同时将ABox项保留在目标函数中。  

**主要贡献**。我们的主要贡献在于理论层面,确立了DL-LiteH忠实模型的存在性,并提出了一种计算该模型的新方法。BoxLitE的实现及实证结果作为概念验证,表明我们的理论结果可转化为实际设置。本工作的动机之一,是尝试使用凸优化视角下的理论可靠技术来解决链接预测问题。我们希望检验纯凸方法能带来多少性能。在此意义上,我们的工作与以往依赖非凸性、导致优化问题更复杂的方法形成对比。  

当代知识库嵌入模型中非凸性的三个主要来源(详见第7节(https://arxiv.org/html/2605.23937#S7))包括:大多数工作使用*负采样*的方式(Bordes等,2013(https://arxiv.org/html/2605.23937#bib.bib42);Sun等,2019(https://arxiv.org/html/2605.23937#bib.bib34);Yang等,2015(https://arxiv.org/html/2605.23937#bib.bib55);Trouillon等,2016(https://arxiv.org/html/2605.23937#bib.bib43);Kazemi和Poole,2018(https://arxiv.org/html/2605.23937#bib.bib56);Balazevic等,2019(https://arxiv.org/html/2605.23937#bib.bib57);Xiong等,2022(https://arxiv.org/html/2605.23937#bib.bib75);Abboud等,2020(https://arxiv.org/html/2605.23937#bib.bib21);Pavlović和Sallinger,2024b(https://arxiv.org/html/2605.23937#bib.bib50));*损失项的设计*中涉及不保凸的运算;以及*本體语言*的选择,特别是允许在概念包含左侧进行合取的语言(如`EL`和`ALC`),很可能导致非凸性。这促使我们考虑DL-LiteH(Artale等,2009(https://arxiv.org/html/2605.23937#bib.bib1)),它是一种简单但实际有用且知名的本體语言,在概念包含左侧没有合取。  

在算法方面,多个工作选用的ADAM(Kingma和Ba,2015(https://arxiv.org/html/2605.23937#bib.bib12))通常以理论不健全的方式使用。例如,ADAM要求目标函数可微;然而,这一要求常被忽视。例如,在(Xiong等,2022(https://arxiv.org/html/2605.23937#bib.bib75),第4.3、4.5节)和(Abboud等,2020(https://arxiv.org/html/2605.23937#bib.bib21),第4节及附录F.2)中,作者描述了通过ADAM优化的不可微目标函数¹。论文未解释其理由,但合理的猜测是这些函数在度量论意义上几乎处处可微,因此迭代点不大可能到达不可微点,算法在实践中或许仍能工作。此外,广泛使用的工具如PyTorch可能尝试为用户对不可微函数进行微分,例如在可用时选择次梯度/超梯度(PyTorch,2026(https://arxiv.org/html/2605.23937#bib.bib65))。不幸的是,优化文献中有已知例子表明,当梯度方法直接应用于不可微函数时,即使函数在方法生成的点可微,也可能无法找到最优解,例如参见(Beck,2017(https://arxiv.org/html/2605.23937#bib.bib16),第8.1.2节)。在优化社区中,有工作探讨简单SGD方法应用于不可微函数时的收敛性质(Bolte和Pauwels,2020(https://arxiv.org/html/2605.23937#bib.bib71);Davis等,2019(https://arxiv.org/html/2605.23937#bib.bib72)),但据我们所知,类似结果尚未对ADAM证明。当性能良好时,人们可能倾向于忽略这些问题,但当性能不佳时,很难知道该归咎于模型、参数选择、优化算法还是它们的组合。我们提出的方法*确实*包含不可微项,但与之相反,我们选择求解底层优化问题的方法适合处理不可微性(第7节(https://arxiv.org/html/2605.23937#S7))。在此意义上,我们的方法在优化角度上概念上是稳健的。  

**组织**。本文组织如下:第2节(https://arxiv.org/html/2605.23937#S2)提供基本定义。第3节(https://arxiv.org/html/2605.23937#S3)定义BoxLitE方法的语义。第4节(https://arxiv.org/html/2605.23937#S4)研究BoxLitE的忠实性性质。第5节(https://arxiv.org/html/2605.23937#S5)将BoxLitE的凸优化问题公式化,并展示问题公式所确保的忠实性性质。第6节(https://arxiv.org/html/2605.23937#S6)讨论BoxLitE的概念验证实现与实验。第8节(https://arxiv.org/html/2605.23937#S8)对知识库嵌入中的优化进行讨论,并总结全文。省略的证明及更多细节见补充材料。  

## 2 基本定义:DL-Lite本體  

设`NC`、`NR`和`NI`分别为有限、非空、互不相交的*概念名*、*角色名*和*个体名*集合。我们用`NR−`表示集合`NR ∪ {R− | R ∈ NR}`,用`NC∃`表示集合`NC ∪ {∃R | R ∈ NR−}`,用`NC¬∃`表示集合`NC∃ ∪ {¬E | E ∈ NC∃}`。  

DL-LiteH角色包含和概念包含分别形如`S ⊑ T`和`B ⊑ C`,其中`S, T ∈ NR−`为角色²,`B, C`为按如下方式构建的概念:  
`S ::= R | R−, B ::= A | ∃S, C ::= B | ¬B`,  
其中`R ∈ NR`,`A ∈ NC`。  

DL-LiteH TBox(我们也可使用较少技术性的术语*本體*)是DL-LiteH概念包含和角色包含的(有限)集合。*断言*形如`D(a)`(称为*概念断言*)或`R(a, b)`(称为*角色断言*),其中`D ∈ NC∃`,`R ∈ NR`,且`a, b ∈ NI`。  

DL-LiteH *知识库*(KB)是一个对`(T, A)`,其中`T`是DL-LiteH TBox,`A`是断言的(有限)集合,称为*ABox*。遵循KBE文献(例如(Xiong等,2022(https://arxiv.org/html/2605.23937#bib.bib75)))并简化叙述,我们假设DL-LiteH TBox处于*命名形式*,即它们仅包含其中一个概念是概念名的概念包含。  

语义如常通过解释`I = (Δ^I, ·^I)`给出(见补充材料)。称DL-LiteH *公理*为角色包含(RI)、概念包含(CI)或断言的表达式。若`I`满足公理`α`,则写为`I ⊧ α`。若解释`I`满足`T`和`A`中的公理,则称它满足知识库`K = (T, A)`,记作`I ⊧ K`。若存在这样的解释`I`,称`K`是*可满足的*。此外,若对所有解释`I`,`I ⊧ K`蕴含`I ⊧ α`,则称`K`*蕴涵*公理`α`,记作`K ⊧ α`。若存在解释`I`使得`I ⊧ K ∪ {α}`,则称公理`α`与知识库`K`*一致*。  

**典范模型**。我们的构建基于以往DL-LiteH典范模型的定义(例如(Kontchakov等,2010(https://arxiv.org/html/2605.23937#bib.bib17)))。不过在此,我们确保模型中的*包含关系**仅当*它们被本體蕴涵时才成立。在给出典范模型定义之前,我们引入以下概念。假设`K = (T, A)`是一个可满足的DL-LiteH知识库。若存在解释`I`使得`I ⊧ K`且`C^I ≠ ∅`,则称概念`C`关于`K`是*可满足的*。我们仅使用形如`B ⊓ C`(带*合取*运算符)的概念来证伪形如`B ⊑ ¬C`的概念包含。在解释`I`中,`(B ⊓ C)^I`的含义是`B^I ∩ C^I`。令`NC⊓∃`为集合`NC∃ ∪ {D ⊓ E | D, E ∈ NC∃}`。  

(注意:输入文本在此处可能被截断,但根据要求,我们只翻译提供的部分。)

相似文章

BitNet 文本嵌入

arXiv cs.CL

本文介绍了 BitEmbed,一个用于基于 LLM 的文本嵌入的极低位宽框架,它将预训练的 LLM 骨干转换为具有三值权重和量化激活的 BitNet 风格编码器。该框架在显著降低编码和存储成本的同时,实现了与全精度模型相当的性能。