IRIS:基于冻结大语言模型的可复用身份表示用于实体对齐

arXiv cs.CL 论文

摘要

IRIS是一个无需训练的框架,利用冻结的大语言模型为知识图谱中的实体构建可复用的身份表示,从而能够在不同知识图谱间实现高效的实体对齐,无需依赖配对处理。

arXiv:2607.25579v1 发布类型:新 摘要:实体对齐(EA)旨在识别不同知识图谱(KG)中指向同一现实世界对象的实体。传统的EA方法主要利用显式图结构和文本字段,这往往不能提供足够的语义理解来识别异构描述下的同一实体,并将其与语义相似的实体区分开。尽管大语言模型(LLM)提供了更深入的实体理解,但现有的基于LLM的EA方法主要将这些能力用于辅助生成或候选条件决策。因此,这种理解并未提炼成稳定且可直接比较的身份空间,导致对齐依赖于特定的KG对或候选集,并且随着匹配上下文的变化需要重复处理。为了解决这些局限性,我们提出了IRIS(内部状态的身份表示),一个无需训练的框架,为每个实体构建一个类似虹膜的签名,编码其独特且稳定的身份特征。IRIS通过从冻结的LLM中引发面向身份的上下文表示来推导这些签名,从而形成一个共享空间,其中每个实体被编码一次,可以通过直接的相似性比较在不同KG之间进行对齐,无需依赖配对构建表示或候选级别的LLM推理。在四个已建立的EA基准和两个冻结LLM骨干上,最佳的IRIS变体在D-Y-15K V2、DBP-WIKI、ICEWS-WIKI和ICEWS-YAGO上分别达到了100.00、99.38、98.31和97.99的Hits@1得分。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:55

# IRIS:基于冻结大语言模型的可复用身份表示用于实体对齐
来源:https://arxiv.org/html/2607.25579
Xinran Liu\*, Shengtao Li\*, Shouqian Shi†, Ge Wang, Xin\-Wei Yao\*同等贡献。†通讯作者:sqlite@nju\.edu\.cn

###### 摘要

实体对齐(EA)旨在识别不同知识图谱(KG)中指向同一现实世界对象的实体。传统的实体对齐方法主要利用显式的图结构和文本字段,这通常无法提供足够的语义理解来识别异构描述下的同一实体,并将其与语义相似的实体区分开。虽然大语言模型(LLM)提供了更深入的实体理解,但现有的基于LLM的实体对齐方法主要将这种能力用于辅助生成或基于候选集的决策。因此,这种理解并未被蒸馏成一个稳定且可直接比较的身份空间,导致对齐过程依赖于特定的知识图谱对或候选集,并且随着匹配上下文的变化需要重复处理。为了解决这些限制,我们提出了IRIS(基于内部状态的身份表示),这是一个无需训练框架,为每个实体构建一个类似虹膜的特征签名,编码其独特且稳定的身份特征。IRIS通过从冻结的LLM中引出面向身份的上下文表示来生成这些签名,从而形成一个共享空间,其中每个实体被编码一次,并可以通过直接相似度比较在不同知识图谱之间对齐,无需构建依赖于对的表示或对候选进行逐一的LLM推理。在四个公认的实体对齐基准测试和两个冻结的LLM主干上,最佳IRIS变体在D-Y-15K V2、DBP-WIKI、ICEWS-WIKI和ICEWS-YAGO上分别达到了100.00、99.38、98.31和97.99的Hits@1分数。

## 引言

实体对齐(EA)识别不同知识图谱(KG)中指向同一现实世界对象的实体,是知识整合的基础。现有方法通过知识图谱嵌入Chen et al. (2017);Sun et al. (2017, 2018)、图神经网络Wang et al. (2018);Cao et al. (2019);Wu et al. (2019);Sun et al. (2020a);Mao et al. (2020, 2021)或多视图和基于交互的方法Zhang et al. (2019);Tang et al. (2020)从图结构、属性和文本描述中学习可比较的表示。

然而,可靠的实体对齐不仅仅需要匹配显式的图和文本模式。同一实体可能出现在不同的语言、缩写、命名约定或不完整的描述中,而不同实体可能共享相似的名称、类型和关系上下文。传统的实体对齐方法通常缺乏识别异构描述下同一实体并将其与语义相似实体区分开所需的语义深度。

大语言模型(LLM)提供了更强的语义理解,最近被引入实体对齐领域,用于实体描述生成、信息增强和候选推理。ChatEA执行候选检索,随后进行基于LLM的推理Jiang et al. (2024a);LLM4EA使用LLM生成的注释结合主动学习Chen et al. (2024);HLMEA结合了候选过滤与LLM选择Jin et al. (2025);EasyEA将基于LLM的摘要集成到多阶段对齐框架中Cheng et al. (2025)。这些方法展示了LLM在解释异构实体信息方面的价值。

尽管如此,现有的基于LLM的方法主要将这种理解用于辅助生成或基于候选集的决策。由此产生的语义知识并未被保留为稳定且可直接比较的身份表示。因此,表示构建或匹配仍然依赖于特定的知识图谱对、跨图交互或候选集。对端知识图谱或候选上下文的更改可能需要重复的表示学习、交互或LLM推理,限制了表示复用和对齐效率。

为了解决这些限制,我们提出了IRIS,一个无需训练框架,为每个实体构建一个类似虹膜的特征签名,编码其独特且稳定的身份特征。IRIS将冻结LLM的上下文表示引导向实体身份,并将其语义理解转化为可复用的向量表示。如同用于识别的虹膜一样,每个签名旨在区分一个实体与其他实体,同时在不同异构表面实现下保持稳定。

每个IRIS签名独立地从实体所在知识图谱中的证据推导而来,无需访问对端图或候选集。因此,实体表示可以计算一次,放入共享比较空间,并在不同的知识图谱组合中复用。对齐随后通过直接向量相似度进行,避免了依赖于对的表示构建和对候选的逐次LLM推理。

主要贡献总结如下:

- •我们提出了IRIS,一个面向身份的表示引导框架,将冻结的大语言模型的上下文理解转化为稳定且具判别力的实体签名,无需实体对齐监督或参数更新。
- •IRIS将实体对齐重新定义为独立的实体编码后接直接向量比较。每个实体从其所在知识图谱中编码一次,并在不同图组合中复用,避免了依赖于对的表示构建和重复的候选LLM推理。
- •在D-Y-15K V2、DBP-WIKI、ICEWS-WIKI和ICEWS-YAGO上的大量实验证明了IRIS的有效性和通用性。最佳IRIS变体分别达到100.00、99.38、98.31和97.99的Hits@1分数,在两个ICEWS基准测试上分别比最强对比基线(基于LLM)高出10.31和4.49个百分点。

## 相关工作

### 用于实体对齐的实体表示学习

实体表示学习是实体对齐的核心。早期基于嵌入的方法从关系三元组和种子对齐中学习跨知识图谱可比较的表示Chen et al. (2017);Sun et al. (2017, 2018)。基于图的方法进一步通过图神经网络聚合邻居和关系信息Wang et al. (2018);Cao et al. (2019);Wu et al. (2019);Sun et al. (2020a);Mao et al. (2020, 2021)。后续方法将结构信息与实体名称和属性结合Zhang et al. (2019),或直接建模候选实体对之间的交互Tang et al. (2020)。

这些方法逐步丰富了实体表示,但其跨图可比性通常是通过种子监督、联合优化或跨图交互在预定义的对齐任务中建立的。而IRIS则为每个实体独立地从其自身知识图谱构建身份表示,并在表示构建完成之后才进行跨图对齐。

### 大语言模型增强的实体对齐

大语言模型最近被引入实体对齐领域,以提供超越显式知识图谱证据的语义知识。LLM4EA通过主动学习获取LLM生成的对齐注释,并减轻注释噪声Chen et al. (2024)。EasyEA结合了基于LLM的摘要、表示融合和候选选择Cheng et al. (2025)。ChatEA检索候选实体并应用对话推理来优化对齐决策Jiang et al. (2024a),而HLMEA结合了候选过滤与基于LLM的选择Jin et al. (2025)。

这些方法通常将LLM输出集成到任务特定的对齐管道中,而不是显式地构建可复用的身份表示。相比之下,IRIS直接从冻结的LLM中提取面向身份的上下文表示,并将其保留为独立于对端实体和候选集的可复用实体签名。

### 仅解码器大语言模型用于表示学习

最近的研究表明,仅解码器的LLM可以被重新用于表示学习。SGPT开发了用于GPT风格模型的语义搜索池化和微调策略Muennighoff (2022)。Echo Embeddings通过重复输入构建改进了因果表示Springer et al. (2025)。LLM2Vec通过注意力修改和面向表示的训练来适应仅解码器LLMBehnamGhader et al. (2024),而NV-Embed开发了一个专门的通用嵌入模型Lee et al. (2025)。

这些方法主要针对通用文本相似度。实体对齐额外要求表示在相同实体的异构描述之间保持稳定,同时将具有相似语义的不同实体分开。IRIS通过结构化的知识图谱上下文化和语义读出满足了这一身份特定需求,无需修改或优化冻结的LLM。

LLM的表示质量在不同Transformer层之间也有所不同。先前的工作研究了Transformer表示的内在维度、各向异性和扩张-压缩行为Valeriani et al. (2023);Razzhigaev et al. (2024)。IRIS使用内在维度作为无标签信号,为每个主干选择固定的读出层窗口。

## 方法

### 问题设置

考虑一个包含KK个知识图谱的集合,记作G={G\(k\)}k=1K\mathbb{G}=\{G^{(k)}\}_{k=1}^{K}。每个图G\(k\)=\(E\(k\),R\(k\),T\(k\)\)G^{(k)}=(\mathcal{E}^{(k)},\mathcal{R}^{(k)},\mathcal{T}^{(k)})包含一组实体、关系和关系三元组。对于一个实体e∈E\(k\)e\in\mathcal{E}^{(k)},IRIS仅使用与其所在知识图谱中ee相关的信息来构建其身份表示ze\mathbf{z}_e。这种构建不访问其他知识图谱、跨图候选或ee在特定对齐任务中的源-目标角色。

由于从不同知识图谱构建的实体表示共享一个共同比较空间,每个表示可以在对端知识图谱变化时被保留和复用。

### 概述

IRIS分三个阶段为每个实体构建一个可复用的身份签名,如图1所示。首先,它将实体及其局部知识图谱证据组织成结构化的文本上下文,并应用上下文身份补全来恢复一个互补的完整英文名称和实体类型。其次,它构建多个名称视图,并使用冻结的LLM从每个保留的视图中独立提取面向身份的表示。第三,它聚合选定的令牌和层表示,并将得到的视图表示融合成一个统一的实体签名。由于每个实体仅使用其所在知识图谱中的证据独立编码,生成的签名可以被缓存并在不同知识图谱之间直接比较。

参见图注

图1:IRIS概述。(a) 对于每个实体,IRIS独立地从其所在知识图谱中组织身份证据,并应用上下文身份补全来获得一个互补的完整英文名称和实体类型。(b) 原始名称、可用的别名以及上下文补全的名称形成多个身份视图。每个保留的视图由一个面向身份的提示处理,随后进行基于内在维度的层选择以及令牌和层感知的聚合。得到的视图表示被融合成一个可复用的实体签名。(c) 独立构建的签名存储在一个共享表示空间中,并通过直接相似度比较用于跨知识图谱实体对齐。向量索引展示了一个可扩展的检索实现;所有报告实验均使用精确的余弦相似度排名。

### 结构化局部知识图谱上下文构建

IRIS将与每个实体相关的信息组织成结构化的文本上下文,包括其名称、类型、属性和局部关系。

每个实体表示为{name}, {type}, {properties}\{name\}, \{type\}, \{properties\},其中{properties}\{properties\}表示实体记录中包含的键值对。这些字段共同构成了实体的结构化描述。

每个出边关系表示为this node -[\{relation\}]-> {target}this node -[\{relation\}]-> \{target\},其中{target}\{target\}遵循相同的实体格式。这种序列化保留了关系方向,并将邻居实体的名称、类型和属性纳入局部上下文。所有信息仅从实体所在的知识图谱中收集。

### 上下文身份补全

同一实体可能使用不同的语言、不完整的名称或缩写来描述。因此,IRIS利用结构化的局部上下文来恢复一个互补的完整英文名称和类型,同时保留原始知识图谱信息。

给定序列化的实体及其局部关系,IRIS采用以下生成模板:

专注于实体去重和消歧。实体:\{entity\} 关系:\{relations\} 确定实体的完整英文名称和类型。答案:"[full name]" 类型:[type].

这里,\{entity\}\{entity\}表示目标实体的结构化描述,\{relations\}\{relations\}包含其序列化的局部关系。下划线字段表示由冻结LLM生成的内容。IRIS首先生成完整英文名称,然后附加固定短语" 类型:"并从相同的KV缓存继续生成类型。补全的名称和类型为原始知识图谱字段补充了额外的身份线索,同时保留了知识图谱提供的信息。

### 判别性多视图表示提取

#### 互补名称视图构建。

IRIS保留原始知识图谱名称作为主视图,因为它直接来源于源数据。可用的别名和上下文补全的完整英文名称被视为

相似文章

GLiNER-Relex:联合命名实体识别与关系提取的统一框架

Hugging Face Daily Papers

GLiNER-Relex 是一个用于联合命名实体识别(NER)与关系提取(RE)的统一框架,利用共享的 Transformer 编码器实现零样本能力。该论文展示了模型在标准基准测试中具有竞争力的性能,并将其作为开源 Python 包发布。

超越静态人格:大型语言模型的情境人格引导

arXiv cs.CL

本文介绍了IRiS,一种无需训练的情境人格引导框架,它通过识别和利用情境依赖的人格神经元,超越了静态人格建模。该方法表明,大型语言模型的行为随情境变化,并提出了基于神经元的识别、检索和加权引导方法,在PersonalityBench和新增的SPBench基准上得到验证。

用于监测和分类研究文献中数据使用的AI

arXiv cs.CL

本文提出了一种基于多任务GLiNER的框架,用于可扩展地监测研究文献中的数据集使用情况。该框架利用合成数据生成和基于LLM的重新验证,以解决提取、关系识别和使用分类中的挑战。