AdaTKG:用于时序知识图谱推理的自适应记忆

arXiv cs.AI 论文

摘要

本文提出了 AdaTKG,一种用于时序知识图谱推理的方法,它利用自适应记忆随着新交互的发生动态优化实体表示,从而在性能上优于静态基线。

arXiv:2605.07121v1 公告类型:新文章 摘要:时序知识图谱(TKG)表示带有时间戳的关系事实,并支持针对演化事件的各种推理任务。然而,现有方法在实体层面产生的实体表示是静态的,即每个表示仅是学习参数的函数,不保留该实体所参与的交互痕迹。在本文中,我们摒弃这种静态观点,提出将每个实体建模为一个自适应过程,其表示在实体每次参与事实时都会得到优化。为此,我们提出了 AdaTKG,它为每个实体维护一个记忆,随着每次观测到的交互进行更新,记忆在线累积,且随着更多交互的到来,预测效果不断提升。具体而言,我们将记忆更新实例化为一个由单一共享标量控制的可学习指数移动平均,而不是为每个实体使用可学习参数,从而使 AdaTKG 能够处理训练中未见过的实体。大量实验证实了相比 TKG 基线的一致增益,证明了自适应记忆的有效性。代码已公开于:https://github.com/seunghan96/AdaTKG。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:13

# 用于时序知识图谱推理的自适应记忆

**来源:** https://arxiv.org/html/2605.07121
**作者:** Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim Tae Yoon Lim, Dongwan Kang, Hwanil Choi, SoonYoung Lee, Wonbin Ahn
**机构:** LG AI Research, Seoul, South Korea

###### 摘要

时序知识图谱(TKGs)表示带时间戳的关系事实,并支持对演变事件进行广泛的推理任务。然而,现有方法生成的实体表示在实体层面是**静态**的,即每个表示仅是学习参数的函数,且不保留该实体参与的交互痕迹。在本文中,我们摒弃了这种静态观点,提出将每个实体建模为一个**自适应过程**,每当实体参与一个事实时,其表示都会得到细化。为此,我们提出了 **AdaTKG**,它维护一个每实体的**记忆**,并随着每次观察到的交互进行更新,记忆在线积累,随着更多交互的到来预测效果不断提升。具体而言,我们将记忆更新实例化为一个可学习的指数移动平均(EMA),由一个**共享标量**控制,而不是为每个实体使用可学习参数,从而使 AdaTKG 能够处理训练期间未见的实体。广泛的实验证实,AdaTKG 在 TKG 基线方法上取得了 consistent 的增益,证明了自适应记忆的有效性。代码公开于:https://github.com/seunghan96/AdaTKG。

## 1 引言

时序知识图谱(TKGs)将现实世界的事实组织成带时间戳的关系四元组,已成为对随时间演变的事件进行推理的基础 Cai et al. (2023) (https://arxiv.org/html/2605.07121#bib.bib1)。它们支持事件预测和风险分析等应用,这些应用通常被框架化为预测未来时间戳下缺失的实体或关系。大量工作研究了在此类图谱上学习时序动态 Li et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib6); Xu et al. (2023b) (https://arxiv.org/html/2605.07121#bib.bib7); Li et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib8); Chen et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib9); Fang et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib10); Liao et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib11); Wang et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib12),这些模型构成了 TKG 推理管道的主干。

尽管取得了 rapid progress,但本质上所有现有的 TKG 推理方法都共享一个 largely unexamined 的共同设计选择:任何给定实体的表示在实体层面都是**静态**的,即它仅是学习参数的函数,且**不携带**该实体所参与交互的任何痕迹。即使对于近期旨在处理训练期间未见实体的归纳方法 Me et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib19); Ding et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib20); Pan et al. (2025) (https://arxiv.org/html/2605.07121#bib.bib21); Anonymous (2026) (https://arxiv.org/html/2605.07121#bib.bib36),这一点也成立。

> **图 1: 自适应 TKG 推理。** 我们的框架通过每次交互细化的**记忆**实现**自适应性**。

虽然近期工作关注 TKG 推理器是否能够处理训练时未出现的新兴实体(transductive vs. inductive),但我们关注另一个方面,即**每当实体参与一个事实时,其实体的表示是否得到细化**,我们将此形式化为**静态 vs. 自适应**的区别。我们主张,每个实体都应被建模为一个**自适应过程**,其表示随着每次交互而细化,如图 1 (https://arxiv.org/html/2605.07121#S1.F1) 所示。为此,我们提出了 **AdaTKG**,这是一种自适应归纳 TKG 推理方法,通过每实体记忆来细化每个实体的表示,该记忆在实体参与事实时更新。具体而言,我们将记忆更新实例化为一个可学习的指数移动平均(EMA),通过单个可学习标量将先前记忆与每个新观察到的交互混合。由于该参数在实体间**共享**而非为每个实体分配,AdaTKG 能够在保持高效的同时,对训练期间未见的实体实现归纳推理。

我们的主要贡献如下:

- 我们论证 TKG 推理应在实体层面是**自适应**的,每个实体的表示应通过其自身的交互进行细化,而不是从固定的查找表中读取。这除了 transductive vs. inductive 之外,为 TKG 推理定义了一个新维度,即**静态 vs. 自适应**。
- 我们通过 **AdaTKG** 实例化了这一原则,其中可学习的 EMA 通过**单个共享标量参数**将每个实体的过去记忆与新交互混合。由于没有引入每实体的可学习参数,该机制直接适用于训练期间未见的实体。
- 我们进行了广泛的实验,表明 AdaTKG 始终优于强大的 TKG 基线,且随着观察到更多每个实体的交互,增益不断增长。这提供了直接证据,表明实体层面的**自适应性**是 TKG 推理的关键组成部分。

## 2 相关工作

**TKG 上的推理。** 时序知识图谱(TKG)上的推理旨在通过对实体和关系的时序演化进行建模,推断缺失或未来的事实 Cai et al. (2023) (https://arxiv.org/html/2605.07121#bib.bib1)。 prior work 通常分为**插值** Garcia-Duran et al. (2018) (https://arxiv.org/html/2605.07121#bib.bib2); Lacroix et al. (2020) (https://arxiv.org/html/2605.07121#bib.bib3); Xiong et al. (2024b) (https://arxiv.org/html/2605.07121#bib.bib4) 和**外推** Zhu et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib5); Li et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib6); Xu et al. (2023b) (https://arxiv.org/html/2605.07121#bib.bib7); Li et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib8); Chen et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib9),近期方法更多地利用 Transformer 架构和语言模型 Fang et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib10); Liao et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib11); Wang et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib12)。然而,这些方法基于封闭世界假设,并随机初始化任何新实体的嵌入,导致每当没有历史交互的实体出现时发生表示崩溃 Zbontar et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib22)。

**KG 上的归纳推理。** 静态 KG 上的归纳学习旨在泛化到训练期间未见的实体,代表性方法利用子图结构 Teru et al. (2020) (https://arxiv.org/html/2605.07121#bib.bib13); Chen et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib14); Liu et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib15)、元学习 Chen et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib16)、关系感知注意力 Lee et al. (2023b) (https://arxiv.org/html/2605.07121#bib.bib17) 或跨图零样本迁移 Galkin et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib18)。将归纳性扩展到时序设置,ALRE-IR Me et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib19)、zrLLM Ding et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib20) 和 POSTRA Pan et al. (2025) (https://arxiv.org/html/2605.07121#bib.bib21) 针对有限监督下的未见关系或实体,而 TransFIR Anonymous (2026) (https://arxiv.org/html/2605.07121#bib.bib36) 最近通过从同一集群向每个新兴实体转移**类型级别**的行为原型确立了 state of the art。

在上述方法中,实体表示在实体层面是**静态**的,仅是学习参数的函数。据我们所知,AdaTKG 是第一个在实体层面具有**自适应性**的 TKG 推理方法,它为每个实体维护一个记忆,并随着每次交互进行更新。更多相关工作见附录 E (https://arxiv.org/html/2605.07121#A5)。

## 3 问题定义

**时序知识图谱(TKG)。** TKG 是时间戳快照的序列 $\mathcal{G}=\{\mathcal{G}_t\}_{t\in\mathcal{T}}, \quad \mathcal{G}_t=(\mathcal{E}_{1:t}, \mathcal{R}, \mathcal{F}_t)$,其中 $\mathcal{T}$ 是离散时间戳集合,$\mathcal{E}_{1:t}$ 表示截至时间 $t$ 观察到的实体集合,$\mathcal{R}$ 是关系集合,$\mathcal{F}_t\subseteq\mathcal{E}_{1:t}\times\mathcal{R}\times\mathcal{E}_{1:t}\times\{t\}$ 是在时间 $t$ 成立的时间戳事实集合。每个事实写为四元组 $(e_s, r, e_o, t)$,其中 $e_s, e_o \in \mathcal{E}_{1:t}$ 是主体和客体实体,$r \in \mathcal{R}$ 是它们的关系。截至时间 $t_q$ 可用的累积历史为 $\mathcal{H}_{t_q} = \bigcup_{i<t_q}\mathcal{F}_i$。

**TKG 中的链接预测任务。** 给定时间戳 $t_q$ 位于未来的查询 $(e_s, r, ?, t_q)$,TKG 链接预测任务是通过在历史 $\mathcal{H}_{t_q}$ 条件下的评分函数 $\phi(\cdot)$ 下对实体池中每个候选者 $e \in \mathcal{E}$ 进行排序,来恢复缺失的实体。遵循外推协议,数据集按时间顺序分割,以便在训练期间不泄露未来信息。由于测试查询是按时间排序的,该协议通过设计打破了 i.i.d. 假设,因为在评分较晚查询时,较早的事实进入 $\mathcal{H}_{t_q}$。

**新兴实体。** 设实体 $e$ 的首次出现时间为 $t_e(e) = \min\{ t\in\mathcal{T} \mid e \text{ appears in some fact of } \mathcal{F}_t \}$。在时间戳 $t$,实体 $e$ 是**新兴实体**如果 $e \in \mathcal{E}_{1:t} \setminus \mathcal{E}_{1:t-1}$,且其在 $t_q=t_e(e)$ 的参与没有任何先验历史。遵循 prior works Lee et al. (2023b) (https://arxiv.org/html/2605.07121#bib.bib17); Anonymous (2026) (https://arxiv.org/html/2605.07121#bib.bib36),我们将此设置作为主要挑战,专注于实体进入图谱的时刻。这在现实世界的 TKG 中经常发生,并且由于该实体没有可用的交互历史,使得推理变得困难 Cai et al. (2023) (https://arxiv.org/html/2605.07121#bib.bib1)。

## 4 从静态 TKG 到自适应 TKG

在本节中,我们将代表性 prior methods 和我们的提议归纳为统一的评分形式。令 $\mathbf{h}_e \in \mathbb{R}^d$ 表示实体 $e$ 的**基础表示**,$\mathbf{h}_r \in \mathbb{R}^d$ 表示关系 $r$ 的嵌入。对于查询 $(e_q, r_q, ?, t_q)$,分配给候选者 $e_o$ 的分数采用统一形式 $\phi_{t_q}(e_q, r_q, e_o) = f(\mathbf{z}^{(t_q)}_{e_q}, \mathbf{h}_{r_q}, \mathbf{z}^{(t_q)}_{e_o})$,其中 $f(\cdot)$ 是关系解码器(例如,ConvTransE Shan et al. (2019) (https://arxiv.org/html/2605.07121#bib.bib33)),$\mathbf{z}^{(t_q)}_{e}$ 是在时间 $t_q$ 用于推理的实体 $e$ 的**有效**表示。这些公式的区别仅在于如何构建 $\mathbf{z}^{(t_q)}_{e}$,比较如表 3 (https://arxiv.org/html/2605.07121#S4.F3) 所示。

> **图 2: TKG 上的代表性公式。** 我们认为实体不应是**静态**的,而应是一个**自适应过程**,每当它参与事实时其表示得到细化。为简便起见,我们省略了上标 $(t_q)$。
>
> **图 3: 我们的方法:自适应 + 归纳。**

**范式 1: 静态 + 传递性。** 传统方法 Li et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib6); Xu et al. (2023b) (https://arxiv.org/html/2605.07121#bib.bib7); Li et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib8); Chen et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib9) 从训练事实中学习每个实体的查找嵌入 $\mathbf{z}^{(t_q)}_e = \mathbf{h}_e, \quad \mathbf{h}_e \in \mathbb{R}^d, \;\; e \in \mathcal{E}_{1:T_{\text{tr}}}$,其中 $T_{\text{tr}}$ 是最终训练时间戳。该表示是**静态**的,即 $\mathbf{h}_e$ 仅是学习参数的函数,且**不携带** $e$ 自身交互的痕迹,并且是**传递**的,因为只有训练期间见过的实体才有定义良好的嵌入。然而,对于新兴实体,$\mathbf{h}_e$ 要么未定义要么随机初始化,导致表示崩溃 Zbontar et al. (2021) (https://arxiv.org/html/2605.07121#bib.bib22)。

**范式 2: 静态 + 归纳。** 为了处理新兴实体,近期 TKG 方法 Me et al. (2022) (https://arxiv.org/html/2605.07121#bib.bib19); Ding et al. (2024) (https://arxiv.org/html/2605.07121#bib.bib20); Pan et al. (2025) (https://arxiv.org/html/2605.07121#bib.bib21) 从外部来源(例如,预训练文本编码器)获取 $\mathbf{h}_e$,并通过来自语义相似实体的**类型级别信号**对其进行增强。设 $\pi(e) \in \{1,\dots,K\}$ 为 $e$ 在 learned codebook 下的聚类索引,并设 $\mathbf{c}_{k, t}$ 表示时间 $t$ 下聚类 $k$ 的原型,由其成员的交互模式池化得出 Anonymous (2026) (https://arxiv.org/html/2605.07121#bib.bib36)。然后,有效表示使用参数化转移门 $\Psi(\cdot)$ 计算为 $\mathbf{z}^{(t_q)}_e = \mathbf{h}_e + \omega_e \cdot \mathbf{c}_{\pi(e), t_q}, \quad \omega_e = \Psi([\mathbf{h}_e \| \mathbf{c}_{\pi(e), t_q}])$。该范式是**归纳**的,因为它允许新兴实体仍然被评分,因为 $\mathbf{c}_{\pi(e), t_q}$ 源自聚类同伴而非 $e$ 本身。然而,转移是**静态**的,因为 $\mathbf{z}^{(t_q)}_e$ 仍然是 $\mathbf{h}_e$ 和 $\mathbf{c}_{\pi(e), t_q}$ 的函数,且**不纳入**除它们之外的任何每实体状态。

**范式 3: 自适应 + 归纳。** 我们认为实体不应被视为**静态**表示,而应视为一个**自适应过程**,每当实体参与事实时其表示得到细化。为此,我们为每个实体引入一个**记忆** $\mathbf{m}^{(\tau)}_e \in \mathbb{R}^d$,每当 $e$ 参与事实时通过前向传播进行更新,其中 $\tau$ 计算更新次数。给定总结触发 $e$ 第 $\tau$ 次更新的交互的信号 $\mathbf{x}^{(\tau)}_e$,记忆更新为 $\mathbf{m}^{(\tau)}_e = \mathcal{U}(\mathbf{m}^{(\tau-1)}_e, \mathbf{x}^{(\tau)}_e), \quad \mathbf{m}^{(0)}_e = \mathbf{0}$,其中 $\mathcal{U}(\cdot, \cdot)$

相似文章

面向时序知识图谱推理的显著性感知评估

arXiv cs.AI

本文提出了一种面向时序知识图谱推理(TKGR)的显著性感知评估框架,该框架根据事件的稀有性对其加权,以更好地评估模型推理能力,解决了由琐碎重复事件导致的过高估计问题。

GRATE:通过门控旋转注意力实现归纳知识图谱基础模型的时间扩展

arXiv cs.AI

本文提出 GRATE(用于时间编码的门控旋转注意力),一种无参数的时间编码方法,通过结合相对时间差和查询条件门控来增强归纳知识图谱基础模型。同时引入了新的归纳时间知识图谱基准(GDELTIndT 和 WIKIIndT)以评估跨数据集迁移,展示了相比静态基础模型的性能提升。

Zep:一种用于智能体记忆的时序知识图谱架构

Papers with Code Trending

本文介绍了 Zep,这是一种用于智能体(agent)记忆的时间知识图谱架构,在 DMR 和 LongMemEval 等基准测试中表现优于 MemGPT。文章强调了 Zep 在企业级用例中处理动态知识融合和时间推理的能力。

SABET-QA:时序知识图谱问答

arXiv cs.CL

SABET-QA 提出了一个用于时序知识图谱问答的迭代框架,通过双向实体-时序评分和上下文化增强了多跳推理,并在 CronQuestions 和 TimeQuestions 等基准测试中显示出相对于基线的一致改进。