通过记忆回溯和拓扑归因实现时间图网络的可解释性

arXiv cs.LG 论文

摘要

本文介绍了MemExplainer,一种通过拓扑归因树和记忆回溯树来归因贡献,并使用层相关性传播(LRP)提供忠实解释时间图网络(TGN)预测的方法。

arXiv:2607.07716v1 公告类型:新 摘要:时间图在实际应用中无处不在,时间图网络(TGN)已取得了卓越的预测精度。理解哪些历史事件驱动模型预测可以增强TGN的可信度。现有的解释方法忽略了记忆模块,即记录和更新节点历史的核心组件,导致过去事件的影响未被探索。为解决这一问题,我们通过拓扑归因树和记忆回溯树来归因TGN的预测。拓扑归因树捕捉邻居及其记忆向量的影响,然后记忆回溯树量化历史事件如何塑造节点的记忆向量。我们在TGN中应用LRP,确保事件的总贡献等于模型的logits。最后,由于从logits到概率的非线性映射,top-k选择可能不忠实,我们设计了优化目标来识别重要事件。在九个时间图数据集上的实验,涵盖节点属性预测、链接预测任务和图分类任务,表明我们的方法提供了忠实的解释,并优于现有的最先进基线。代码可在 https://github.com/yazhengliu/MemExplainer 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:10

# 面向时间图网络的记忆回溯与拓扑归因可解释性 来源: https://arxiv.org/html/2607.07716 ###### 摘要 时间图在实际应用中无处不在,时间图网络(TGN)已取得卓越的预测精度。理解哪些历史事件驱动模型预测,能够增强 TGN 的可信度。现有解释方法忽略了记忆模块——记录和更新节点历史的核心组件,从而未探索过去事件的影响。为应对这一挑战,我们通过拓扑归因树和记忆回溯树来归因 TGN 的预测。拓扑归因树捕捉邻居及其记忆向量的空间影响,记忆回溯树则量化历史事件如何塑造节点记忆向量。我们在 TGN 中应用 LRP,确保事件的总贡献等于模型的 logits。最后,由于从 logits 到概率的非线性映射可能导致 top-k 选择不忠实,我们设计了优化目标来识别重要事件。在九个时间图数据集上,涵盖节点属性预测、链接预测任务和图分类任务,实验表明我们的方法提供了忠实的解释,并优于最先进的基线方法。代码见 https://github.com/yazhengliu/MemExplainer。 机器学习,ICML ## 1 引言 时间图网络(TGN)[Rossi 等人,2020](https://arxiv.org/html/2607.07716#bib.bib8) 在欺诈检测 [Kim 等人,2024](https://arxiv.org/html/2607.07716#bib.bib36) 和医疗预测 [Hancox 等人,2024](https://arxiv.org/html/2607.07716#bib.bib37);Lin 等人,2025](https://arxiv.org/html/2607.07716#bib.bib38) 等实际应用中日益受到关注。TGN 将时间图作为输入。时间图可以表示为图上带时间戳的事件序列。每个事件表示为 e_k = (v, u, t_k),指示源节点 v 和目标节点 u 在时间戳 t_k 处发生交互事件。在 TGN 中,每个节点维护一个记忆向量以存储其历史信息。例如,在社交网络中,节点的记忆向量可能表示其与其他用户交互的历史,而在推荐系统中,它可能存储用户过去的偏好和活动。TGN 分两个阶段处理时间图:记忆模块和嵌入模块。在记忆模块(图 1 (b))中,事件以批处理方式提高计算效率。目标节点根据接收到的消息更新其记忆。该消息包括源节点记忆、目标节点记忆和事件特征。更新后的记忆被传递到后续批次进一步处理。在嵌入模块(图 1 (c))中,每个节点 u 获得其邻域事件 N_u[0,t] = { e_k = (v, u, t_k) | e_k ∈ E(t) },其中 t 是当前时间,E(t) 是在时间戳之前观察到的事件集合。记忆向量用于生成这些邻域事件的嵌入。事件嵌入还包括源节点记忆、目标节点记忆和事件特征。每个节点聚合这些邻域事件嵌入,形成自己的节点嵌入。为了预测两个目标节点之间是否存在边,使用这些节点的嵌入进行预测。记忆和嵌入模块使 TGN 能够捕获时间图中的结构和时间依赖关系,并提高预测精度。 参见图注 图 1: TGN 概述及我们的可解释性框架。(a) 时间图:每个节点有一个记忆向量,每个事件有特征。(b) TGN 中的记忆模块:事件按批次处理。在批次 1 中,节点 3 和 2 更新其记忆,因为它们接收到来自事件 e1 和 e2 的消息。对于事件 e1 = (1,3,t1),消息由源节点 1 的记忆、目标节点 3 的记忆和 e1 的特征构建。更新后的记忆被传递到批次 2 进行进一步处理。(c) TGN 中的嵌入模块:对于目标节点 2 和 4,邻域事件为 e2 和 e4。e4 的嵌入基于节点 3 和 4 的记忆以及事件特征。事件嵌入被聚合以生成节点 4 的嵌入,用于预测。(d) 现有解释方法。现有的解释方法固定记忆,从而忽略了历史事件如何更新节点记忆。结果,它们可能获得不忠实的解释。(e) 所提出的框架:我们构建拓扑归因树以量化邻域事件的空间贡献和节点记忆的时间贡献(第 4.2 节)。然后我们构建记忆回溯树以跟踪历史事件对节点记忆的长期影响(第 4.3 节)。邻域事件和历史事件的总贡献等于 logits。 尽管 TGN 具有强大的预测性能,但它们仍然是黑箱模型。TGN 几乎不提供关于预测如何依赖历史事件的透明度。增强可解释性对于提高 TGN 的可信度并确保其在欺诈检测和医疗等高风险领域的安全部署至关重要。针对静态图神经网络,已提出了多种解释方法,如 GNNExplainer [Ying 等人,2019](https://arxiv.org/html/2607.07716#bib.bib9)、PGExplainer [Luo 等人,2020](https://arxiv.org/html/2607.07716#bib.bib10) 和 FlowX [Gui 等人,2023](https://arxiv.org/html/2607.07716#bib.bib11)。这些方法通常识别出对静态图预测贡献最大的重要边、节点或子图的小子集。最近有一些针对 TGN 可解释性的尝试,例如 T-GNNExplainer [Xia 等人,2022](https://arxiv.org/html/2607.07716#bib.bib12) 和 TempME [Chen and Ying, 2023](https://arxiv.org/html/2607.07716#bib.bib13)。然而,上述所有方法都固定了最终的记忆向量(图 1 (d))。固定记忆向量意味着它们忽略了历史事件如何更新节点记忆。在 TGN 中,目标节点嵌入既捕获节点记忆中的时间信息,也捕获邻域事件中的空间信息。因此,固定记忆向量将解释方法限制在时间图的拓扑结构上,忽视了记忆模块的关键作用。结果,这些解释方法导致不准确的归因和不忠实的解释。 为应对时间图解释的挑战,我们提出了一个框架,将 TGN 的预测归因于邻域事件和历史事件,同时考虑邻居之间的空间交互和节点记忆的更新(图 1 (e))。首先,我们构建拓扑归因树以量化邻域事件的空间贡献和节点记忆的时间贡献。然后我们构建记忆回溯树以跟踪历史事件对节点记忆的长期影响。我们将层级相关性传播(LRP)[Bach 等人,2015](https://arxiv.org/html/2607.07716#bib.bib16) 方法应用于 TGN 模型,并确保在构建拓扑归因树时,邻域事件和节点记忆的贡献之和等于 logits。在记忆回溯树中,事件的贡献之和等于所有节点的总记忆贡献。因此,我们的方法实现了守恒性,即所有事件贡献之和等于 logits。这一守恒性质使我们能够推导出 KL 散度并制定优化问题,以选择重要事件作为解释。在涵盖节点属性预测、链接预测和图分类的九个时间图数据集上的实验证明了我们方法的有效性,它始终优于四个最先进的基线方法,突显了追踪节点记忆的优势。我们的方法与第二佳基线之间的 t 检验显示,在 77% 的案例中 Fidelity_KL 具有统计显著性,在 74% 的案例中 Fidelity_prob 具有统计显著性。 ## 2 相关工作 **GNN 可解释性** 图神经网络的可解释性方法大致可分为实例级和模型级方法 [Yuan 等人,2022](https://arxiv.org/html/2607.07716#bib.bib32)。实例级解释方法侧重于通过识别与预测高度相关的重要子图来解释模型预测。例如,基于梯度/特征的技术,如 CAM 和 GradCAM [Pope 等人,2019](https://arxiv.org/html/2607.07716#bib.bib14),利用梯度识别重要节点。基于扰动的方法,如 GNNexplainer [Ying 等人,2019](https://arxiv.org/html/2607.07716#bib.bib9)、PGExplainer [Luo 等人,2020](https://arxiv.org/html/2607.07716#bib.bib10),通过学习边掩码最大化互信息来解释预测的类别分布。基于分解的方法,如 GNN-LRP [Schnake 等人,2020](https://arxiv.org/html/2607.07716#bib.bib15),将原始 LRP [Bach 等人,2015](https://arxiv.org/html/2607.07716#bib.bib16) 算法扩展到 GNN,并将重要性归因于图游走。基于代理的方法,如 GraphLime [Huang 等人,2020](https://arxiv.org/html/2607.07716#bib.bib17),通过基于核的特征选择构建代理模型以提供节点特征解释。模型级解释方法 [Yuan 等人,2020](https://arxiv.org/html/2607.07716#bib.bib39) 生成关于 GNN 一般行为的高级解释。然而,这些方法是为静态图设计的,无法解释时间图模型。它们无法捕获与图拓扑混合的时间依赖关系。 **TGN 可解释性** TGNNExplainer [Xia 等人,2022](https://arxiv.org/html/2607.07716#bib.bib12) 是第一个专为 TGN 定制的解释器,它依赖 MCTS 算法搜索解释性事件的组合。TempME [Chen and Ying, 2023](https://arxiv.org/html/2607.07716#bib.bib13) 基于信息瓶颈原则提取与交互最相关的模体。最近的工作 [He 等人,2022](https://arxiv.org/html/2607.07716#bib.bib18) 利用概率图模型为图上的离散时间序列生成解释,而连续时间设置仍未被充分探索。然而,这些方法忽视了 TGN 中负责随时间维护和更新节点状态的记忆模块。因此,它们未能捕获历史交互如何在记忆中积累并直接影响未来预测,从而未能解释 TGN 的核心机制。 ## 3 TGN 预备知识 时间图定义为时间戳 t 的函数,记作 G(t) = {V(t), E(t)},其中 V(t) 和 E(t) 分别表示时间戳 t 之前观察到的节点集合和事件集合。每个事件 e_k = (v, u, t_k) ∈ E(t) 表示源节点 v 和目标节点 u 在时间戳 t_k 处的交互,且 t_k < t。令 x_u ∈ R^{1×d_m} 和 x_{e_k} ∈ R^{1×d_e} 分别表示节点 u 和事件 e_k 的特征向量。在 TGN 中,每个节点 u 在时间戳 t 处维护一个记忆向量 s_u^t ∈ R^{1×d_m}。s_u^{t-} ∈ R^{1×d_m} 表示节点 u 在时间戳 t 之前的记忆向量。 时间图网络 [Rossi 等人,2020](https://arxiv.org/html/2607.07716#bib.bib8) 可以被视为一个编码器-解码器框架。编码器将时间图 G(t) 映射为时间感知的节点嵌入,而解码器则使用一个或多个嵌入获得特定任务的预测,例如节点属性预测或链接预测。每当节点参与一个事件时,其记忆就会被更新。TGN 通过四个步骤计算节点嵌入 z_u^t ∈ R^{d_m}:
m_u^t = f_message(s_v^{t-}, s_u^{t-}, x_{e_k}, t - t_k) (1)
\bar{m}_u^t = f_agg(m_u^{t_1}, ..., m_u^{t_b}) (2)
s_u^t = f_update(\bar{m}_u^t, s_u^{t-}) (3)
z_u^t = ∑_{e_k ∈ N_u^n([0,t])} f_emb(s_u^t, s_v^t, x_{e_k}, x_u, x_v) (4)

这里,消息函数 f_message 基于记忆 s_u^{t-}、s_v^{t-}、事件特征 x_{e_k} 和经过时间 t - t_k 计算目标节点 u 的消息。f_message 可以是恒等映射或 MLP。如果在同一批次中收到多条消息,消息聚合器 f_agg 将这些消息组合起来,可以是选择最新消息或取均值,且 t_1, ..., t_b ≤ t。记忆更新器 f_update 更新节点的记忆,通常使用 LSTM 或 GRU。令 N_u[0,t] = { e_k | e_k = (v, u, t_k) ∈ E(t) } 表示节点 u 在时间间隔内的邻域,N_u^n[0,t] 表示从 N_u[0,t] 中取最近 n 个交互的集合,其中 t 是当前时间。对于每个事件,嵌入函数 f_emb 将目标节点及其邻居的记忆向量与相关事件和节点特征结合,生成事件特定的表示。f_emb 可以实现为时间图注意力或图求和函数。节点嵌入被输入 MLP 以获得特定任务的预测。对于链接预测,给定两个节点 v 和 u 在时间 t,预测得分计算为 \hat{y}_{v,u} = σ(f_mlp([z_v^t || z_u^t])),其中 [· || ·] 表示向量拼接。

相似文章

图神经网络Top-k解释中的自同构诱导非规范性问题

arXiv cs.LG

本文揭示了图神经网络top-k解释中的一个根本问题:输入图中的自同构导致解释不唯一,因为模型无法区分对称元素。作者提出了一个检测这种任意性的标准,并利用Lean 4中的自动推理对其进行了验证,表明该问题在分子数据集中广泛存在。

基于反事实链和因果图的LLM可解释性

Hugging Face Daily Papers

本文提出了一种四阶段方法,用于构建建模LLM推理过程的因果图,利用反事实增强实现稳定的因果发现,并提供透明、概念级的可解释性。