TERGAD: 面向图异常检测的结构感知文本增强表示

arXiv cs.CL 论文

摘要

TERGAD是一种新颖的数据增强框架,利用大语言模型将节点级别的拓扑属性转化为语义描述,然后通过门控双分支自编码器将这些语义描述与原始节点属性融合,用于图异常检测,在六个数据集上取得了最先进的结果。

arXiv:2605.19738v1 公告类型:新 摘要:图异常检测(GAD)旨在识别异常图实体,例如节点、边或子结构,这些实体与大多数实体显著不同。虽然现有的文本丰富方法通常利用原始文本特征将结构上下文集成到数据表示流程中,但它们常常忽略了节点的结构上下文。这一限制阻碍了它们检测由节点固有内容与其拓扑角色不一致所导致的复杂异常的能力。为了弥补这一差距,我们提出了TERGAD(面向图异常检测的结构感知文本增强表示),这是一种新颖的数据增强框架,通过大语言模型(LLM)的语义推理能力来丰富GAD的结构语义。具体而言,TERGAD将节点级别的拓扑属性转换为描述性自然语言叙述,随后由LLM处理以生成高级语义嵌入。然后,通过门控双分支自编码器将这些嵌入与原始节点属性自适应融合,以联合重建图结构和节点特征。异常分数基于综合重建误差计算,有效捕获可观测属性和LLM告知的语义期望中的偏差。在六个真实世界数据集上的大量实验表明,TERGAD持续优于最先进的基线方法。此外,我们的消融研究验证了结构语义指导不可或缺的作用以及门控融合机制的有效性。代码可在 https://github.com/Kantorakitty/TERGAD-main 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:26

# TERGAD: 结构感知文本增强表示用于图异常检测
来源:https://arxiv.org/html/2605.19738
Wen Shi, Zhe Wang, Huafei Huang, Qing Qing, Ziqi Xu, Qixin Zhang, Xikun Zhang, Renqiang Luo, Feng Xia

施文、王哲、青青和罗仁强来自吉林大学计算机科学与技术学院,长春130012,中国 \(\{shiwen24, qingqing25\}@mails\.jlu\.edu\.cn, \{wz2000, lrenqiang\}@jlu\.edu\.cn\)\.
Huafei Huang 来自阿德莱德大学计算机科学与信息技术学院,阿德莱德SA5095,澳大利亚(电子邮件:hhuafei@outlook\.com)\.
Ziqi Xu、Xikun Zhang 和 Feng Xia 来自RMIT大学计算技术学院,墨尔本,VIC 3000,澳大利亚(电子邮件:\{ziqi\.xu, xikun\.zhang\}@rmit\.edu\.au, f\.xia@ieee\.org)\.
Qixin Zhang 来自南洋理工大学计算与数据科学学院,639798,新加坡(电子邮件:qixin\.zhang2026@gmail\.com)\.
通讯作者:Xikun Zhang, Renqiang Luo.

###### 摘要

图异常检测(GAD)旨在识别与大多数节点显著偏离的非典型图实体,如节点、边或子结构。现有基于文本丰富的方法通常将结构上下文通过原始文本特征集成到数据表示流程中,但往往忽视了节点的结构上下文。这一局限阻碍了它们检测由节点内在内容与其拓扑角色不一致导致的复杂异常的能力。为了弥补这一差距,我们提出TERGAD(结构感知文本增强表示用于图异常检测),一种新颖的数据增强框架,通过大型语言模型(LLMs)的语义推理能力增强结构语义。具体来说,TERGAD将节点级拓扑属性转化为描述性自然语言叙述,然后由LLM处理以提取高层语义嵌入。这些嵌入通过门控双分支自编码器与原始节点属性自适应融合,共同重构图结构和节点特征。异常分数基于整合的重构误差计算,有效捕捉了可观察属性和LLM告知的语义期望中的偏差。在六个真实世界数据集上的广泛实验表明,TERGAD持续优于最先进的基线方法。此外,我们的消融研究验证了结构语义指导的不可或缺作用以及门控融合机制的有效性。代码可在 https://github.com/Kantorakitty/TERGAD-main 获取。

## I. 引言

图异常检测(GAD)旨在识别与图数据库中大多数模式显著偏离的非典型图对象,如节点、边或子结构[33 (https://arxiv.org/html/2605.19738#bib.bib33)]。这一任务在高风险领域变得不可或缺,包括金融欺诈预防[14 (https://arxiv.org/html/2605.19738#bib.bib14)]、网络入侵检测[29 (https://arxiv.org/html/2605.19738#bib.bib32)]和社交网络垃圾过滤[25 (https://arxiv.org/html/2605.19738#bib.bib27)]。现实世界数据的日益互联以及图数据挖掘的快速发展在过去十年中显著提升了人们对GAD的兴趣[15 (https://arxiv.org/html/2605.19738#bib.bib15)]。一个关键转变是从依赖人类专家知识转向传统机器学习,以及最近转向复杂的深度学习技术[6 (https://arxiv.org/html/2605.19738#bib.bib7)]。这些深度学习方法通过从海量数据中端到端地学习复杂非线性模式,无需手动特征工程,从而提升了检测性能[16 (https://arxiv.org/html/2605.19738#bib.bib16)]。

然而,在许多现实场景中,图是“文本贫乏”的或纯结构的,仅由节点和边组成,没有丰富的描述性属性。这种显式语义信息的缺失构成了重大挑战,因为异常节点往往隐藏在微妙的结构模式中,仅凭数值特征难以区分[24 (https://arxiv.org/html/2605.19738#bib.bib26),12 (https://arxiv.org/html/2605.19738#bib.bib13)]。基于重构的分析已成为检测这些异常的常用方法,通过识别模型无法从学习表示中准确重构的节点。然而,现有方法在数据表示流程中常常难以解释节点位置的功能意义,因为它们依赖于原始邻接矩阵或基本度统计[30 (https://arxiv.org/html/2605.19738#bib.bib31)]。这一局限源于无法将抽象拓扑模式转化为提供节点行为更高层次理解的语义丰富表示。例如,具有高聚类系数的节点在一个社区中可能是正常枢纽,而在另一个社区中可能是恶意桥梁,这种细微差别是数值特征工程流程经常忽略的。

为了克服节点属性的稀疏性,我们探索了通过大型语言模型(LLMs)将结构模式转化为文本丰富表示作为数据增强策略的潜力[11 (https://arxiv.org/html/2605.19738#bib.bib12)]。一个新兴范式是将图拓扑转化为自然语言描述,使模型能够利用LLM强大的推理能力进行结构理解。例如,最近的工作尝试提示LLM基于图连接性生成解释或标签[8 (https://arxiv.org/html/2605.19738#bib.bib8),7 (https://arxiv.org/html/2605.19738#bib.bib6)]。这些方法在受益于自然语言推理和外部知识整合的任务中显示出有前景的结果[13 (https://arxiv.org/html/2605.19738#bib.bib11)]。然而,标准的Graph2Text方法存在关键局限,例如要求LLM从冗长的序列文本描述中推断隐含结构。此外,这些方法常常生成过长的序列,超出大多数LLM的实际上下文窗口,使其无法扩展到大规模图数据。此外,大多数现有方法缺少显式机制,在统一的特征集成框架中平衡这些新生成的语义先验与图的原始结构属性。

为了进一步研究LLM在此领域的直接适用性,我们进行了一项初步研究,评估了香草LLM在GAD任务上的表现。结果(图1 (https://arxiv.org/html/2605.19738#S1.F1))显示其零样本性能显著落后于基于GCN的GAD模型,表明LLM在未经过专门适应时难以内在把握底层结构异常。这些发现强调了有效利用LLM进行图异常检测的非平凡性,并激发了更集成的语义-结构方法的需求。

![图1](caption)
图1:DOMINANT(一种传统基于GCN的方法)与四种代表性LLM的性能比较。显著性能差距激发了在基于LLM的GAD中采用集成语义-结构方法的需求。

解决这些差距引出了一个基本问题:我们能否通过LLM合成文本丰富表示来有效增强结构图学习?回答这个问题需要克服关于效率与集成的几个技术障碍。首先,我们必须确定如何在结构化数据转换流程中有效将抽象图拓扑转化为语义丰富且计算高效的文本描述。其次,以互补方式将这些LLM派生的语义见解与专门的图学习模型集成至关重要。第三,我们需要设计一个框架,共同优化合成的语义一致性和原生结构信息,以用于异常检测任务。有效平衡这些多模态信号对于捕捉在属性贫乏网络中表征复杂异常的微妙偏差至关重要。
我们的工作通过在一个统一的数据处理框架中建立原始结构信息与基于LLM的语义理解之间的关键联系,来应对这些挑战。我们提出TERGAD,一个用于结构感知文本增强表示的图异常检测新颖框架,该框架在原始结构信息和基于LLM的语义推理之间建立了关键联系。具体来说,我们的框架通过生成描述每个节点在网络中独特结构角色的自然语言描述来丰富节点表示。这是通过精心设计的模板实现的,这些模板将复杂的拓扑度量(如中心性和社区成员身份)转化为简洁且可解释的文本角色。然后,门控双分支自编码器通过可学习的门控机制自适应地融合这些合成的语义嵌入与原始结构特征。该架构共同重构合成的语义描述和底层图结构,异常分数反映两个域中的偏差。我们的主要贡献总结如下:

- **为异常检测构建文本丰富图**。我们提出TERGAD,一个通过系统化语义增强流程集成来自LLM的显式结构语义来解决属性稀疏性的框架。通过将拓扑转化为自然语言,我们将纯结构图转化为文本丰富表示,以实现更稳健的检测。
- **语义引导的图编码与自适应融合**。我们引入了一种基于结构化模板的方法,通过LLM编码拓扑角色,随后进行自适应融合机制。这使得模型能够根据每个节点的具体上下文,选择性地集成高层语义先验与原始结构数据。
- **广泛的经验验证**。我们在六个真实世界数据集上进行了全面实验,以评估所提出框架在实际数据工程中的有效性。结果表明TERGAD持续优于最先进的GAD方法。

## II. 相关工作

### II-A. 用于图学习的LLMs

近期LLMs的进展激发了将其推理能力应用于图的兴趣日益增长[32 (https://arxiv.org/html/2605.19738#bib.bib34)]。一个主导范式是通过结构化数据转换流程(通常称为Graph2Text)将图拓扑转化为自然语言描述,然后由冻结的LLM处理生成语义节点特征[31 (https://arxiv.org/html/2605.19738#bib.bib35)]。例如,一个用于维基数据的统一破坏检测系统采用Graph2Text方法将复杂的事实三元组和多语言编辑转化为单一文本空间,使语言模型能够评估结构和内容变化以检测潜在的知识改动[22 (https://arxiv.org/html/2605.19738#bib.bib23)]。类似地,GPT4Graph[7 (https://arxiv.org/html/2605.19738#bib.bib6)]系统通过将图转化为各种文本格式(如邻接表和GraphML)来系统评估LLM的结构理解能力。然而,Graph2Text方法在数据处理效率方面存在两个关键局限:它迫使LLM从序列文本推断隐含图结构,相比于原生图学习器效率较低;并且常常生成超出LLM上下文窗口的过长序列。为解决这些问题,InstructGLM[27 (https://arxiv.org/html/2605.19738#bib.bib29)]提出直接在图上对LLM进行指令微调,使用可扩展的自然语言提示显式描述多跳邻居。另一方面,GraphLLM[1 (https://arxiv.org/html/2605.19738#bib.bib1)]通过图增强前缀调谐将图转换器与LLM集成,将图信息压缩为紧凑前缀,避免了冗长转换。尽管有这些创新,大多数现有方法要么将LLM视为静态特征提取器,要么需要复杂的多阶段训练流程。此外,生成的表示通常缺乏平衡原始属性保真度和LLM派生语义先验的显式机制。我们的工作TERGAD直接通过门控双分支架构弥补了这一差距,该架构自适应融合两种模态,以实现实际数据质量评估流程中的稳健异常检测。

### II-B. 图异常检测

已经开发了多种基于深度学习的方法来应对GAD的挑战。图自编码器(GAEs)作为基础范式,通过测量节点嵌入的重构质量来识别异常。例如,AnomalyDAE[5 (https://arxiv.org/html/2605.19738#bib.bib5)]采用具有注意机制的双自编码器架构来捕捉网络拓扑与节点属性之间的复杂交互。GAAN[3 (https://arxiv.org/html/2605.19738#bib.bib2)]引入了生成对抗框架,集成生成器和判别器,通过重构误差和判别置信度检测异常。除重构外,自监督学习也获得了显著关注。CoLA[10 (https://arxiv.org/html/2605.19738#bib.bib10)]利用实例对上的对比学习来增强可扩展性,而CONAD[26 (https://arxiv.org/html/2605.19738#bib.bib28)]通过数据增强和孪生GNN编码器融入异常特定的先验知识。更近期的工作关注局部上下文和数据稀缺性;GAD-NR[17 (https://arxiv.org/html/2605.19738#bib.bib17)]通过邻居重构建模局部结构,FIAD[2 (https://arxiv.org/html/2605.19738#bib.bib3)]通过直接将合成异常信号注入特征矩阵来缓解标签稀缺。为解决多模态不一致,AHFAN[23 (https://arxiv.org/html/2605.19738#bib.bib25)]采用基于注意力的模块融合拓扑驱动和语义驱动的表示。尽管有这些进展,大多数现有GAD方法严格在数值拓扑和属性空间内操作。它们缺乏融入关于图结构数据的高层语义知识(如节点扮演的功能角色)的能力,这限制了它们在复杂真实世界数据集上的检测性能和可解释性。数据表示中的这种语义空白激发了我们探索利用LLM弥合原始结构数据与高层概念理解之间差距的动机。

## III. 预备知识

### III-A. 符号说明

除非另有说明,本文采用以下数学符号:集合使用花体大写字母表示(例如,\(\mathcal{A}\)),矩阵使用粗体大写字母表示(例如,\(\mathbf{A}\)),向量使用粗体小写字母表示(例如,\(\mathbf{x}\))。我们定义一个图 \(\mathcal{G}=(\mathcal{V},\mathcal{E},\mathbf{X})\),其中 \(\mathcal{V}\) 表示 \(n\) 个节点的集合(\(\|\mathcal{V}\|=n\)),\(\mathcal{E} \subseteq \mathcal{V} \times \mathcal{V}\) 是边的集合,\(\mathbf{X} \in \mathbb{R}^{n \times d_{x}}\) 表示节点属性矩阵。拓扑结构通过邻接矩阵表示。

相似文章

AGE:图检索增强生成中的自适应掩码图嵌入方法

Hugging Face Daily Papers

介绍了自适应掩码图嵌入(AGE),这是一种基于Transformer的自监督学习方法,通过专注于预测非关键节点,解决了GraphRAG任务中LLM的图表示与文本表示之间的潜在特征不对齐问题。