半监督文本属性图蒸馏

arXiv cs.AI 论文

摘要

提出了STAD,一种半监督框架,利用Wasserstein距离、双路径编码器和基于LLM的文本合成来蒸馏文本属性图,以实现性能与压缩之间的最先进权衡。

arXiv:2607.20477v1 公告类型:新 摘要:{\em 文本属性图}(TAG)已成为一种表达力强的数据模型,用于整合图拓扑与丰富的文本语义。现有的TAG表示学习方法面临严重的可扩展性瓶颈,尤其是与{\em 大规模语言模型}(LLM)结合时。虽然数据蒸馏提供了一种有前景的数据中心解决方案,但现有方法无法捕捉图与文本模态之间的复杂相互作用,难以应对半监督设置中固有的标签稀缺问题,并且缺乏为下游基于LLM的任务生成可读文本属性的能力。 为了解决这些挑战,我们提出了STAD,一个由{\em Wasserstein距离}(WSD)指导的统一半监督框架。基于我们在真实TAG上的实证发现,STAD引入了一个图-文本协作编码模块,该模块在协作自训练方案中利用双路径编码器(图感知和无图编码器)来获取可靠的伪标签并融合互补的图-文本特征。此外,我们开发了一个有理论基础的基于WSD的图草图算法和一个成本效益高的LLM文本合成模块,该模块利用基于聚类的关键词提取为压缩节点生成连贯、可读的摘要。在基准数据集上的大量实验表明,STAD在基于GNN和基于LLM的下游任务中实现了最先进的性能-压缩权衡,从而实现有效且高效的TAG学习或分析。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:01

# 半监督文本属性图蒸馏
来源:https://arxiv.org/html/2607.20477
Samir Moustafa,奥地利科学院CeMM分子医学研究中心,维也纳大学,奥地利维也纳,[email protected] (https://arxiv.org/html/2607.20477v1/mailto:[email protected]),
Renchi Yang†,香港浸会大学,香港,[email protected] (https://arxiv.org/html/2607.20477v1/mailto:[email protected])
以及Tsz Nam Chan,深圳大学,中国深圳,[email protected] (https://arxiv.org/html/2607.20477v1/mailto:[email protected])

###### 摘要
文本属性图(TAG)已成为一种表达力强的数据模型,用于整合图拓扑与丰富的文本语义。现有基于TAG的表征学习方法存在严重的可扩展性瓶颈,特别是在结合大语言模型(LLM)时。数据蒸馏提供了一种以数据为中心的解决方案,但现有方法未能捕捉图与文本模态之间的复杂交互,在半监督场景下固有的标签稀缺问题中难以应对,并且缺乏生成下游LLM任务所需的人类可读文本属性的能力。为解决这些挑战,我们提出STAD,一个以Wasserstein距离(WSD)为指导的统一半监督框架。基于对真实TAG的实证发现,STAD引入了一个图-文本协作编码模块,该模块在协作自训练方案中采用双路径编码器(图感知路径和图无关路径),以获取可靠的伪标签并融合互补的图-文本特征。此外,我们开发了一个理论基础的WSD图素描算法和一个成本效益高的LLM文本合成模块,该模块利用基于聚类的关键词提取为压缩节点生成连贯、可读的摘要。在基准数据集上的大量实验表明,STAD在基于GNN和基于LLM的下游任务中均达到了最先进的性能-压缩权衡,实现了有效且高效的TAG学习或分析。

数据蒸馏;文本属性图;半监督分类;文本合成
††提交ID:41300
脚注:†通讯作者

## 1. 引言
文本属性图(TAG)已成为一种流行的图数据范式,它整合了丰富的语义文本与文本实体之间的复杂关系(Yan等人,2023 (https://arxiv.org/html/2607.20477#bib.bib13);Feng等人,2024 (https://arxiv.org/html/2607.20477#bib.bib20);Chen等人,2024b (https://arxiv.org/html/2607.20477#bib.bib6);Zhang等人,2024b (https://arxiv.org/html/2607.20477#bib.bib25))。通过弥合图数据与自然语言之间的差距,TAG释放了大语言模型(LLM)在跨领域应用(Li等人,2024 (https://arxiv.org/html/2607.20477#bib.bib22);Liu等人,2023 (https://arxiv.org/html/2607.20477#bib.bib26);Jin等人,2024 (https://arxiv.org/html/2607.20477#bib.bib23);Wang等人,2025 (https://arxiv.org/html/2607.20477#bib.bib21))中的潜力,从药物发现(Li等人,2025 (https://arxiv.org/html/2607.20477#bib.bib66))到欺诈检测(Yang等人,2025b (https://arxiv.org/html/2607.20477#bib.bib67))等。通过利用TAG中两种模态的协同作用,最近将图神经网络(GNN)(Kipf和Welling,2017 (https://arxiv.org/html/2607.20477#bib.bib15);Veličković等人,2018 (https://arxiv.org/html/2607.20477#bib.bib16);Hamilton等人,2017 (https://arxiv.org/html/2607.20477#bib.bib17))与LLM相结合的混合框架在TAG学习任务中取得了显著成果(Zhao等人,2023 (https://arxiv.org/html/2607.20477#bib.bib32);He等人,2024 (https://arxiv.org/html/2607.20477#bib.bib28);Zhang等人,2024a (https://arxiv.org/html/2607.20477#bib.bib31);Chen等人,2024b (https://arxiv.org/html/2607.20477#bib.bib6);Zhu等人,2024 (https://arxiv.org/html/2607.20477#bib.bib27);Tang等人,2024 (https://arxiv.org/html/2607.20477#bib.bib29);Chen等人,2024a (https://arxiv.org/html/2607.20477#bib.bib30);Sun等人,2025 (https://arxiv.org/html/2607.20477#bib.bib33);Wu等人,2025 (https://arxiv.org/html/2607.20477#bib.bib24))。尽管取得了进展,这些方法在实际部署中仍面临严重可扩展性瓶颈,因为现实世界的TAG通常拥有数十万个节点和边(Chen等人,2024b (https://arxiv.org/html/2607.20477#bib.bib6))。与LLM的集成进一步显著增加了这些方法所需的计算和财务开销,从而严重限制了它们在大型工业和科学场景中的适用性。

数据蒸馏为大规模学习任务中的这一可扩展性挑战提供了一种以数据为中心的解决方案(Sachdeva和McAuley,2023 (https://arxiv.org/html/2607.20477#bib.bib34);Lei和Tao,2023 (https://arxiv.org/html/2607.20477#bib.bib35))。其目标是合成一个压缩的小规模数据集,保留原始大规模数据的训练动态和信息。近年来,大量工作(Jin等人,2022 (https://arxiv.org/html/2607.20477#bib.bib38);Yang等人,2023 (https://arxiv.org/html/2607.20477#bib.bib39);Liu等人,2024 (https://arxiv.org/html/2607.20477#bib.bib41);Lai等人,2025 (https://arxiv.org/html/2607.20477#bib.bib40))致力于图蒸馏(也称为图压缩)和文本蒸馏(Li和Li,2021 (https://arxiv.org/html/2607.20477#bib.bib56);Sucholutsky和Schonlau,2021 (https://arxiv.org/html/2607.20477#bib.bib42);Maekawa等人,2023 (https://arxiv.org/html/2607.20477#bib.bib48);Tao等人,2024 (https://arxiv.org/html/2607.20477#bib.bib59)),前者旨在将带有节点属性的原始图压缩成小图,后者则专注于将文本压缩为简洁的语义表示。然而,将这些成功扩展到TAG仍然面临独特且非平凡的挑战。首先,图蒸馏和文本蒸馏的简单组合无法捕捉图与文本模态之间的复杂交互(Jin等人,2022 (https://arxiv.org/html/2607.20477#bib.bib38);Zhou等人,2025 (https://arxiv.org/html/2607.20477#bib.bib65))。图蒸馏方法通常将文本视为静态数值特征,无法保持语义一致性,而文本蒸馏忽视了结构特征。其次,现有的图压缩方法仅构造连续的节点属性特征,缺乏可解释性。但对于TAG,需要生成人类可读的文本属性,以使蒸馏后的TAG仍能与下游基于LLM的任务(例如基于提示的学习或解释生成(He等人,2024 (https://arxiv.org/html/2607.20477#bib.bib28)))兼容。除此之外,现实世界的TAG通常存在严重的标签稀缺问题,而标准蒸馏技术通常依赖大量监督信号来对齐梯度或分布,因此在标签稀缺情况下会失效甚至失败。

为克服上述挑战,本文提出STAD(半监督文本属性图蒸馏),这是一个统一的框架,旨在半监督设置下将TAG蒸馏为紧凑、可读的图。我们的方法基于定量实证研究,我们发现:(i) 图感知模型(GNN)和图无关模型(MLP)捕捉互补信息,仅优化单一模态不足以有效压缩TAG;(ii) 原始图与压缩图分布之间的Wasserstein距离(WSD)(Solomon等人,2015a (https://arxiv.org/html/2607.20477#bib.bib49);Yang等人,2023 (https://arxiv.org/html/2607.20477#bib.bib39))与下游性能高度相关。受这些观察启发,我们首先提出一个图-文本协作编码模块,该模块在协作自训练方案中采用双路径编码器(图感知和图无关路径)作为互补学习者,迭代生成伪监督以实现更好的特征融合,从而缓解标签稀缺和跨模态不对齐问题。随后,基于这些融合特征,我们利用一个理论基础的图素描算法,旨在最小化原始TAG与压缩TAG之间分布偏移的WSD,从而同时压缩图拓扑、属性和标签。此外,我们通过基于关键词的LLM文本合成为蒸馏图构建文本属性。与优化抽象嵌入或直接使用LLM进行文本摘要(功能强大但成本高昂(Zhang等人,2025b (https://arxiv.org/html/2607.20477#bib.bib47), a (https://arxiv.org/html/2607.20477#bib.bib44)))不同,STAD采用三阶段流水线:首先从压缩簇中提取关键词,然后成本高效地利用LLM从这些关键词生成连贯的候选文本,最后采用WSD验证指导的选择策略,挑选出最能保留原始数据分布特征的合成文本。总之,本文的主要贡献如下:

- • 我们首次系统探索了TAG蒸馏。我们提出使用WSD作为可靠指标,量化TAG中的分布偏移,为在图文上下文中评估蒸馏质量提供理论基础。
- • 我们开发了STAD框架,它集成了图-文本协作编码以解决标签稀缺和模态不对齐及模态融合问题,以及WSD指导的图素描和基于关键词的LLM文本合成,以生成高质量的压缩图和文本属性。
- • 在多个基准TAG数据集上的大量实验表明,与现有的图或文本蒸馏解决方案相比,STAD在基于GNN和基于LLM的节点分类任务中均一致地实现了最先进的性能-压缩权衡。

## 2. 相关工作

**图蒸馏。** 图蒸馏(或图压缩)是一种以数据为中心的解决方案,用于降低大规模图上GNN的计算和存储成本,其目标是合成紧凑的图,同时保留原始图的关键信息以保持有竞争力的模型性能。GCond(Jin等人,2022 (https://arxiv.org/html/2607.20477#bib.bib38))是一种简单的梯度匹配方法,通过匹配合成图和原始图上GNN的梯度来合成图。SGDD(Yang等人,2023 (https://arxiv.org/html/2607.20477#bib.bib39))提出了一种结构广播方案,在梯度匹配过程中保留原始结构信息。GCDM(Liu等人,2022 (https://arxiv.org/html/2607.20477#bib.bib50))和GDEM(Liu等人,2024 (https://arxiv.org/html/2607.20477#bib.bib41))是基于分布匹配的方法,GCDM通过MMD对齐合成图和原始图的感受野分布,GDEM则专注于匹配两图的特征基和谱分布。SFGC(Zheng等人,2023 (https://arxiv.org/html/2607.20477#bib.bib51))和GCSR(Liu等人,2024 (https://arxiv.org/html/2607.20477#bib.bib41))是基于轨迹匹配的蒸馏方法,对齐GNN在合成图和原始图上的长期学习动态。CGC(Gao等人,2025 (https://arxiv.org/html/2607.20477#bib.bib55))和ClustGDD(Lai等人,2025 (https://arxiv.org/html/2607.20477#bib.bib40))是基于聚类的方法,CGC通过类别划分以闭合形式推导压缩节点特征和拓扑,ClustGDD通过优化合成图与原始图之间的FID进行聚类。

**文本蒸馏。** 文本蒸馏是为NLP任务合成紧凑文本数据集的过程。TDD(Sucholutsky和Schonlau,2021 (https://arxiv.org/html/2607.20477#bib.bib42))通过梯度下降更新网络参数,使用蒸馏样本和软标签,计算真实文本上的损失,并通过损失梯度优化蒸馏成分以捕捉文本语义,然后使用原始词嵌入字典解码蒸馏文本。DD4TC(Li和Li,2021 (https://arxiv.org/html/2607.20477#bib.bib56))使用在原始文本上训练得到的梯度反向传播到蒸馏文本上。ASD(Maekawa等人,2023 (https://arxiv.org/html/2607.20477#bib.bib48))同时使用梯度下降优化蒸馏输入嵌入、软标签和注意力标签,并通过结合任务损失和Transformer注意力损失指导模型参数更新。DiLM(Maekawa等人,2025 (https://arxiv.org/html/2607.20477#bib.bib60))使用GPT-2模型生成候选蒸馏文本,并通过匹配学习器在原始和蒸馏文本上的梯度来学习生成概率。DaLLME(Tao等人,2024 (https://arxiv.org/html/2607.20477#bib.bib59))对文本嵌入进行k-中心点聚类,并通过在原始数据集上微调的T5(Raffel等人,2020 (https://arxiv.org/html/2607.20477#bib.bib63))模型将聚类嵌入中心转换回可读文本。

尽管图与文本领域存在许多蒸馏方法,但尚未为TAG设计专门的方案。单模态蒸馏无法充分利用另一种模态,这促使我们为TAG提出协作图文蒸馏方案。

**TAG表征学习。** 语言模型(包括LLM)结合传统GNN,已利用TAG中原始文本的丰富语义信息在TAG表征学习上发挥了能力。语言模型可以作为TAG编码器,将图拓扑和文本集成到嵌入空间中(Yan等人,2023 (https://arxiv.org/html/2607.20477#bib.bib13);Chen等人,2024b (https://arxiv.org/html/2607.20477#bib.bib6);Zhu等人,2024 (https://arxiv.org/html/2607.20477#bib.bib27))。ENGINE(Zhu等人,2024 (https://arxiv.org/html/2607.20477#bib.bib27))结合LLM的层间嵌入进行文本编码。语言模型可以作为TAG增强器,例如TAPE(He等人,2024 (https://arxiv.org/html/2607.20477#bib.bib28))使LLM直接生成预测和解释以丰富节点文本。CTGL(Zhou等人,2025 (https://arxiv.org/html/2607.20477#bib.bib65))定量比较了图结构与文本属性之间的互补性,使用GNN和LLM串行增强和编码TAG,并以对比方式融合图结构与文本。语言模型可以作为预测器,给出TAG学习任务的最终预测(Tang等人,2024 (https://arxiv.org/html/2607.20477#bib.bib29);Chen等人,2024a (https://arxiv.org/html/2607.20477#bib.bib30))。LLaGA(Chen等人,2024a (https://arxiv.org/html/2607.20477#bib.bib30))将序列化的图结构和节点文本输入LLM,生成预测和自然语言描述。Wu等人(2025)(https://arxiv.org/html/2607.20477#bib.bib24)对不同类型的LLM在TAG节点分类上的表现进行了广泛调研。然而,当TAG规模扩大时,这些方法将面临训练效率问题,这促使我们探索TAG蒸馏。在本文中,我们将LLM4TAG定义为专为TAG学习任务定制的大语言模型(Su等人,2025 (https://arxiv.org/html/2607.20477#bib.bib9)),并在实验部分一致使用这一标准化术语。

## 3. 预备知识

### 3.1. 符号与问题定义

**符号。** 设G = (V, E, S) 为一个文本属性图(TAG),其中V是顶点集,E是边集,S是节点上的文本属性集。

相似文章

TERGAD: 面向图异常检测的结构感知文本增强表示

arXiv cs.CL

TERGAD是一种新颖的数据增强框架,利用大语言模型将节点级别的拓扑属性转化为语义描述,然后通过门控双分支自编码器将这些语义描述与原始节点属性融合,用于图异常检测,在六个数据集上取得了最先进的结果。

超越金牌教师:通过LLM-GNN协同教学增强图学习

arXiv cs.LG

本文提出LLM-GNN协同教学(LLM-GNN Co-Teaching),一种面向文本属性图的小样本图学习的双向框架。LLM和GNN交换高置信度的伪标签,并利用基于轮次的偏好优化(RPL-PO)相互改进,在基准测试上优于先前方法。