植入木马于对齐:针对 Graph Foundation Models 的隐蔽后门攻击
摘要
本文介绍了 STAG,一个针对文本属性图上 Graph Foundation Models 的隐蔽后门攻击框架,协调图和文本触发器以规避检测并实现有效攻击。
arXiv:2608.20991v1 Announce Type: new
摘要: 在文本属性图 (TAGs) 上的 Graph Foundation Models (GFMs) 将图表示与语言语义对齐,以支持可迁移的图学习。尽管有这些优势,GFMs 在 TAGs 上的后门漏洞仍研究不足,尤其是在图-语言对齐下,图和文本表示被训练以在共享语义空间中相互约束。现有的后门攻击主要针对图侧或文本侧,将两种模态独立处理。这使得直接适应无效:纯图触发器可能被干净文本语义约束,而纯文本触发器改变语言视图但不直接转移正在对齐和评分的图表示。TAGs 也带来隐蔽性挑战,因为触发器暴露为节点文本和局部图结构,使得不连贯的触发属性或异常子图容易被检查或过滤。在本文中,我们提出了 STAG,一个专为 GFMs 在 TAGs 上的图-语言对齐接口设计的隐蔽木马攻击框架。STAG 协调图触发器生成器和文本侧软提示,使触发附着的图表示和触发文本表示向同一目标类文本区域移动。为了解决 TAG 特定的隐蔽性,STAG 通过候选检索将触发节点实现为可读文本,并规范化触发附着子图,使其局部结构接近原始子图。在多个 TAG 数据集和代表性 GFMs 上的广泛实验证明了 STAG 的有效性和隐蔽性。我们的代码可在 https://github.com/ventr1c/STAG 获取。
查看缓存全文
缓存时间: 2026/08/24 04:35
# 针对图基础模型的隐蔽后门攻击
来源:https://arxiv.org/html/2608.20991
## 对齐中的木马植入:针对图基础模型的隐蔽后门攻击
两位作者对本文贡献相同。
林敏华¹⁺, 高志诚²⁺, 王一龙¹, 卢汉清³, 张翔¹, 王苏航¹
¹宾夕法尼亚州立大学,美国宾夕法尼亚州大学公园市 ²独立研究员 ³亚马逊公司,美国加利福尼亚州帕洛阿尔托市
{mfl5681, yvw5769, xzz89, szw494}@psu.edu, [email protected], [email protected]
###### 摘要
在文本属性图上的图基础模型将图表示与语言语义对齐,以支持可迁移的图学习。尽管具备这些优势,图基础模型在文本属性图上的后门漏洞仍未得到充分研究,尤其是在图-语言对齐场景下——图表示和文本表示被训练以在共享语义空间中相互约束。现有后门攻击主要针对图侧或文本侧,将两种模态视为独立个体。这种处理方式使得直接适配效果不佳:纯图触发器可能被干净文本语义所约束;而纯文本触发器虽改变了语言视角,却无法直接移动正在对齐和评分的图表示。文本属性图还带来了隐蔽性挑战,因为触发器同时暴露为节点文本和局部图结构,使得不连贯的触发器属性或异常子图容易被检查或过滤。本文提出STAG,一种专为图基础模型在文本属性图上的图-语言对齐接口设计的隐蔽木马攻击框架。STAG协调图触发器生成器与文本侧软提示,使触发器附加的图表示与被触发的文本表示向同一目标类别文本区域移动。为解决文本属性图特有的隐蔽性问题,STAG通过候选检索将触发节点实现为可读文本,并对触发器附加子图进行正则化,使其局部结构接近原始子图。在多个文本属性图数据集和代表性图基础模型上的大量实验表明了STAG的有效性和隐蔽性。我们的代码已开源于:https://github.com/ventr1c/STAG
###### 索引术语:
后门攻击,图基础模型,大语言模型,图神经网络
## I 引言
图基础模型正越来越多地用于学习可跨任务、跨领域、跨数据机制迁移的图表示。这一趋势源于大规模图语料库的日益普及以及文本属性图的广泛存在——其中节点(有时包括边)关联着自然语言描述,如论文摘要、商品资料、用户简介或交易元数据。文本属性图支持着具有重要影响力的应用,包括推荐系统、生物医学发现和金融风险分析。为同时利用结构连通性和语言语义,近期的图基础模型将图编码器与语言模型耦合在一个共享的嵌入空间中,实现了零样本和少样本预测以及指令式图推理。
这些能力背后的核心机制是图-语言对齐。图基础模型将图结构和文本描述视为同一实体的两个视角,并使用对比目标将它们投射到一个共享的语义空间中。这一过程将一个可学习的图编码器锚定到预训练语言模型的语义空间中。它主要存在于两种主流架构中:*LLM-as-Aligner*方法直接对齐图嵌入和文本嵌入;而*LLM-as-Predictor*方法则通过学习到的投影器将图表示映射到大语言模型的输入空间,以进行token级别的交互。在这两种情况下,图-语言对齐都是将结构信息植根于文本语义中的接口。
尽管图基础模型前景广阔,但这个共享接口也创造了一个独特的攻击面。由于图编码器被训练以匹配语言定义的语义空间,一个能移动任一模态的触发器都可能被对齐目标所强化,并保留在学到的图表示中。一个尤其令人担忧的威胁是*后门攻击*,模型在良性输入上行为正常,但在出现隐藏触发器时会被驱动到攻击者选择的行为。对齐接口使得这一威胁对图基础模型尤为严重:一旦一个被污染的文本属性图语料库或一个被攻破的文本编码器进入图-语言对齐过程,标准的图基础模型训练就可能将触发器-目标关联编码进共享表示空间。由于图基础模型及其上游组件在不同任务中被重复使用,一次攻破可能传播到许多下游部署中。例如,一个被触发的欺诈账户可能与一个良性类别对齐从而逃避欺诈筛查;而在推荐系统中,攻击者选择的物品可能被推送给用户。由于干净输入不受影响,此类后门可以通过基于准确率的验证并持续不被检测到。
然而,现有的后门攻击主要针对图侧或文本侧,将两种模态视为独立个体。将此类攻击直接适配到图基础模型在文本属性图上的图-语言对齐接口,暴露了两个局限性。*首先*,单侧触发器与图-语言对齐的匹配度较差。图后门方法在孤立的图空间中优化触发器,而文本侧攻击则操纵提示或输入文本。结果,纯图触发器使得被投毒的节点与干净文本配对,因此对齐训练可以将其表示保持在干净语义锚点附近;纯文本触发器改变了语言侧信号,但没有提供相应的图侧机制来移动用于预测的图表示。我们在III-C节中的初步分析支持了这一诊断,表明代表性的单侧适配要么攻击成功率低,要么显著降低了干净准确率。*其次*,文本属性图触发器在两种模态中都必须保持隐蔽性。现有的图攻击通常依赖任意的触发器特征,但在文本属性图中,这些特征对应注入的节点文本,并且触发器还会改变局部图结构。因此,不连贯的触发器属性或结构异常的局部结构很容易被检查或过滤。
因此,在本文中,我们研究了一个新问题:*针对图基础模型在文本属性图上的图-语言对齐接口的后门攻击*。主要有两个挑战:(i) 跨模态协调。如何协调图侧和文本侧的攻击组件,通过共享的对齐目标相互强化?以及 (ii) 文本属性图特有的触发器隐蔽性。如何在不牺牲攻击效果的前提下,将攻击触发节点实现为可读文本并保持合理的局部图结构?为解决这些挑战,我们提出STAG,一种在图基础模型上的隐蔽木马攻击框架,它劫持了图-语言对齐接口。为克服跨模态协调挑战,STAG联合优化图触发器生成器和文本侧软提示,使触发器附加的图表示和被触发的文本表示向同一目标类别文本区域移动。这使得两种模态在图-语言对齐过程中相互强化,而不是让一种模态抵消另一种模态。为解决文本属性图上的触发器隐蔽性问题,STAG将生成的触发器特征与目标类别文本区域对齐,通过候选检索将其实现为可读的触发节点属性,并对触发器附加子图进行正则化,使其局部结构接近原始子图。
总之,我们的主要贡献是:(i) 我们研究了一个针对图基础模型在文本属性图上的图-语言对齐接口的新后门攻击问题;(ii) 我们提出了STAG,一个隐蔽的木马攻击框架,它通过共享的对齐目标协调图侧和文本侧的后门信号,并将触发器伪装为具有合理局部图结构的可读文本;(iii) 在多个文本属性图数据集和代表性图基础模型上的大量实验证明了STAG的有效性和隐蔽性。
## II 相关工作
面向文本属性图的图基础模型。面向文本属性图的图基础模型使用语言模型将结构连通性与文本语义联系起来。现有方法通常遵循三种范式:*LLM-as-Predictor*,将图表示投影到大语言模型兼容的空间;*LLM-as-Aligner*,将图编码器与冻结的文本模型的语义空间对齐;以及*LLM-as-Enhancer*,使用大语言模型在图学习之前改进图属性、结构或标签信号。本文关注前两种范式,其中图表示与文本语义被显式对齐。而LLM-as-Enhancer方法则主要将大语言模型用作图学习前的离线优化步骤。
图后门攻击。图后门攻击通过污染训练数据或提示,使得模型对干净输入正常预测,而对附加了触发器的输入映射到攻击者选择的目标。早期攻击主要针对监督式图神经网络。例如,UGBA学习自适应且不易察觉的触发器,DPGBA通过匹配良性特征分布来提高隐蔽性。后续工作攻击了自监督和基于提示的图学习。近期,针对图基础模型的后门攻击开始出现。GFM-BA将触发器锚定到无标签的原型嵌入,DTGBA通过文本级和结构级触发器攻击经过提示调优的、由大语言模型赋能的图基础模型。我们的方法与这些方法在两个方面有本质不同:(i) 我们专注于图-语言对齐接口,通过协调图侧和文本侧攻击使其相互强化,而不是单独攻击图编码器、提示模块或原型空间;(ii) 我们通过将触发节点属性实现为可读文本并保持合理的局部结构,解决了文本属性图特有的隐蔽性问题。
## III 预备知识
### III-A 文本属性图上的图基础模型
令 $\mathcal{G} = (\mathcal{V}, \mathcal{E}, \mathcal{T})$ 为一个文本属性图,其中 $\mathcal{V} = \{v_i\}_{i=1}^n$ 是节点集,$\mathcal{E} \subseteq \mathcal{V} \times \mathcal{V}$ 是边集,$\mathcal{T} = \{T_i\}_{i=1}^n$ 是节点-文本集,$T_i$ 是节点 $v_i$ 的文本属性。令 $\mathcal{V}_l \subseteq \mathcal{V}$ 表示有标签的训练节点,$\mathcal{V}_u = \mathcal{V} \setminus \mathcal{V}_l$ 表示剩余的无标签节点。每个节点 $v_i$ 携带特征 $x_i = e(T_i)$,该特征通过文本侧编码器 $e(\cdot)$ 从 $T_i$ 获得。$G_i$ 表示以 $v_i$ 为中心的 $K$ 跳子图。
一个在文本属性图上的图基础模型将图编码器与语言组件耦合,使得图结构化信息可以通过语言语义来解释。我们将节点 $v_i$ 的预测写为:
$F(v_i; \theta, e) = g\big(h_\theta(G_i), e(\cdot)\big)$,(1)
其中 $h_\theta(\cdot)$ 是受害图编码器,$e(\cdot)$ 是文本侧编码器(例如,句子编码器或大语言模型嵌入模块),$g$ 是预测接口。根据图基础模型的设计,$g$ 可以是基于相似度的决策规则(针对文本类别描述)或基于大语言模型的解码器,但两者都依赖于图表示被植根于语言空间。
尽管架构不同,训练此类模型的一种常见方式是将图侧表示植根于文本侧表示。我们将此接口抽象为:
$L_{\mathrm{align}}(G_i, T_i; \theta, e) = -\mathrm{sim}\big(h_\theta(G_i), e(T_i)\big)$,(2)
其中 $\mathrm{sim}(\cdot, \cdot)$ 衡量图嵌入和文本嵌入之间的相似性。
### III-B 威胁模型
攻击者目标。攻击者的目标是在受害图基础模型中植入一个隐蔽的后门,使得任何附加了触发器的节点都被分配到攻击者选择的目标类别 $y_t$,而没有触发器的干净节点则被正常预测。在受害者训练期间,攻击者旨在使模型在标准图基础模型训练流程下,将触发器模式与目标类别关联起来。在推理阶段,将相同类型的触发器附加到测试节点上会激活这种关联,并导致...相似文章
通过共享表示攻击图基础模型
本文识别并攻击了图基础模型的对齐层,表明这是一个独特的攻击面,在低预算扰动下尤其脆弱,特别是对于频谱分词器,并提出基于检测的防御措施。
绕过LLM护栏:普通文本如何无需越狱即可改变潜在轨迹
本文介绍了一项研究发现,即用良性叙事文本填充LLM的上下文窗口可以主导注意力机制并改变潜在轨迹,有可能在无需传统越狱的情况下绕过对齐护栏。文章认为,当前的对齐方法是对本质上流动的架构的一种表面修复。
TERGAD: 面向图异常检测的结构感知文本增强表示
TERGAD是一种新颖的数据增强框架,利用大语言模型将节点级别的拓扑属性转化为语义描述,然后通过门控双分支自编码器将这些语义描述与原始节点属性融合,用于图异常检测,在六个数据集上取得了最先进的结果。
@LeeLeepenkman: 多模态大型语言模型的文本锚定语义扰动可转移越狱攻击 https://pap…
本文介绍了TA-SPA,一个针对多模态大型语言模型的黑盒越狱攻击框架,该框架利用基于文本的语义扰动,实现针对安全对齐的有效且可转移的攻击。
子图解释能否被武器化以窃取图神经网络?
本文首次提出在严格黑盒约束下对图分类的模型提取攻击,利用子图解释来估计决策边界。研究结果表明,强制性的可解释性接口在**图神经网络**服务中造成了可被利用的安全漏洞。