通过共享表示攻击图基础模型
摘要
本文识别并攻击了图基础模型的对齐层,表明这是一个独特的攻击面,在低预算扰动下尤其脆弱,特别是对于频谱分词器,并提出基于检测的防御措施。
arXiv:2607.18567v1 公告类型:新
摘要:图基础模型通过将每个输入映射到一个共享表示后再进行任务推理,从而泛化到不同的图领域。我们将这个映射称为对齐层,它是区分图基础模型与图神经网络的关键组件,并表明这是一个先前工作尚未研究的独特攻击面。我们在推理时攻击它,无需访问训练过程,针对六个公共模型,涵盖频谱分词器、文本嵌入空间和离散码本。一个定向的表示空间扰动可以击垮所有模型,但其预算与普通图网络所需的表示范数相当,唯有一个例外:OpenGraph,其频谱分词器仅需五分之一的预算即可崩溃,这是一种普通网络不具备的对齐特定脆弱性,且同表示对照实验将其追溯到分词器而非解码器。一种可实现的输入空间攻击(编辑边、特征或文本)在峰值时至少移除了六个模型中三个模型的一半正确预测。输入访问攻击者实现这种脆弱性的程度,取决于解码器读取表示的直接性,而非任务留下的干净准确率;我们通过解码器的局部Lipschitz敏感度在结构上衡量这种载体增益,并报告干净准确率裕量作为模型内排序启发式方法,但该方法在可实现攻击中不成立。
查看缓存全文
缓存时间: 2026/07/22 08:22
# 攻击图基础模型:利用其共享表示空间
来源:https://arxiv.org/html/2607.18567
###### 摘要
图基础模型通过将每个输入映射到一个共享表示空间后再进行任务推理,从而跨图域泛化。我们将这个映射称为对齐层——这是区分图基础模型与图神经网络的关键组件,并证明它是一个此前研究未涉及的独特攻击面。我们在推理时(无训练访问权限)对六个公开模型(涵盖谱分词器、文本嵌入空间和离散码本)进行攻击。在表示空间上施加一个定向扰动即可使所有模型崩溃,且其预算与普通图网络所需的表示范数相当;但有一个例外:OpenGraph 的谱分词器仅需五分之一的预算即可崩溃,这是一种对齐层特有的脆弱性,普通网络不具备,且通过相同表示控制实验可追溯至分词器而非解码器。一种可实现的输入空间攻击(编辑边、特征或文本)在三个模型上最多可移除超过一半的正确预测。输入访问权限攻击者所实现的脆弱性程度,取决于解码器直接读取表示的程度,而非任务对应的干净准确率;我们通过解码器在干净表示处的局部 Lipschitz 敏感性来结构性衡量这种载体增益,并报告干净准确率余量作为一种模型内排序启发式,但在可实现攻击下不成立。当载体为离散时,我们通过将码本分配固定为干净值来因果定位效应。随后我们研究防御方法。面对自适应攻击者,鲁棒化表示空间失效。然而,被攻击的输入是可检测的:在低维连续载体上进行密度测试几乎可以完美区分它们,在干净留出数据上仅有5%的假阳性率,并且在自适应攻击者下仍然成立。因此,即使我们的防御未能强化对齐层,也可以对其进行监测。
## 1 引言
图基础模型旨在通过一个预训练模型服务于多种图任务和多个图域 (Liu et al. 2025; Mao et al. 2024)。这样的模型必须协调共享不同节点、不同边和不同特征空间的输入。它通过一个图神经网络不具备的组件来实现这一点:一个对齐层,在任务推理开始前将每个输入映射到一个共享表示空间。在结构模型中,这一层是基于邻接矩阵奇异值分解(SVD)构建的谱分词器 (Xia et al. 2024; Xia and Huang 2026; Zhao et al. 2025)。在文本属性模型中,它是一个冻结的文本嵌入空间或离散词汇表 (Liu et al. 2024; Wang et al. 2024; Li et al. 2024)。图1展示了共同结构:每个域被映射到一个共享表示空间,攻击扰动该表示,共享空间将扰动跨域和跨模型传播。
图1:攻击设置。图基础模型通过对齐映射 Φ 将来自任意域的输入映射到一个共享表示空间,然后由解码器 g 读取。我们在推理时攻击 Φ,在预算内编辑可实现的输入(边、特征或节点和类别文本),无训练访问权限,在白盒、灰盒或黑盒知识下进行。由于每个域和模型家族共享这个空间,一个扰动可以跨域传播,并通过代理模型跨模型传播。载体(即 Φ 的形式)可以是谱令牌、文本嵌入、码本或通道 logits。
针对图神经网络的对抗性攻击会扰动单个图(用于单个任务)的邻接矩阵或特征 (Zügner et al. 2018; Zügner and Günnemann 2019; Xu et al. 2019; Sun et al. 2020)。这些攻击都无法扰动可迁移的编码器、对齐映射或离散词汇表,因为这些组件只存在于图基础模型中,用于换取跨域泛化能力。没有已发表的攻击针对我们研究的六个模型。一个共享空间意味着一个共享弱点:因为每个域都通过 Φ 路由,对它的单一位移会降低所有域的性能,因此使这些模型具有基础性的泛化能力本身就是一个漏洞。我们将研究从该漏洞推进到防御。我们的贡献如下:
- • 我们形式化了跨模型家族共享的对齐映射 Φ,并在推理时(无训练访问权限)对六个公开模型进行攻击(第3节)。
- • 我们通过普通网络控制实验将该层与输入杠杆分离。大多数对齐层在定向表示空间扰动下崩溃的预算与普通图网络相同,但 OpenGraph 的谱分词器在五分之一的预算下崩溃,这是对齐层特有的脆弱性,而相同表示控制实验将其追溯至分词器而非解码器(第4节)。
- • 我们基于特征向量扰动理论推导出一种针对奇异值分词器的谱旋转攻击,这是第一个可实现攻击,在投影梯度上升失败的情况下将 OpenGraph 从噪声基底中移出,并证明其残余抵抗性源于谱基简并性,而非鲁棒性(第4节)。
- • 我们通过多个种子在跨四个域的九个数据集上评估可实现输入攻击,并发现攻击者实现的脆弱性程度与解码器读取表示的直接程度相关。我们从解码器在干净表示处(无攻击曲线)的局部 Lipschitz 敏感性出发,结构性衡量这种载体增益,并作为启发式对崩溃阈值进行排序,而干净准确率余量在可实现攻击中无法作为预测因子(第3、4节)。离散码本允许一种 do 算子来因果定位效应。
- • 我们证明,鲁棒化对齐层在面对自适应攻击者时失败,但被攻击的输入在鲁棒化失败的低维连续载体上可被检测(第5节)。
## 2 相关工作
#### 图神经网络的攻击。
结构攻击通过翻转边来改变预测。Nettack 制作有针对性的编辑 (Zügner et al. 2018),Metattack 使用元梯度毒化图 (Zügner and Günnemann 2019),拓扑攻击求解边翻转上的最小-最大松弛 (Xu et al. 2019)。强化学习提供了黑盒变体 (Dai et al. 2018),节点注入通过添加节点而非编辑边进行攻击 (Sun et al. 2020)。相关综述覆盖了该领域 (Jin et al. 2020)。所有这些工作都假设一个图、一个任务和一个基底。
#### 图基础模型及其鲁棒性。
关于图基础模型鲁棒性的工作近期才出现,且未触及推理时的对齐层。基准测试会扰动图语言模型的其他通道(提示、文本和结构)(Zhang et al. 2025),后门攻击需要毒化或微调阶段 (Luo et al. 2026)。没有先前的攻击展示过一个通过共享接口跨域传播的扰动。
#### 表示对齐与认证鲁棒性。
已有论证认为独立模型会趋向于一个共享表示 (Huh et al. 2024),但表示可编码并不意味着被因果使用 (Usama and Chang 2026),因此我们的测试是干预而非探查。只有当表示在几何上对齐时,表示空间扰动才能跨模型传播 (Gupta et al. 2025),这正是跨域对齐映射创造的条件,因此这个攻击面也是一个传播面。我们使用线性对齐度量 (Kornblith et al. 2019) 识别子空间,并通过擦除和激活编辑 (Belrose et al. 2023; Meng et al. 2022) 移除它们。扰动内部表示是一个既定范式:特征对手匹配目标表示 (Sabour et al. 2016),该思想延伸到视觉-语言和自监督编码器 (Zhao et al. 2023; Jia et al. 2022),在共享嵌入空间中匹配目标可以跨编码器传播 (Zhang et al. 2024)。在这些工作中,贡献在于目标而非优化器,不可实现的表示空间扰动是展示漏洞的标准方式,之后再询问输入是否能达到该扰动。我们将目标转向图基础模型相对于图网络新增的表示:跨域对齐映射,而非单个模型的私有特征。我们的防御改编自随机平滑 (Cohen et al. 2019),并采用自适应评估 (Carlini and Wagner 2017; Athalye et al. 2018; Tramèr et al. 2020) 的标准实践。
## 3 对齐映射与攻击
设一个图基础模型从任意域读取输入 x=(A, X, text),其中 A∈{0,1}^{n×n} 是邻接矩阵,X∈R^{n×d} 是节点特征,text 是节点和类别描述。定义对齐映射 Φ: (A, X, text) → S 为每个输入在进行任务推理前必须经过的表示,因此模型为 g∘Φ,并令 S 表示这个共享表示空间(Φ 的像)。其像通过构造跨域共享。
对齐层并非任何编码器。它具有四个属性:域无关(相同的映射服务于所有输入域,而非每个域一个编码器);瓶颈(每个输入在进行任务推理前都经过它);低维或离散对象(一个 top-k 奇异子空间、码本或固定嵌入空间);由任务解码器 g 读取。单域图神经网络的中间层不是对齐层,因为它不跨域共享,也不支持跨域迁移。由于 Φ 是一个跨域瓶颈,对 S 的单一扰动会影响所有经过它的域,因此它可以表达跨域迁移。对普通隐藏层的攻击受限于一个输入分布,无法表达这样的迁移。
对于谱模型,令 D 为对角线度矩阵,Ā = D^{-1/2} A D^{-1/2} 为对称归一化邻接矩阵,UΣV^⊤ 为其奇异值分解(U, V 为奇异向量,Σ 为对角线上奇异值 σ_1 ≥ σ_2 ≥ ...),则令牌为:
E = (∑_{l=1}^L Ā^l) LN( U√Σ + V√Σ ), (1)
其中 LN(·) 为逐行层归一化,S 是 Ā 的主奇异子空间。对于文本模型,S 是冻结的文本嵌入空间,预测通过计算节点嵌入与类别嵌入的相似度进行。对于 GFT,S 是离散码本 C,计算树嵌入 z 被分配为最近令牌 j = argmin_c ||z - c||。
我们关于 Φ 提出两个论断和一个假设,第4节将分别进行测试。
**论断 1(共享表面)**。Φ 是每个域都经过的瓶颈。因此攻击它不同于攻击消息传递(后者与单个邻接矩阵和单个任务绑定,在 GNN 设置中没有类比)。
**论断 2(跨域载体)**。由于 Φ 将每个域映射到一个共同的几何空间,S 内部的位移可以传播到共享 Φ 的目标域,而针对单个、非共享邻接矩阵的结构攻击无法表达这种传播。
**假设(集中性)**。Φ 将模型压缩成一个低维对象:一个 top-k 奇异子空间、码本或路由专家。因此 S 的微小位移通过基旋转、令牌翻转或专家重路由改变输出。这种集中性是否导致层脆弱性是我们测试的内容,第4节发现崩溃阈值与之顺序相关,因此我们将其报告为一个证据不支持的假设。
#### 为什么对齐映射是攻击面。
将模型写为 g∘Φ,其中 Φ 在 S 中生成一个秩为 k 的表示,g 是 L-Lipschitz 解码器。两个事实使 Φ 脆弱。首先,有界输入预算 B 将 Ā 的主奇异子空间旋转一个由奇异值间隔倒数 1/(σ_i - σ_j) 决定的数量(Davis-Kahan)。因此,近简并谱会将小预算转化为 S 内部的大位移。其次,只有解码器读取的那部分位移会改变输出,因此一个训练好的解码器(具有小的任务子空间)会吸收其余部分。这给出了一个包含两个因子的翻转预算命题:间隔和载体增益。
**命题(翻转预算)。** *设节点 i 具有干净间隔 m_i > 0(节点 i 到其决策边界在 S 中的有符号距离),攻击以载体增益 κ_i > 0(每单位预算的边界法向位移)移动其表示。则翻转节点 i 的最小预算为一阶近似 b_i = m_i / κ_i,因此可达性为 R(B) = Pr[ m_i ≤ κ_i B ]。*
我们在第4节中证明,在可实现攻击上,载体增益 κ 占主导地位,而干净准确率总结的间隔项本身无法排序可达性。证明见附录。
**算法 1 ALIGN 攻击(任务损失形式)**
输入:输入 x,模型 g∘Φ,标签 y,预算 B,步数 T
输出:扰动后的输入 x'
1: 初始化 δ ← 0
2: for t = 1 to T do
3: s ← Φ(x + δ)(若 SVD 不稳定则使用固定基代理)
4: ℓ ← loss(g(s), y)
5: δ ← δ + η ∇_δ ℓ
6: 将 δ 投影到预算 B 上
7: end for
8: 返回 x' = x + δ 投影到离散输入空间
#### 威胁模型。
攻击者仅在推理时行动,无训练、毒化或微调权限,也不能修改模型权重(图1)。三个维度可变:
*目标:* 无特定目标的逃逸攻击,消融实验中包含有针对性的码本变体。
*能力:* 每次扰动什么?相似文章
面向联邦多模态图基础模型:一种拓扑感知的多模态对齐框架
提出了FedGAMMA,一种联邦多模态图基础学习框架,通过两阶段预训练和基于提示的微调,对齐多模态属性和图拓扑,在多个数据集上取得了显著提升。
当图标记成为汇点:图语言模型的机制分析
本文分析了大型语言模型在图语言模型(GLM)中如何内部处理图标记,发现激活层面的显著性与图语义效用之间存在解耦。图汇点标记作为激活异常值出现,但并非图结构的主要载体,揭示了当前图标记构建和对齐机制的局限性。
子图解释能否被武器化以窃取图神经网络?
本文首次提出在严格黑盒约束下对图分类的模型提取攻击,利用子图解释来估计决策边界。研究结果表明,强制性的可解释性接口在**图神经网络**服务中造成了可被利用的安全漏洞。
图对齐拓扑作为接地检测的归纳偏置
本文介绍了将图对齐拓扑作为接地检测的归纳偏置,使用图神经网络对参考信息与LLM输出之间的对齐结构进行建模。该方法在多个幻觉和问答数据集上取得了最先进的结果,性能优于GPT-4o。
克服阻抗不匹配:融合基础模型与知识图谱的理论路线图
本文正式提出了基础模型与知识图谱之间的“阻抗不匹配”概念,并利用结构化残差流、向量符号架构和正交子空间编辑,提出了一种神经符号融合的理论路线图。