子图解释能否被武器化以窃取图神经网络?
摘要
本文首次提出在严格黑盒约束下对图分类的模型提取攻击,利用子图解释来估计决策边界。研究结果表明,强制性的可解释性接口在**图神经网络**服务中造成了可被利用的安全漏洞。
arXiv:2605.30470v1 Announce Type: new
摘要:Graph Machine Learning as a Service (GMLaaS) 平台越来越多地实现可解释性接口以满足监管透明性要求。然而,这种透明性为模型提取攻击创造了可被利用的漏洞。我们首次提出针对严格黑盒约束下图分类的模型提取攻击,攻击者仅能观察到离散类别标签和二元解释掩码(无概率分数、梯度或置信度值)。我们的方法 (1) 利用模型解释输出指导蒙特卡洛边敏感性估计朝向决策边界,并具有基于 Hoeffding 集中不等式的估计精度保证;(2) 利用解释子图高效缩小边界搜索空间。在多个领域的基准图数据集上的大量实验表明,我们的方法优于可比基线。这些发现表明,此类可解释性接口创造了可被利用的攻击面,为可解释人工智能指令的防御机制和政策框架提供了参考。实现代码见 https://github.com/LabRAI/XSTEAL/。
查看缓存全文
缓存时间: 2026/06/01 09:25
# 子图解释能否被武器化以窃取图神经网络?
来源:https://arxiv.org/html/2605.30470
Ojas Nimase
南加州大学
洛杉矶,美国
nimase@usc\.edu
&Jiate Li
南加州大学
洛杉矶,美国
jiateli@usc\.edu
&Yue Zhao
南加州大学
洛杉矶,美国
yzhao010@usc\.edu
&Yushun Dong
佛罗里达州立大学
塔拉哈西,美国
yushun\.dong@fsu\.edu
###### 摘要
图机器学习即服务(GMLaaS)平台越来越多地实现可解释性接口,以满足监管透明度要求。然而,这种透明度为模型提取攻击创造了可利用的漏洞。我们提出了首个专门针对图分类任务、在严格黑盒约束下的模型提取攻击,其中攻击者仅能观察到离散的类别标签和二值解释掩码(无概率得分、梯度或置信度值)。我们的方法:(1) 利用模型解释输出指导蒙特卡洛边敏感性估计朝向决策边界,并带有Hoeffding浓度保证;(2) 利用解释子图高效缩小边界搜索空间。在多个领域的基准图数据集上进行的大量实验表明,我们的方法优于可比的基线方法。这些发现表明,此类可解释性接口创造了可利用的攻击表面,为可解释AI法规的防御机制和政策框架提供了参考。实现代码见 https://github.com/LabRAI/XSTEAL/。
## 1 引言
图机器学习即服务(GMLaaS)允许组织通过公开可用的API分发对专有图机器学习模型的访问,同时保持内部模型工作安全[15 (https://arxiv.org/html/2605.30470#bib.bib15)],广泛应用于欺诈检测[1 (https://arxiv.org/html/2605.30470#bib.bib1)]和推荐系统[40 (https://arxiv.org/html/2605.30470#bib.bib40),36 (https://arxiv.org/html/2605.30470#bib.bib36)]等应用中。然而,这种范式面临一个基本的安全威胁:模型提取攻击,它通过对抗性地利用API访问查询内部模型,重构出功能相似的替代模型来复制受害者的决策行为[35 (https://arxiv.org/html/2605.30470#bib.bib35),27 (https://arxiv.org/html/2605.30470#bib.bib27),19 (https://arxiv.org/html/2605.30470#bib.bib19),44 (https://arxiv.org/html/2605.30470#bib.bib44)]。这一威胁促使了跨机器学习范式的日益增长的研究,涵盖攻击、防御和所有权验证[33 (https://arxiv.org/html/2605.30470#bib.bib33),16 (https://arxiv.org/html/2605.30470#bib.bib16),43 (https://arxiv.org/html/2605.30470#bib.bib43)]。加剧这一威胁的是,日益增长的监管要求[10 (https://arxiv.org/html/2605.30470#bib.bib10),6 (https://arxiv.org/html/2605.30470#bib.bib6)]和用户需求[32 (https://arxiv.org/html/2605.30470#bib.bib32)]正在推动提供商进一步在其API中增加可解释性接口,用户将额外了解对预测标签影响最大的图成分[41 (https://arxiv.org/html/2605.30470#bib.bib41)]。虽然这种透明机制有助于满足合规要求,但它们也暴露了一个新的攻击通道,从根本上威胁了GMLaaS所依托的安全前提。这种强制性透明度与模型安全之间的基本张力已被识别为MLaaS的一个开放挑战[25 (https://arxiv.org/html/2605.30470#bib.bib25)]。这就提出了一个关键问题:为透明度而强制提供的解释,是否可以被武器化以窃取它们所解释的相同模型?
最近的工作已经开始利用这一漏洞,证明解释可以实现更高效的模型提取攻击[26 (https://arxiv.org/html/2605.30470#bib.bib26),21 (https://arxiv.org/html/2605.30470#bib.bib21),18 (https://arxiv.org/html/2605.30470#bib.bib18)]。然而,这个新兴领域仍然研究不足,特别是对于图神经网络。当前的研究面临三个关键限制。
首先,现有的GNN提取方法缺乏对哪些训练数据对提取最有效的原则性理解。当前的方法通过集中于高置信度成分来构建查询样本[26 (https://arxiv.org/html/2605.30470#bib.bib26),21 (https://arxiv.org/html/2605.30470#bib.bib21),18 (https://arxiv.org/html/2605.30470#bib.bib18)],但从未形式化为什么这些样本有助于提取,或者是否存在更好的策略。直观上,高保真度的替代模型必须不仅在高置信度区域复制受害者的行为,还要在预测发生变化的决策边界附近复制。先前关于一般(非图)模型提取的工作已经经验性地证明了边界采样的有效性[3 (https://arxiv.org/html/2605.30470#bib.bib3)],然而这一见解尚未扩展到GNN领域,其中图数据的离散组合性质引入了根本不同的挑战。
其次,为连续域开发的边界搜索技术无法转移到离散的图空间。利用边界点的现有方法[3 (https://arxiv.org/html/2605.30470#bib.bib3),8 (https://arxiv.org/html/2605.30470#bib.bib8)]需要输入空间的连续性才能高效定位决策边界。在图上,这些技术根本失败:给定两个预测标签不同的图\(G_1, G_2\),并不存在唯一的“中点”,因为组合上存在多个与两者编辑距离相等的图(图1 (https://arxiv.org/html/2605.30470#S1.F1))[29 (https://arxiv.org/html/2605.30470#bib.bib29)]。此外,朴素地估计所有\(O(n^2)\)个可能边的敏感性会招致令人望而却步的查询成本[13 (https://arxiv.org/html/2605.30470#bib.bib13)],再加之图数据的混合离散-连续性质阻碍了标准优化技术的直接应用[7 (https://arxiv.org/html/2605.30470#bib.bib7),22 (https://arxiv.org/html/2605.30470#bib.bib22)]。
第三,每个现有的GNN提取方法都需要访问丰富的连续信息(概率得分、连续重要性向量或梯度衍生的信号)[21 (https://arxiv.org/html/2605.30470#bib.bib21),26 (https://arxiv.org/html/2605.30470#bib.bib26),18 (https://arxiv.org/html/2605.30470#bib.bib18),34 (https://arxiv.org/html/2605.30470#bib.bib34),45 (https://arxiv.org/html/2605.30470#bib.bib45)],而这些在实际API部署中是得不到的。在新兴的监管要求下[10 (https://arxiv.org/html/2605.30470#bib.bib10),6 (https://arxiv.org/html/2605.30470#bib.bib6)],GMLaaS提供商越来越被要求随预测一起提供解释。实践中,理性的提供商会暴露合规所需的最少信息(离散的类别标签和二值解释掩码),而不是连续得分或梯度,因为这些会泄露额外的专有模型内部信息。现有的GNN提取方法都不能在这种最少信息约束下运行。
参见图注
图 1: 在编辑距离上与\(G_A\)和\(G_B\)相等的多个可能的“中点图”。
为了解决这些限制,我们:(1) 定义并研究了边界样本对GNN提取的有效性,将提取问题形式化为边界对搜索。(2) 提出了一种基于解释引导的搜索攻击,在严格的黑盒约束下(攻击者仅观察到离散预测和二值解释掩码)定位此类边界样本。我们的搜索通过从离散标签响应中进行蒙特卡洛采样来迭代估计边敏感性,翻转最敏感的边,并验证边界跨越。我们将候选边限制在解释子图内部或与其相邻,从而将搜索空间从\(O(|V|^2)\)减少到\(O(|V_{\mathrm{sub}}|^2)\)。我们聚焦于图分类,这一设置为模型提取带来了独特挑战,且此前未曾在严格黑盒约束下得到解决。在分子、生物和社会图基准上的大量实验验证了我们的框架。总之,我们的贡献如下:
- **GNN边界样本的有效性**:我们首次为GNN提取提供了边界样本的形式化定义,并经验性地验证了它们相对于随机和高置信度采样策略的优越性,将模型提取重新定义为边界对搜索问题。
- **新颖的基于解释引导的提取攻击**:在仅输出离散预测和二值解释掩码的严格黑盒约束下,我们开发了首个针对图分类的模型提取攻击,该攻击结合了具有准确性保证的蒙特卡洛梯度估计和基于解释的候选缩减,以高效生成边界样本。
- **全面的经验评估**:我们在横跨分子、生物、视觉和合成领域的八个图数据集、三种受害者架构和两种解释器类型上进行了广泛实验,证明了我们的方法在替代-受害者保真度上一致优于调整后的基线方法。
## 2 预备知识与动机
#### 图神经网络与解释。一个图\(G = (V, E, X)\)由节点\(V\)、边\(E \subseteq V \times V\)和节点特征\(X \in \mathbb{R}^{|V| \times d}\)组成。图神经网络(GNN)[14 (https://arxiv.org/html/2605.30470#bib.bib14),37 (https://arxiv.org/html/2605.30470#bib.bib37),12 (https://arxiv.org/html/2605.30470#bib.bib12)]通过消息传递机制处理\(G\)以获得节点级嵌入。在图分类任务中,GNN(记为\(f\))进一步应用池化操作以获得图级嵌入,并将嵌入映射为类别标签:\(f: \mathcal{G} \to [C]\),其中\([C] = \{1, \ldots, C\}\)表示标签空间。在特定模型\(f\)和图\(G\)下,GNN解释器\(h\)返回一个解释子图\(G_{\mathrm{sub}} = (V_{\mathrm{sub}}, E_{\mathrm{sub}})\),其中\(V_{\mathrm{sub}} \subseteq V\)且\(E_{\mathrm{sub}} \subseteq E\),标识对预测\(f(G)\)影响最大的节点和边。代表性方法包括GNNExplainer[41 (https://arxiv.org/html/2605.30470#bib.bib41)]和PGExplainer[17 (https://arxiv.org/html/2605.30470#bib.bib17)]。
参见图注
图 2: 模型提取的采样策略:曲面是决策边界,三角形是为可视化清晰而平滑的分类。现有方法是(a)或(b),关注随机采样或采样高置信度区域。我们的策略是(a)和(c)。
#### GNN边界采样的动机。为了更好地解决提取问题公式化中的现有空白,并回答我们在第1节 (https://arxiv.org/html/2605.30470#S1)中提出的问题:“什么样的采样数据对提取GNN有效?”,我们事先研究了边界采样对GNN提取的有效性以巩固我们的动机。我们进行了控制实验,在四个二分类基准数据集(AIDS, MUTAG, NCI1, Tox21\_AhR;数据集统计见附录E.1 (https://arxiv.org/html/2605.30470#A5.SS1))上隔离了边界接近度对提取保真度的影响。完整的实验细节见附录C (https://arxiv.org/html/2605.30470#A3)。对于影子数据集中的每个图\(G\),我们穷举测试所有单边翻转(\(\delta_e = 1\))以识别*边界对*\((G, G')\),其中\(f(G) \neq f(G')\),并将剩余图归类为*非边界样本*。我们在等大小的训练集上比较了四种训练策略:(1) 边界:仅用边界对样本训练;(2) 非边界:仅用非边界样本训练;(3) 混合:用50%边界对 + 50%来自整个影子集的随机样本训练;(4) 影子:仅用来自整个影子集的随机样本训练。
参见图注
图 3: 等大小训练集上不同采样策略的保真度(%)。完整结果见附录表2 (https://arxiv.org/html/2605.30470#A3.T2)。
在所有四个数据集上,使用边界数据的替代模型始终优于没有边界数据的模型(图3 (https://arxiv.org/html/2605.30470#S2.F3)),证实了决策边界信息对模型提取的益处远超出其比例。我们在附录C (https://arxiv.org/html/2605.30470#A3)中提供了完整的实验细节和理论分析。
#### 问题形式化。在这项工作中,我们考虑对图神经网络的*严格黑盒*模型提取攻击。设\(f: \mathcal{G} \to [C]\)表示一个受害者GNN分类器,它将图映射为离散类别标签\([C] = \{1, \ldots, C\}\)。攻击者仅有查询权限:给定任何图\(G\),攻击者可以观察到预测标签\(y(G) = f(G) \in [C]\),但不能访问概率得分、logits、置信度值或内部模型参数。这一严格假设反映了现实部署场景,其中API只返回分类决策。在一般的模型提取攻击中,攻击者的目标是训练一个替代模型\(g\)来复制\(f\)的决策行为,但这在黑盒设置下难以形式化。受已证明的GNN边界样本有效性的启发,我们将问题定义为构建一个由*边界对*组成的查询集\(\bar{\mathcal{G}}\):即那些相似但获得不同预测的图对。形式上,我们旨在设计一个有效算法\(M\)来尽可能多地发现边界对\((G, G')\),并训练一个模型\(g\)来重建相同的决策边界:
\[
M(Q, f, h, \delta) = \arg\max_{M} |\bar{\mathcal{G}}|, \quad \bar{\mathcal{G}} = \{ (G, G') : f(G) \neq f(G') \land \operatorname{dis}(G, G') \leq \delta \}
\]
\[
g = \arg\max_{g} \sum_{(G, G') \in \bar{\mathcal{G}}} \mathbb{I}(g(G)=f(G)) + \mathbb{I}(g(G')=f(G'))
\]
其中\(Q\)是攻击者可以承受查询受害者模型的预算。\(h\)是持有方的GNN解释器,返回一个离散的解释子图\(G_{\mathrm{sub}} = (V_{\mathrm{sub}}, E_{\mathrm{sub}})\),标识对预测\(f(G)\)重要的节点和边。\(\delta > 0\)是距离阈值,\(\operatorname{dis}(\cdot, \cdot)\)衡量图相似性,距离函数定义为:\(\operatorname{dis}(G, G') = \|A - A'\|_0\),即邻接矩阵中不同条目的数量。在这项工作中,我们专注于结构扰动,而我们后续的实验评估经验性地表明,仅边翻转就足以构建我们的边界搜索。如果需要处理特征主导的任务,也可以纳入特征扰动。值得注意的是,较小的\(\delta\)直观上会产生更精确刻画\(f\)局部决策边界几何的边界对。
## 3 XSTEAL 框架
在本节中,我们描述如何构建我们的方法来搜索满足条件的边界对\((G, G')\)。相似文章
通过共享表示攻击图基础模型
本文识别并攻击了图基础模型的对齐层,表明这是一个独特的攻击面,在低预算扰动下尤其脆弱,特别是对于频谱分词器,并提出基于检测的防御措施。
通过记忆回溯和拓扑归因实现时间图网络的可解释性
本文介绍了MemExplainer,一种通过拓扑归因树和记忆回溯树来归因贡献,并使用层相关性传播(LRP)提供忠实解释时间图网络(TGN)预测的方法。
知识图谱与可解释人工智能作为城市采矿的互补资源
本文提出了一种基于互补理论的解释,用于整合知识图谱与可解释人工智能,以支持城市采矿中拆前评估的可辩护决策。它定义了四种KG-XAI集成模式(提升、约束、类型化、修正),并通过一个防火门示例进行了说明。
对抗图神经网络基准:迈向实用且公平的评价
本文提出了一个全面的基准,用于评估图神经网络中的对抗攻击与防御,强调了需要标准化和公平的实验协议。
使用图神经网络的门级网表结构可操控性学习
本文定义了一种基于拓扑驱动的门级网表结构可操控性分数,该分数基于路径参与度、k-core嵌入、对称性和中心性,并评估了不同GNN架构在ISCAS85和EPFL基准上近似该分数的效果,以及一个关于木马检测的案例研究。