基于模型重编程的GNN模型提取防御

arXiv cs.LG 论文

摘要

本文提出了GraphRP,一种利用模型重编程的主动防御框架,用于保护GNN免受模型提取攻击,其采用结构感知门控机制,在降低对抗查询有效性的同时保持良性查询的效用。

arXiv:2608.11495v1 公告类型:新 摘要:图神经网络(GNN)是机器学习即服务(MLaaS)中高风险应用的骨干。然而,其黑盒部署使其面临模型提取(ME)攻击,攻击者通过查询API窃取知识产权。现有防御存在严重的“欧几里得偏差”:它们将基于图像的策略(如随机噪声)迁移到图上,忽略了节点之间复杂的拓扑依赖关系,往往导致严重的效用下降。水印等被动方法也无法实时阻止窃取。为弥补这一空白,我们提出了GraphRP(图重编程保护),一种将模型重编程用于安全的主动防御框架。与静态扰动不同,GraphRP引入了一种由可学习拓扑原型驱动的结构感知门控机制。这创建了一道动态的“结构防火墙”,能够选择性地调节模型的决策边界:对于位于训练流形上的良性查询保持保真度,同时沿着扰动方向最大化对抗查询的Fisher信息。在标准假设(有界损失、最优攻击者和局部二阶近似)下,我们证明了攻击者估计误差的下界随重编程噪声的结构敏感性而增加。在硬标签和软标签ME攻击上的大量实验表明,GraphRP显著降低了攻击有效性,同时保持了良性效用。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:36

# 使用模型重编程防御针对GNN的模型提取攻击
来源:https://arxiv.org/html/2608.11495
## Defending against Model Extraction for GNNs with Model Reprogramming会议:第32届ACM SIGKDD知识发现与数据挖掘会议 V.2;2026年8月9–13日,韩国济州岛Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 \(KDD ’26\), August 09–13, 2026, Jeju Island, Republic of KoreaDOI:10\.1145/3770855\.3817983 (https://doi.org/10.1145/3770855.3817983)ISBN:979\-8\-4007\-2259\-2/2026/08CCS:安全与隐私 软件与应用安全CCS:计算方法 机器学习

Yan WenOrcID:0009\-0002\-6425\-5056 (https://orcid.org/0009-0002-6425-5056)所属机构:马里兰大学帕克分校,计算机科学系,College Park, MD,美国邮箱:[ywen1@umd\.edu](mailto:[email protected])Zhenyi WangOrcID:0000\-0002\-2780\-9446 (https://orcid.org/0000-0002-2780-9446)所属机构:中佛罗里达大学,计算机科学系与人工智能研究所,Orlando, FL,美国邮箱:[zhenyi\.wang@ucf\.edu](mailto:[email protected])和Heng HuangOrcID:0000\-0002\-3483\-8333 (https://orcid.org/0000-0002-3483-8333)所属机构:马里兰大学帕克分校,计算机科学系,College Park, MD,美国邮箱:[heng@umd\.edu](mailto:[email protected])

2026;© cc

###### 摘要\.

图神经网络 \(GNNs\) 是机器学习即服务 \(MLaaS\) 中高风险应用的核心支撑。然而,其黑盒部署方式使其面临模型提取 \(ME\) 攻击的风险:攻击者通过查询API窃取知识产权。现有防御方法存在严重的“欧几里得偏见”:它们将基于图像的策略(如随机噪声)直接迁移到图数据上,忽略了节点之间复杂的拓扑依赖关系,往往导致严重的效用下降。水印等被动方法也无法实时阻止窃取行为。为弥补这一空白,我们提出GraphRP(GraphReprogrammingProtection,图重编程保护),一种基于模型重编程的安全防御框架。与静态扰动不同,GraphRP引入了一种由可学习的拓扑原型驱动的结构感知门控机制。这构建了一道动态的“结构防火墙”,能够选择性地调节模型的决策边界:对于位于训练流形上的良性查询,保持模型输出保真度;对于对抗性查询,则沿扰动方向最大化Fisher信息。在标准假设下(有界损失、最优攻击者和局部二阶近似),我们证明了攻击者估计误差的下界随重编程噪声的结构敏感性增加而增大。在硬标签和软标签模型提取攻击上的大量实验表明,GraphRP在保持良性查询效用的同时,显著降低了攻击有效性。

###### 关键词:

模型提取;图神经网络;模型重编程;对抗防御;可信人工智能

††cc\-license:by

## 1\. 引言

图神经网络 \(GNNs\)\(21 (https://arxiv.org/html/2608.11495#bib.bib1);12 (https://arxiv.org/html/2608.11495#bib.bib2);39 (https://arxiv.org/html/2608.11495#bib.bib3)\)已成为建模非欧几里得数据的事实标准,并在推荐系统\(46 (https://arxiv.org/html/2608.11495#bib.bib4)\)、金融欺诈检测\(23 (https://arxiv.org/html/2608.11495#bib.bib5)\)和社交网络分析\(22 (https://arxiv.org/html/2608.11495#bib.bib6)\)等高风险应用中发挥着核心作用。考虑到数据收集和模型训练的高昂成本,这些专有模型越来越多地以云端API服务的形式部署,这种范式被称为机器学习即服务 \(MLaaS\)\(24 (https://arxiv.org/html/2608.11495#bib.bib7);25 (https://arxiv.org/html/2608.11495#bib.bib8)\)。然而,这种黑盒访问方式使其面临模型提取 \(ME\) 攻击:攻击者通过系统性地查询API,训练出一个能够复制受害者模型功能的替代模型\(35 (https://arxiv.org/html/2608.11495#bib.bib9);45 (https://arxiv.org/html/2608.11495#bib.bib10);50 (https://arxiv.org/html/2608.11495#bib.bib11)\)。与针对独立同分布 \(i\.i\.d\.\) 图像数据的攻击不同,针对GNN的模型提取攻击利用了节点之间复杂的拓扑依赖关系,使攻击者能够从有限的查询中推断出全局图属性。这使得GNN在知识产权 \(IP\) 窃取以及后续对抗性利用方面尤为脆弱\(7 (https://arxiv.org/html/2608.11495#bib.bib12)\)。

尽管已有工作在防御模型提取方面取得了进展,但现有解决方案在应用于GNN时存在关键局限性。首先,被动防御(如水印\(9 (https://arxiv.org/html/2608.11495#bib.bib13);15 (https://arxiv.org/html/2608.11495#bib.bib14)\))侧重于所有权验证,而非预防。这些方法只能在窃取行为发生后识别被盗模型,而此时知识产权已经受到侵害。其次,从图像域迁移而来的主动防御未能考虑图数据的特有属性。大多数现有主动防御方法试图通过在推理过程中添加随机噪声或执行复杂计算来迷惑攻击者\(32 (https://arxiv.org/html/2608.11495#bib.bib15);20 (https://arxiv.org/html/2608.11495#bib.bib16);27 (https://arxiv.org/html/2608.11495#bib.bib17);43 (https://arxiv.org/html/2608.11495#bib.bib18)\)。然而,这些方法在图数据上存在两大问题:\(1\) 效用下降:与图像中的像素不同,图中的节点是相互连接的。对单个节点添加无差别噪声会在消息传递过程中将误差传播给其邻居,严重损害良性用户的模型准确性。\(2\) 高延迟:许多防御方法需要对每个查询执行昂贵的优化步骤。对于推荐系统等现实网络应用,这种额外延迟是不可接受的。

这些挑战引出了本工作的核心研究问题:RQ:我们如何为GNN设计一种主动防御方法,既能有效阻止模型提取,又不会损害良性用户的准确性,同时保持推理速度?

为解决这一问题,我们提出GraphRP(GraphReprogrammingProtection),一种基于模型重编程\(3 (https://arxiv.org/html/2608.11495#bib.bib19);17 (https://arxiv.org/html/2608.11495#bib.bib20)\)的新型主动防御机制。虽然重编程传统上用于将预训练模型适配到新任务,但我们将其重新用于安全目的。我们的核心洞察是将防御视为一个“条件任务”:模型应对良性查询表现正常,而对对抗性查询则基本“失效”。与随机噪声注入不同,GraphRP优化一组可学习的、逐层扰动,构成一道“结构防火墙”。至关重要的是,我们引入了一种结构感知门控机制,根据输入图的拓扑特征动态调节这些扰动。通过学习“良性结构原型”,我们的方法确保防御性噪声仅在查询分布偏离良性分布(OOD)时被激活,从而保持良性用户的效用。

总之,我们的主要贡献有以下四点:

- •框架:我们提出GraphRP,这是第一个利用模型重编程来保护GNN免受模型提取攻击的防御框架,无需重新训练完整模型。
- •结构感知:我们引入了一种基于原型的门控机制,利用图的拓扑不变量(如谱特征)区分良性查询和提取攻击,解决了效用与防御之间的权衡。
- •理论保证:在标准假设下(有界损失、最优攻击者和局部二阶近似),我们证明了我们的方法通过利用目标GNN的Fisher信息,最大化攻击者估计误差的下界。
- •实证有效性:在多个基准上的大量实验表明,与最先进的基线相比,GraphRP将克隆模型准确率降低高达17%17\\%,同时保持高效用和低推理延迟。

## 2\. 相关工作

### 2\.1\. 模型提取

模型提取 \(ME\) 也被称为模型窃取,是指通过提取目标模型的参数或逼近其决策边界来复制目标模型功能的对抗过程\(31 (https://arxiv.org/html/2608.11495#bib.bib21);33 (https://arxiv.org/html/2608.11495#bib.bib22);38 (https://arxiv.org/html/2608.11495#bib.bib23);30 (https://arxiv.org/html/2608.11495#bib.bib24)\)。攻击者可能针对精确参数\(34 (https://arxiv.org/html/2608.11495#bib.bib25)\)、超参数\(41 (https://arxiv.org/html/2608.11495#bib.bib26)\)或神经架构\(29 (https://arxiv.org/html/2608.11495#bib.bib27)\);然而,本工作关注的是行为克隆——训练一个模拟目标模型输出的替代模型,而不访问其内部结构\(7 (https://arxiv.org/html/2608.11495#bib.bib12)\)。

ME攻击通常根据攻击者可获取的数据进行分类。基于数据的模型提取 \(DBME\)\(18 (https://arxiv.org/html/2608.11495#bib.bib28);5 (https://arxiv.org/html/2608.11495#bib.bib29);33 (https://arxiv.org/html/2608.11495#bib.bib22)\) 假设攻击者拥有与受害者训练数据分布相似的数据集。通过使用这些输入查询目标模型,攻击者收集带标签的样本对,以监督方式训练替代模型。相反,无数据模型提取 \(DFME\)\(18 (https://arxiv.org/html/2608.11495#bib.bib28);38 (https://arxiv.org/html/2608.11495#bib.bib23)\) 代表了一种更复杂的威胁:攻击者无法获得任何真实数据。在这种情况下,攻击者必须生成合成查询,以同时探索高维输入空间并学习模型行为,通常利用生成模型来最大化查询效率。

提取的难度还取决于API输出的粒度。在软标签攻击中,受害者返回完整的概率分布(logits),为攻击者提供了关于决策边界的丰富信息\(13 (https://arxiv.org/html/2608.11495#bib.bib30)\)。相比之下,硬标签攻击仅返回Top\-1类别预测。这种设置显著限制了每次查询的信息增益,迫使攻击者依赖仅标签的学习技术,这类技术通常样本效率较低且更难优化。

近期研究表明,由于结构信息的泄露,GNN对此类攻击具有独特的脆弱性\(7 (https://arxiv.org/html/2608.11495#bib.bib12);45 (https://arxiv.org/html/2608.11495#bib.bib10);35 (https://arxiv.org/html/2608.11495#bib.bib9);50 (https://arxiv.org/html/2608.11495#bib.bib11)\)。与图像模型不同,GNN提取不仅重建节点标签,还重建底层图拓扑。45 (https://arxiv.org/html/2608.11495#bib.bib10)提出使用离散图结构学习从节点属性推断替代图,而35 (https://arxiv.org/html/2608.11495#bib.bib9)利用k最近邻 \(kNN\) 初始化替代结构。最近,50 (https://arxiv.org/html/2608.11495#bib.bib11)提出了StealGNN,一种无数据的GNN提取攻击,利用生成模型在无法访问任何真实图数据的情况下合成查询,证明即使在严格的黑盒约束下,结构信息也会泄露。此外,随着领域向大规模预训练发展,47 (https://arxiv.org/html/2608.11495#bib.bib31)表明即使是图基础模型也容易受到提取攻击,这凸显了在图域中建立稳健防御机制的迫切需求。

### 2\.2\. 模型提取防御

现有的模型提取防御策略大致可分为被动防御和主动防御两大类,取决于它们是尝试检测攻击还是完全阻止攻击。

被动防御侧重于监控和检测提取尝试,而不修改模型的推理行为\(15 (https://arxiv.org/html/2608.11495#bib.bib14);37 (https://arxiv.org/html/2608.11495#bib.bib32);26 (https://arxiv.org/html/2608.11495#bib.bib33)\)。这些方法通常分析查询模式、分布偏移和时序,以识别与正常用户行为不同的可疑活动。标准技术包括复杂的日志记录和异常检测流水线。在GNN的具体背景下,近期方法(如9 (https://arxiv.org/html/2608.11495#bib.bib13)提出的方法)主张将水印直接嵌入GNN解释中以验证所有权。虽然这些方法为事后法律追索提供了证据,但无法从一开始就防止知识产权窃取。

相比之下,主动防御旨在通过主动修改模型的响应或访问机制来阻止模型提取 \(ME\) 攻击\(32 (https://arxiv.org/html/2608.11495#bib.bib15);20 (https://arxiv.org/html/2608.11495#bib.bib16);19 (https://arxiv.org/html/2608.11495#bib.bib34);27 (https://arxiv.org/html/2608.11495#bib.bib17);43 (https://arxiv.org/html/2608.11495#bib.bib18)\)。主要策略包括预测混淆\(32 (https://arxiv.org/html/2608.11495#bib.bib15)\)(修改输出logits以降低每次查询的信息增益)和扰动技术\(20 (https://arxiv.org/html/2608.11495#bib.bib16);19 (https://arxiv.org/html/2608.11495#bib.bib34);43 (https://arxiv.org/html/2608.11495#bib.bib18)\)(引入随机噪声以降低提取替代模型的保真度)。其他方法,如查询限制\(27 (https://arxiv.org/html/2608.11495#bib.bib17)\),限制查询速率或基于行为分析动态调整响应\(43 (https://arxiv.org/html/2608.11495#bib.bib18);50 (https://arxiv.org/html/2608.11495#bib.bib11)\)。

尽管取得了上述进展,为GNN设计防御方法仍面临现有方法无法解决的独特挑战。我们将这种失败模式称为欧几里得偏见。图数据是非欧几里得的,包含节点特征与拓扑结构之间的复杂依赖关系。大多数现有主动防御是为独立同分布 \(i\.i\.d\.\) 图像数据设计的;当应用于图时,它们通常会破坏消息传递机制,导致良性用户的效用严重下降。近期工作ADAGE\(48 (https://arxiv.org/html/2608.11495#bib.bib35)\)向GNN专用主动防御迈出了一步,通过监控跨会话的输入查询多样性,并主动拦截表现出提取特征模式的请求。然而,ADAGE以有状态方式运行,需要跨多个API调用持续监控查询日志,这带来了显著的基础设施开销,使其无法应用于真正的无状态黑盒部署。此外,其反应式拦截策略依赖于在触发防御之前积累足够的查询历史,这为早期攻击留下了可利用的时间窗口。相比之下,GraphRP完全无状态:它不需要查询日志记录或跨会话状态,并且仅基于当前输入的结构特征在推理时主动污染每个OOD查询。这些根本性的架构差异使得ADAGE与GraphRP之间的直接实验比较不可行,因为它们在互不兼容的部署假设下运行。

我们的工作通过提出一种新的防御流水线来弥合这一空白,该流水线

相似文章

子图解释能否被武器化以窃取图神经网络?

arXiv cs.LG

本文首次提出在严格黑盒约束下对图分类的模型提取攻击,利用子图解释来估计决策边界。研究结果表明,强制性的可解释性接口在**图神经网络**服务中造成了可被利用的安全漏洞。

PropGuard:通过传播感知的探索与修复保障LLM-MAS安全

arXiv cs.LG

PropGuard是一种传播感知框架,用于保护基于LLM的多智能体系统(LLM-MAS)免受跨智能体和轮次传播的恶意指令的影响。它构建了一个双视角时空图,并使用经过GE-GRPO训练的检查器来检测和修复可疑的传播子图。

Schreier-Coset Graph Rewiring

arXiv cs.LG

提出了 Schreier-Coset 图重连(Schreier-Coset Graph Rewiring),一种基于群论的图重连方法,用于 GNN,通过改善谱间隙和有效电阻来缓解过度挤压问题。实验结果表明,该方法在多种学习任务中显著降低了有效电阻。