COPYCOP:图神经网络的所有权验证
摘要
本文介绍了 CopyCop,这是一种用于验证图神经网络所有权的算法,即使模型在架构、权重或输出变换上存在差异,它也能检测出代理模型。
arXiv:2605.05360v1 公告类型:新发布
摘要:给定两个输出节点嵌入的 GNN,我们如何判断它们是否独立训练?攻击者可能专门训练一个 GNN 来模仿另一个 GNN 的嵌入。为了掩盖 GNN 之间的这种关系,对抗性 GNN 可能会对其输出嵌入进行变换。这两个 GNN 可能具有不同的架构、权重和嵌入维度,且攻击者可以变换嵌入。尽管存在这些严苛条件,我们的算法(名为 CopyCop)仍能识别此类模仿 GNN,而现有的水印和指纹方法则无法做到。我们还为 CopyCop 提供了理论保证。最后,在 14 个数据集和 5 种 GNN 架构上的实验表明,CopyCop 准确且对广泛的对抗性攻击和变换具有鲁棒性。代码可用地址:https://anonymous.4open.science/r/CopyCop-Graph-Ownership-Verification-8143/README.md
查看缓存全文
缓存时间: 2026/05/08 07:02
# CopyCop:图神经网络的所有权验证
来源:https://arxiv.org/html/2605.05360
Rahul Nandakumar
McCombs 商学院,德克萨斯大学奥斯汀分校
奥斯汀,TX
rahul\.nandakumar@utexas\.edu
&Deepayan Chakrabarti
McCombs 商学院,德克萨斯大学奥斯汀分校
奥斯汀,TX
deepay@utexas\.edu
###### 摘要
给定两个输出节点嵌入的 GNN,我们如何判断它们是否独立训练?对手可能专门训练一个 GNN 以模仿另一个 GNN 的嵌入。为了掩盖 GNN 之间的这种关系,对抗性 GNN 可能会对其输出的嵌入进行转换。这两个 GNN 可能具有不同的架构、权重和嵌入维度,且对手可以对嵌入进行转换。尽管条件严苛,我们的算法(名为 CopyCop)仍能识别此类“山寨”GNN,而现有的水印和指纹方法则无法做到这一点。我们还为 CopyCop 提供了理论保证。最后,在 14 个数据集和 5 种 GNN 架构上的实验表明,CopyCop 准确且稳健,能够抵御广泛的对抗性攻击和转换。代码可在以下地址获取:https://anonymous.4open.science/r/CopyCop-Graph-Ownership-Verification-8143/README.md
## 1 引言
图神经网络(GNNs)越来越多地作为可复用的嵌入模型进行部署,通常通过“嵌入即服务”(Embeddings-as-a-Service)\[peng\_are\_2023\] 的形式对外提供。在这种设置下,用户使用图查询模型并获得节点嵌入,这些嵌入可复用于下游任务。虽然这实现了灵活的复用,但也提出了一个根本性问题:*我们能否判断另一个模型是独立训练的,还是源自已部署的 GNN?*
对手可以通过在多个图上查询受害者模型并从产生的输入-输出对中学习,来训练一个模仿受害者模型嵌入的替代 GNN。随后,对手可以应用旋转、缩放、置换或改变嵌入维度等转换。这些转换可能会大幅改变表示,同时保持下游性能,使得替代模型看起来与受害者模型无关。此外,替代 GNN 的架构可能与受害者 GNN 不同。因此,给定一个输出嵌入的受害者 GNN,我们的目标是在架构、参数、嵌入维度或输出转换发生变化的情况下,识别替代 GNN。
现有的替代模型检测方法分为两类:水印和指纹。水印方法通过修改训练过程,使模型在特殊图上产生独特的输出\[zhao\_watermarking\_2021,xu\_watermarking\_2023,pregip\]。然而,对手可以通过模型提取绕过此类信号:通过在普通图上查询受害者并仅利用产生的输入-输出对进行训练,替代模型无需重现特殊的水印行为\[lukas\_sok\_2021\]。指纹方法避免修改受害者模型,而是依赖于其输出的内在属性。对于输出嵌入的 GNN,现有方法通常直接比较受害者和候选嵌入\[grove\]。然而,简单的转换如旋转或嵌入维度的变化,可能使嵌入在分类器看来有所不同,同时保持下游准确性。因此,现有的基于嵌入的指纹容易受到替代表示中表面变化的影响。
**图 1:CopyCop 概览:** 在嵌入即服务模式中,受害者 GNN 为输入图提供嵌入,这些嵌入可用于下游任务。对手可以训练一个替代 GNN 来模仿这些嵌入,然后对其进行转换,在实现相似准确率的同时掩盖替代关系。CopyCop 能够在不进行受害者 GNN 水印的情况下,检测出经过此类转换的替代模型。
### 1.1 我们的贡献
我们提出了 CopyCop,一种针对 GNN 的指纹方法,对广泛的对抗性转换(包括旋转、缩放和嵌入维度变化)具有鲁棒性。我们的方法是架构无关的:受害者和替代 GNN 可以使用不同的架构、参数和嵌入维度。此外,我们的指纹是随机的,并且可以随时重新生成,因此泄露的指纹不会永久破坏该方法的安全性。据我们所知,*CopyCop 是第一种在广泛转换下、跨 GNN 架构且在任何时间点对 GNN 嵌入有效的指纹方法。*
核心思想是利用嵌入函数的驻点作为指纹。节点的嵌入是图结构和节点特征的函数。由于对手可能会转换嵌入空间,指纹必须对此类转换保持不变。我们证明了嵌入函数的驻点具有这种不变性属性。我们展示了如何从受害者 GNN $M$ 中采样驻点,并测试这些点对于候选 GNN $Z$ 是否也是驻点。该测试使我们能够以高置信度确定 $Z$ 是独立训练的还是 $M$ 的替代模型。我们证明了在合理条件下,无论 GNN 架构或嵌入维度如何,CopyCop 都能检测替代模型。
在实证方面,我们在 14 个数据集和 5 种流行的 GNN 架构上评估了 CopyCop。结果表明,CopyCop 对模型提取、剪枝、微调以及广泛的嵌入转换具有鲁棒性。
本文其余部分组织如下。我们在第 2 节 (https://arxiv.org/html/2605.05360#S2) 讨论相关工作。在第 3 节 (https://arxiv.org/html/2605.05360#S3) 中,我们提出所提方法并证明其对嵌入转换的鲁棒性。我们在第 4 节 (https://arxiv.org/html/2605.05360#S4) 通过实证验证我们的方法,并在第 5 节 (https://arxiv.org/html/2605.05360#S5) 总结。所有证明和额外实验均推迟到附录中。
## 2 相关工作
我们在所有权验证方面的工作与更广泛的推断图结构和属性的对抗性攻击领域相关\[zhang\_gnnguard\_2020,deng2022garnet,wang\_group\_2022,zhang\_inference\_2022\]。对后门攻击的鲁棒性也与可信 AI\[dai\_comprehensive\_2024\]、完整性验证\[8953972,kuttichira2022verification,wang2023publiccheck\] 以及 MLaaS 中 GNN 的基于查询的方案\[wu2024securing\] 相关。在此,我们概述与我们最密切相关的研究。
**模型窃取攻击与防御:** 模型窃取攻击与防御已在图像\[papernot\_practical\_2017\]和文本\[krishna\_thieves\_2020\]等领域得到研究。一种防御方法是扰动模型的层\[lee\_defending\_2019\],但这无法对抗模型提取攻击\[juuti\_prada\_2019\]。其他防御基于查询模式检测模型提取攻击\[juuti\_prada\_2019\]。然而,我们假设受害者 GNN 是公开的,或者对抗性查询可以成功隐藏。类似针对 GNN 的攻击也已提出\[defazio\_adversarial\_2019,shen\_model\_2022\],但\[lukas\_sok\_2021\] 表明当前防御措施不足。一个相关但不同的问题是*完整性验证*:检测部署后的模型是否被篡改\[8953972,kuttichira2022verification,wang2023publiccheck\]。然而,我们关注的是完全可能在架构和权重上截然不同的独立训练替代模型的*所有权*验证。
**水印:** 可以通过在训练期间正则化模型参数,将水印嵌入受害者模型的权重中\[uchida\_embedding\_2017\]。其他方法嵌入后门,训练模型对特殊输入返回不可能的输出\[adi\_turning\_2018,darvish\_rouhani\_deepsigns\_2019,kwon\_blindnet\_2022,zhao\_recipe\_2023\]。针对 GNN 的后门式水印也已提出\[zhao\_watermarking\_2021,xu\_watermarking\_2023,pregip\]。然而,水印可能会降低性能\[grove\],并且容易受到模型提取攻击的影响\[lukas\_sok\_2021\]。
**指纹:** 与水印不同,指纹不修改受害者模型。指纹可以基于模型权重\[chen\_deepmarks\_2019\]、某些替代模型和独立模型给出非常不同输出的特殊输入\[lukas\_deep\_2021\]、跨越决策边界的特殊向量上的样本对\[peng\_fingerprinting\_2022\],或替代模型的置信水平\[maini\_dataset\_2021\]。对于 GNN,现有方法依赖于受害者模型和替代模型之间嵌入的相似性\[grove\]。这种方法仅适用于受害者和替代 GNN 具有相同嵌入维度的情况,限制了其通用性。相比之下,我们的方法适用于任何 GNN 架构或嵌入维度的替代模型。
## 3 所提方法
图是一个元组 $(G, X)$,其中 $G=(V, E)$ 有 $n:=|V|$ 个节点,每个节点具有特征 $x_i \in \mathbb{R}^D$,且 $X=(x_1, ..., x_n)$。设 $\mathcal{D}$ 表示可行对 $(G, X)$ 上的数据分布。$d$ 维 GNN $H$ 是一个函数 $h:(G, X) \to \mathbb{R}^{d \times n}$,其第 $i$ 列 $h_i(G, X; H) \in \mathbb{R}^d$(或当上下文清楚时为 $h_i(X)$)是节点 $i$ 的*嵌入*。
我们给定一个 $d$ 维*受害者* GNN $M$,其嵌入具有以下属性。
###### 假设 3.1(嵌入性质)。
$h_i(X)$ 二阶可微且海森矩阵有界,并且存在常数 $\underline{\alpha}_M$ 和 $\overline{\alpha}_M$,使得对于所有可行的 $G, X$ 和 $i$,有 $0 < \underline{\alpha}_M \leq \|h_i\| \leq \overline{\alpha}_M$。
接下来,我们看到一个 $d'$ 维 GNN 模型 $Z$,可能使用与 $M$ 不同的架构和维度。我们可以用少数图查询 $Z$ 并观察其输出,但无法访问 $Z$ 的内部结构。我们的目标是*确定 GNN $Z$ 是独立训练的模型还是受害者 GNN $M$ 的替代模型*。我们定义替代模型如下。
###### 定义 3.2(替代模型)。
$d'$ 维 GNN $M'$,其嵌入 $h'_i := h_i(G, X; M') \in \mathbb{R}^{d'}$,是 GNN $M$ 的替代模型,如果存在函数 $\phi: \mathbb{R}^d \to \mathbb{R}^{d'}$ 和 $\hat{h}:(G, X) \to \mathbb{R}^{d \times n}$ 使得
$$
\sup_{G, X, i} \|\hat{h}_i(G, X) - h_i(G, X; M)\| \leq \epsilon,
$$
$$
h'_i = \phi(\hat{h}_i), \quad (1)
$$
对于每个可行的图 $(G, X)$ 或位于可行图的 $\delta$-邻域内的图成立($\epsilon$ 和 $\delta$ 是稍后指定的小正数)。
直观地说,对手可以在图 $(G, X)$ 上查询受害者模型 $M$,收集所有节点产生的嵌入 $h_i(G, X; M)$,并训练一个其嵌入 $\hat{h}_i$ 近似 $h_i$ 的 GNN。对手随后可能应用额外的转换层,输出 $\phi(\hat{h}_i)$。或者,对手可以使用 $(G, X)$ 作为输入,$\phi(h_i)$ 作为目标输出,端到端地训练 $M'$。尽管对手从未显式构建中间表示 $\hat{h}_i$,但刻画 $h_i$ 和 $h'_i$ 之间的联系仍然有用。在这两种情况下,受害者和替代模型分别输出嵌入 $h_i \in \mathbb{R}^d$ 和 $h'_i \in \mathbb{R}^{d'}$,我们的算法仅依赖于这些输出。两者之间的链接由定义 3.2 (https://arxiv.org/html/2605.05360#A2.EGx1) 中引入的(未观测到的)$\hat{h}_i$ 和 $\phi(\cdot)$ 给出。它们的存在仅用于我们的分析中。
接下来,我们在讨论一般情况之前,从无重建误差($\epsilon=0$)的特殊情况出发,激励我们提出的方法。
### 3.1 完美重建情况
在此,$h_i = \hat{h}_i$,因此 $M'$ 输出嵌入 $h'_i = \phi(h_i)$。并非所有 $\phi(\cdot)$ 的选择都是现实的。例如,$\phi(h) = 0$ 会导致无用的嵌入。更一般地,如果对于 $h_1 \neq h_2$ 有 $\phi(h_1) = \phi(h_2)$,则 $\phi(\cdot)$ 丢失信息。这可能会损害下游任务的性能,因此对手会避免此类 $\phi(\cdot)$。
###### 假设 3.4(局部可逆性)。
转换 $\phi(\cdot)$ 是可微且局部可逆的:
$$
\nabla_w \phi|_h := \lim_{t \to 0} \frac{\phi(h + tw) - \phi(h)}{t} \neq 0 \quad \forall h \in \mathbb{R}^d, w \in \mathbb{R}^d, \|w\|=1. \quad (2)
$$
假设 3.4 (https://arxiv.org/html/2605.05360#A2.EGx2) 确保对于任何两个接近的嵌入 $h_1 \neq h_2$,有 $\phi(h_1) \neq \phi(h_2)$。该假设适用于许多直观的转换,如旋转、非零缩放、投影到更高维度和平移,以及此类函数的任意组合(见附录中的引理 A.2 (https://arxiv.org/html/2605.05360#A1.Thmtheorem2))。注意,投影到较低维度会丢失信息,因此对手会避免 $d' < d$ 的情况。
[注:原文此处数学公式较为密集且部分截断,以下翻译尽量保留原意并整理格式]
... [中间部分关于驻点性质、定理证明及一般情况的推导] ...
### 3.2 一般情况
现在,$\hat{h}_i(X)$ 可以是围绕 $h_i(X)$ 宽度为 $\epsilon$ 的带内的任何函数(定义 3.2 (https://arxiv.org/html/2605.05360#A2.EGx1))。因此,其驻点可能与 $M$ 不同。函数 $\hat{h}_i(X)$ 甚至可能不连续,因此我们不能假设其方向导数存在。所以我们不能像在算法 1 (https://arxiv.org/html/2605.05360#alg1) 中那样直接检查驻点。相反,我们近似驻点检查,如下所示。
###### 定义 3.9。
设 $F$ 为任何 GNN 模型。对于元组 $t = (G, X, i, w) \in \mathcal{Q}$ ...相似文章
子图解释能否被武器化以窃取图神经网络?
本文首次提出在严格黑盒约束下对图分类的模型提取攻击,利用子图解释来估计决策边界。研究结果表明,强制性的可解释性接口在**图神经网络**服务中造成了可被利用的安全漏洞。
VeriGate:用于GRPO的验证器门控步级监督
VeriGate通过验证器门控步级监督扩展了GRPO,在验证器奖励退化时提供细粒度的信用分配。在1.5B和7B模型的推理基准测试上实现了显著的准确率提升。
LLMSniffer:通过GraphCodeBERT和监督对比学习检测大模型生成代码
LLMSniffer是一个检测框架,通过监督对比学习微调GraphCodeBERT来区分AI生成的代码和人工编写的代码,在GPTSniffer和Whodunit基准测试上分别达到78%和94.65%的准确率。该方法通过结合代码结构感知嵌入、对比学习和注释移除预处理,解决了学术诚信和代码质量保证方面的关键挑战。
使用图神经网络从凯莱图学习代数性质的通用框架
本文提出了一个使用图神经网络从凯莱图学习代数性质的通用框架,为利用GNN进行代数推理提供了新方法。
基于图的金融欺诈检测:校准风险评分与结构正则化
本文提出了一种用于金融欺诈检测的图神经网络框架,该框架将交易记录和身份信息整合到节点属性中,采用多层消息传递机制,并利用加权监督和结构一致性正则化来改进风险评分和概率校准。在公共数据集上的实验表明,该方法优于现有方法。