SoK:神经正切泛化攻击现状的全面分析与研究方向

arXiv cs.LG 论文

摘要

本文对用于数据保护的神经正切泛化攻击(NTGA)进行了全面分析,包括相关攻击的分类,并讨论了未来的研究方向。

arXiv:2605.12792v1 公告类型:新 摘要:近期存在一个严重问题,即深度神经网络(DNN)训练中越来越多地使用未授权数据。一种干净标签泛化攻击(数据投毒攻击的一种类型)被提出以解决此问题。神经正切泛化攻击(NTGA)被认为是黑盒设置下首个著名的干净标签泛化攻击,在数据保护方法中迈出了前所未有的步伐。本文对NTGA的最新进展进行了全面分析;据我们所知,这是首个针对NTGA的深入分析。首先,我们提供了针对DNN的攻击分类,并解释了它们与NTGA的关系。然后,本文提出了黑盒攻击的分类体系,并证明NTGA是黑盒设置下第一个干净标签泛化攻击。我们进一步分析了NTGA的现有研究,并通过自己的实验验证这些发现,对其结果进行了全面比较。此外,我们的广泛实验表明,NTGA对对抗训练和图像变换具有脆弱性,而对NTGA生成的图像应用线性可分性会使它们更容易受到这些脆弱性的影响。我们阐述了NTGA的优缺点,并根据分析提出了提高NTGA鲁棒性的方法。进一步实验表明,最近提出的几种干净标签泛化攻击在数据保护方面优于NTGA。最后,我们揭示了进一步研究的必要性,并提供了关于NTGA的未来研究见解。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:18

# SoK:神经正切泛化攻击现状综合分析及研究方向
来源:https://arxiv.org/html/2605.12792

由于深度神经网络(DNN)表现出色,它们被广泛应用于各个领域的多种应用中(Goodfellow等人,2016 (https://arxiv.org/html/2605.12792#bib.bib75);Li等人,2021 (https://arxiv.org/html/2605.12792#bib.bib73);Poznyak等人,2019 (https://arxiv.org/html/2605.12792#bib.bib74))。为了使DNN获得最佳结果,需要用大量数据进行训练。另一方面,互联网包含海量数据,这些数据归属于不同的所有者。由于对大数据集的迫切需求,DNN从业者倾向于以非法方式从互联网收集数据。因此,不愿意分享其信息的数据所有者要求有方法保护其数据免受未经授权的利用。幸运的是,大量研究工作已致力于通过数据保护方法来避免数据的未经授权使用。2018年,Yuan和Wu(Yuan and Wu, 2021 (https://arxiv.org/html/2605.12792#bib.bib1))提出了一种这样的数据保护方法——神经正切泛化攻击(NTGA),该方法基于神经正切核(NTK)(Jacot等人,2018 (https://arxiv.org/html/2605.12792#bib.bib2))。NTGA的核心思想是向训练数据集中添加人眼无法察觉的扰动。这样,在扰动数据集上训练的模型将在验证集或测试集上表现不佳。因此,这些数据对DNN从业者来说变得毫无价值。由于这些扰动对人眼不可见,数据仍可像往常一样用于其他常规目的。NTGA代表了数据保护方法领域的重大进步,原因如下:(1)它解决了数据保护方法在不同模型间的可迁移性问题;(2)它通过宽神经网络的NTK近似利用高斯过程来生成数据投毒攻击;(3)与当时现有方法相比,它在保护数据方面表现出色。其重要性主要在于它是首个在黑盒设定下的干净标签泛化攻击。为什么黑盒性质如此关键?因为我们无法预测未经授权的用户可能使用哪种模型,扰动必须对任何模型都有效。

在NTGA提出七年之后,我们重新审视其在数据保护方法领域中的作用。我们的目标是明确回答以下问题:自NTGA提出以来,关于它有哪些发现?它又指出了哪些未来的研究方向?

尽管已有大量关于对抗攻击和数据投毒攻击的综述,这些可能为数据保护方法指明道路,但没有一篇综述明确讨论或评述NTGA(Fan等人,2022 (https://arxiv.org/html/2605.12792#bib.bib55);Ahmed and Kashmoola, 2021 (https://arxiv.org/html/2605.12792#bib.bib56);Wang等人,2022 (https://arxiv.org/html/2605.12792#bib.bib32);Tian等人,2022 (https://arxiv.org/html/2605.12792#bib.bib67);Long等人,2022 (https://arxiv.org/html/2605.12792#bib.bib69);Meng等人,2022 (https://arxiv.org/html/2605.12792#bib.bib68);Li等人,2025 (https://arxiv.org/html/2605.12792#bib.bib104))。虽然NTGA是一种数据保护方法,但它也可以被视为一种针对DNN的攻击。在本文中,我们提出了一个与NTGA相关的针对DNN攻击的分类体系,同时提供了每种攻击类型的基础知识。该分类体系清晰地定位了NTGA在更广泛的针对DNN攻击领域中的位置。具体来说,NTGA属于数据投毒类别下的一种泛化攻击,旨在通过破坏训练数据来降低模型性能。尽管泛化攻击已被研究多年,但在针对多样化的DNN架构时仍面临挑战。NTGA通过引入NTK理论解决了这个问题。由于其架构无关的特性,NTGA可归类为黑盒数据投毒攻击,这是一个很少被探索的领域。为了支持这一事实,我们提出了一个专注于针对DNN的黑盒攻击的单独分类体系。

在文献中,我们发现有几项研究从不同角度揭示了NTGA的基本特征,这些在Yuan & Wu(Yuan and Wu, 2021 (https://arxiv.org/html/2605.12792#bib.bib1))中并未讨论。第3节 (https://arxiv.org/html/2605.12792#S3) 就是基于这些研究组织的。我们在表1 (https://arxiv.org/html/2605.12792#S1) 中提供了该节的摘要。首先,我们探讨了NTGA与其他干净标签泛化攻击(数据保护方法)相比的性能。在介绍NTGA时,Yuan & Wu(Yuan and Wu, 2021 (https://arxiv.org/html/2605.12792#bib.bib1))仅将其攻击与DeepConfuse(Feng等人,2019 (https://arxiv.org/html/2605.12792#bib.bib11))和Return Favour Attack (RFA)(Chan-Hon-Tong, 2019 (https://arxiv.org/html/2605.12792#bib.bib13))进行了比较。提出新攻击时的标准做法是,将所提方法的有效性与现有攻击进行比较。因此,确定强攻击和弱攻击至关重要,以便研究人员能够轻松决定在实验中考虑哪些攻击。我们的论文提供了足够的事实,包括实验演示,帮助研究人员就NTGA做出决定。接下来,我们分析了NTGA在对抗其挑战、对抗训练和数据增强方面的现状。除了分析现有研究,我们还提供了自己的实验证据,以解释我们在表1 (https://arxiv.org/html/2605.12792#S1) 中提到的见解和结论。之后,我们探讨了NTGA和其他数据保护方法的线性可分性,以及它如何影响它们的鲁棒性。我们提供的实验结果表明,授权用户可以根据数据的线性可分性来确定数据是否被扰动。此外,我们还研究了其他使用神经正切核(NTK)的攻击(Jacot等人,2018 (https://arxiv.org/html/2605.12792#bib.bib2)),NTK是NTGA的构建模块,并确定了它们与NTGA的相似之处。

在评估NTGA的当前状态后,我们通过明确陈述该攻击的优缺点来总结我们的发现。这些结论为研究人员在使用NTGA方面做出决策提供了见解。然后,我们提出了关于NTGA的可以用于进一步研究的新见解和视角。新的研究方向包括分析NTGA与其他攻击的可迁移性、将NTGA应用于真实世界数据、研究NTGA在分布式机器学习算法和无监督机器学习算法上的性能,以及将NTGA扩展到其他数据类型。

参见图注 图1.针对DNN的攻击可以使用多个标准进行分类。我们考虑与NTGA也相关的三个主要标准。此分类说明了NTGA属于干净标签黑盒泛化攻击这一事实。

本文的贡献可总结如下:
- • 我们明确了NTGA在针对DNN的广泛攻击领域中的位置。此外,我们描绘了NTGA在针对DNN的更大攻击领域中的作用。此外,我们提出了一个针对DNN的黑盒攻击分类体系,以突出NTGA在现有方法中的重要性。
- • 我们对NTGA的当前状态进行了全面分析,并指出了Yuan & Wu(Yuan and Wu, 2021 (https://arxiv.org/html/2605.12792#bib.bib1))中未涉及的空白。我们的分析显示,最近提出的几种数据保护方法优于NTGA。通过实验,我们揭示了NTGA易受对抗训练和数据增强影响的特点,并探讨了解决这些局限性的策略。我们还揭示了由NTGA及相关攻击扰动的图像的线性可分性增加了它们对其他威胁的敏感性。
- • 基于我们研究中发现的NTGA的挑战和关键特征,我们提出了几个未来NTGA研究的潜在方向。

## 2. 背景

我们首先讨论针对DNN的攻击分类。然后,本文将重点讨论干净标签泛化攻击。除了NTGA,我们还考虑其他几种干净标签泛化攻击。此外,我们研究针对DNN的黑盒攻击,因为NTGA在黑盒攻击的背景下扮演着至关重要的角色。此外,我们将讨论扩展到对抗训练,这是抵御盛行攻击的最强大的防御手段之一。

### 2.1. 针对深度神经网络(DNN)的攻击

针对DNN的攻击可以通过不同方式进行分类。图1 (https://arxiv.org/html/2605.12792#S1.F1) 展示了专注于数据保护方法的这些攻击的一种特定分类,其中DNN攻击的主要分类标准之一是根据其发生的时间。基于该标准,这些攻击被分为两类:数据投毒攻击和对抗攻击。

数据投毒攻击:发生在模型训练期间。数据投毒攻击操纵训练数据,使得模型在干净的测试数据上表现不佳(Wen等人,2023 (https://arxiv.org/html/2605.12792#bib.bib87))。这些攻击破坏DNN,使其无法用于泛化目的。迄今为止,已经引入了各种数据投毒攻击,例如误差最小化攻击、误差最大化攻击、NTGA等(Fowl等人,2021 (https://arxiv.org/html/2605.12792#bib.bib10))(Feng等人,2019 (https://arxiv.org/html/2605.12792#bib.bib11))(Huang等人,2021 (https://arxiv.org/html/2605.12792#bib.bib12))(Wang等人,2021 (https://arxiv.org/html/2605.12792#bib.bib31))(Wu等人,2022 (https://arxiv.org/html/2605.12792#bib.bib47))。数据投毒攻击也被称为因果攻击(Machado等人,2020 (https://arxiv.org/html/2605.12792#bib.bib16))(Biggio等人,2012 (https://arxiv.org/html/2605.12792#bib.bib9))。我们可以进一步将数据投毒攻击分为两大类:泛化攻击和完整性攻击。泛化攻击也称为可用性攻击(Zhao and Lao, 2022 (https://arxiv.org/html/2605.12792#bib.bib48)),其主要目标是降低模型的整体准确率,包括验证准确率和测试准确率。另一方面,完整性攻击导致模型在干净测试集中对特定图像进行错误分类,并降低模型的测试准确率。Poison Frogs(Shafahi等人,2018 (https://arxiv.org/html/2605.12792#bib.bib41))是主要的完整性攻击之一(Huang等人,2020 (https://arxiv.org/html/2605.12792#bib.bib22))(Zhu等人,2019 (https://arxiv.org/html/2605.12792#bib.bib40))。与泛化攻击不同,完整性攻击不会降低验证准确率。

对抗攻击:数据投毒攻击在训练时损害模型,而对抗攻击发生在测试时。攻击者向测试数据添加人眼无法察觉的扰动,使得预训练模型在测试时以高置信度对它们进行错误分类(Szegedy等人,2014 (https://arxiv.org/html/2605.12792#bib.bib8))(Goodfellow等人,2015 (https://arxiv.org/html/2605.12792#bib.bib58))。对抗攻击也被称为规避攻击(Machado等人,2020 (https://arxiv.org/html/2605.12792#bib.bib16))。流行的对抗攻击包括投影梯度下降(PGD)攻击(Madry等人,2017 (https://arxiv.org/html/2605.12792#bib.bib15))、快速梯度符号法(FGSM)攻击(Huang等人,2017 (https://arxiv.org/html/2605.12792#bib.bib25))、DeepFool攻击(Moosavi-Dezfooli等人,2016 (https://arxiv.org/html/2605.12792#bib.bib60))以及Carlini和Wagner的攻击(C&W)(Carlini and Wagner, 2017 (https://arxiv.org/html/2605.12792#bib.bib26))。根据定义,对抗攻击是一个映射 α: R^n → R^n,使得对抗样本 α(x)=x' 被模型 f 错误分类为其原始类别 y 以外的类别。x' 与 x 之间的差异很小,即对于某个小值 ε,有 ||x - x'||_p ≤ ε(Lin等人,2021 (https://arxiv.org/html/2605.12792#bib.bib66))。为了更好地理解对抗攻击,我们以FGSM(Huang等人,2017 (https://arxiv.org/html/2605.12792#bib.bib25))攻击为例,其中对抗样本 x' 通过求解以下优化问题生成:max_{x'} L(f(x', y)) 满足 (1) ||x - x'||_∞ ≤ ε,其中 x' 是通过最大化 DNN 模型 f 的损失函数生成的。同时,攻击者试图最小化对抗样本与原始数据之间的不相似性。因此,即使 x' 看起来像 x,一个训练好的模型也会将其错误分类,而人类可以正确地将它分类为类别 y。

此外,我们可以根据攻击者是否操纵输入的目标准标签来对针对DNN的攻击进行分类。如果攻击者在构建攻击时改变了目标准标签,我们称之为脏标签攻击。另一方面,如果攻击者不影响输入的标签,这些攻击被称为干净标签攻击。根据攻击者对目标模型的了解程度,攻击还可以分为三类。(1)在黑盒攻击中,攻击者对目标模型没有任何信息。(2)如果攻击者对模型有部分了解,但不是确切的信息(如权重),这些攻击称为灰盒攻击。(3)当攻击者完全了解目标模型时,发生白盒攻击。然而,针对DNN的攻击分类并不仅限于图1 (https://arxiv.org/html/2605.12792#S1.F1) 中的这三个标准(Vorobeychik and Kantarcioglu, 2018 (https://arxiv.org/html/2605.12792#bib.bib17))(Wang等人,2022 (https://arxiv.org/html/2605.12792#bib.bib32))。本文只关注与NTGA相关的这三个标准。如图1 (https://arxiv.org/html/2605.12792#S1.F1) 所示,NTGA可以被归类为干净标签的黑盒泛化攻击。接下来,我们将深入探讨干净标签泛化攻击。附录表6.1 (https://arxiv.org/html/2605.12792#S6.SS1) 中的符号有助于理解后续章节。

令训练集表示为 X^D,训练集的目标标签由 Y^D 给出。验证集表示为 X^V,验证集的标签由 Y^V 给出。给予 X^D 的扰动集表示为 δ。扰动受 L_p 范数约束,即 ||δ||_p ≤ ε。注意 f 表示目标模型,θ 表示模型参数集。L 表示模型的损失函数。

###### 定义 2.0 (干净标签泛化攻击)。干净标签泛化攻击通过求解以下双层优化问题来构建(Yuan and Wu, 2021 (https://arxiv.org/html/2605.12792#bib.bib1))(Segura等人,2022 (https://arxiv.org/html/2605.12792#bib.bib7))(Chan-Hon-Tong, 2019 (https://arxiv.org/html/2605.12792#bib.bib13)):
满足 (2) θ* = arg min_θ [ L( f( X^D + δ; θ ), Y^D )]

正如我们之前解释的,泛化攻击不仅在测试数据集上表现不佳,在验证集上也一样。F

相似文章

内核重启:突破神经场中神经切向核的边界

arXiv cs.LG

本文开发了NTK-KIP、MetaQuill和MetaQuill-KIP算法,以改善从稀疏观测中重建神经场,使基于神经切向核(NTK)的神经场变得非线性和元可学习,从而实现高效的少样本适应。

分叉附近的状态空间NTK坍缩

arXiv cs.LG

本文发展了动力模型分叉附近梯度下降的局部理论,表明状态空间神经正切核坍缩为秩一算子,主导学习动力学,使优化有效低维且可从规范形式预测。

与大型语言模型无关的语义表示攻击

arXiv cs.CL

本文介绍了语义表示攻击(SRA),这是一种新颖的与大型语言模型无关的方法,它针对恶意语义表示而非确切文本进行优化,在多个开源模型中实现了高攻击成功率。