基于差分隐私原始-对偶视角的可证明后门攻击鲁棒性
摘要
本文介绍了一个框架,通过隐私配置文件将随机平滑与差分隐私联系起来,从而能够针对同时影响训练和推理的后门攻击提供严格的可证明鲁棒性保证。该框架在DP-SGD和深度分区聚合上实例化,并在MNIST和CIFAR-10上进行了实验。
arXiv:2605.21780v1 Announce Type: new
Abstract: 随机平滑是一种强大的工具,用于证明对对抗性扰动的鲁棒性,包括通过随机训练实现的投毒攻击和通过随机推理实现的逃避攻击。然而,将这些保证扩展到后门攻击(即训练数据和测试数据同时受到扰动)仍然具有挑战性,因为训练时和测试时的随机机制必须在同一个鲁棒性证书内进行分析。我们通过将随机平滑与差分隐私的对偶视图(通过隐私配置文件)联系起来,解决了这一问题,隐私配置文件提供了一种用于组合异构机制的数值程序。所得框架能够对复杂的、组合的机制进行严格的、模块化的端到端认证,同时利用现有的差分隐私机制分析。我们将该框架实例化到DP-SGD和带有推理时平滑的深度分区聚合,推导出针对训练时和推理时攻击的联合鲁棒性保证。在MNIST和CIFAR-10上的实验证明了我们框架的有效性。总体而言,我们提供了一个有原则且通用的框架,用于使用组合机制在更复杂的威胁模型下认证鲁棒性,从而更好地捕捉真实世界攻击者的能力。
查看缓存全文
缓存时间: 2026/05/22 08:52
# 通过差分隐私的原-偶视角实现可证明的后门攻击鲁棒性
来源:https://arxiv.org/html/2605.21780
Aman Saxena¹,²,³, Jan Schuchardt⁴, Yan Scholten¹,²,³, Stephan Günnemann¹,²,³
{a.saxena, y.scholten, s.guennemann}@tum.de, [email protected]
¹ 慕尼黑工业大学计算机科学系
² 慕尼黑数据科学研究所
³ MCML
⁴ 摩根士丹利机器学习研究
###### 摘要
随机平滑是一种强大的工具,可用于认证对对抗性扰动的鲁棒性,包括通过随机化训练实现的投毒攻击和通过随机化推理实现的规避攻击。将这些保证扩展到后门攻击(即训练和测试数据同时被扰动)仍然具有挑战性,因为训练和测试阶段的随机化机制必须在一个鲁棒性证书内共同分析。我们通过将随机平滑与差分隐私的偶视角(通过隐私配置文件)联系起来,从而解决了这一问题。隐私配置文件提供了一种用于组合异构机制的数值方法。由此产生的框架能够在利用现有差分隐私机制分析的同时,对复杂组合机制进行紧致、模块化、端到端的认证。我们将该框架实例化用于DP-SGD和深度分区聚合(结合推理时平滑),从而推导出针对训练时和推理时攻击的联合鲁棒性保证。在MNIST和CIFAR-10上的实验证明了我们框架的有效性。总体而言,我们提供了一个原则性的通用框架,通过组合机制在复杂威胁模型(更好地捕捉真实世界对手的能力)下认证鲁棒性。
## 1 引言
机器学习系统上的对抗性攻击仍然是一个主要问题,尤其是在大型模型(如大型语言模型)快速部署的背景下[64,63,22]。这些攻击不仅包括测试时的规避攻击,还扩展到数据投毒和后门攻击,其中对手操纵训练数据以降低性能或在推理时诱导隐藏行为,这使得在这种联合威胁场景下的鲁棒性保证尤其具有挑战性。虽然正式验证神经网络鲁棒性仍然困难,但随机平滑已成为认证推理时攻击鲁棒性的一种强大方法,并已成功应用于多个领域,包括图像分类、离散数据(如图)以及量子分类器。然而,将RS扩展到认证联合训练和推理时攻击的鲁棒性仍然未被充分探索,现有方法仅限于特定的威胁模型和离散特征设置。
为了认证对推理时攻击的鲁棒性,RS从一个扰动输入的分布中采样,并限制对抗性扰动如何影响由此产生的预测分布。将训练视为从数据集到测试时预测的映射,同样的思想也适用于投毒鲁棒性,通过考虑训练算法或数据的扰动所诱导的分布。这一视角暗示了可能扩展到训练和测试数据的联合扰动,但目前尚不清楚如何组合训练时和推理时随机化的保证。
图1:我们的框架和新视角概述:训练和分类流水线可以被视为随机化机制的组合,每种机制都有其自身的隐私保证。通过利用f-DP与隐私配置文件之间的原-偶等价性,我们可以高效地组合这些保证,以推导针对后门攻击的端到端鲁棒性证书。
组合性是差分隐私的核心,已有工作利用f-DP的形式框架来紧致组合特定随机平滑机制(如高斯噪声)的对抗鲁棒性保证。然而,虽然f-DP提供了组合的理论紧致刻画,但它并未给出任意机制组合的可行程序,且可行分析仍局限于同质设置。相比之下,其他工作将易于组合的DP概念(如ADP和RDP)与随机平滑联系起来,从而实现了可行的组合,但保证弱于f-DP。这引发了一个核心问题:*我们如何能够可行地组合任意机制,同时保持与随机平滑的紧致联系,以认证针对后门攻击等复杂威胁模型的鲁棒性?*
在本文中,我们通过将随机平滑与差分隐私的偶视角(即隐私配置文件)联系起来来回答这个问题。我们通过利用和扩展f-DP与隐私配置文件之间的原-偶等价性,推导出随机平滑的这种偶形式。这使我们能够利用机器学习中常用差分隐私机制的紧致分析的大量文献,结合数值组合技术,从而将f-DP与RS之间的联系操作化。
**贡献**
我们引入了一个通用的可证明鲁棒性框架,支持由简单机制组成的随机平滑分类器的模块化设计。我们在图1中概述了我们的框架。我们的方法在给定威胁模型下追踪各个组件的隐私,并通过随机平滑的偶形式组合这些保证以推导鲁棒性证书。该框架直接支持在联合威胁模型下评估后门鲁棒性。我们在MNIST和CIFAR-10上展示了推理时高斯噪声与训练时随机化(包括深度分区聚合和DP-SGD)组合的可认证后门鲁棒性。这种模块化还使我们能够单独分析复杂的训练机制。特别地,我们针对训练数据的添加和移除为DP-SGD推导了可证明紧致的随机平滑保证,并在实验中展示了相对于Liu等人的改进。
## 2 相关工作
#### 针对后门攻击的认证
随机平滑已成为针对规避攻击的可认证鲁棒性的标准工具。在此基础上,多项工作探索了使用RS进行联合认证。其他工作采用的后门鲁棒性概念并未捕捉训练时和推理时联合扰动。此外,有工作提出了一种专门针对语言任务的基于RS的方法,而Lorenz等人则依赖于应用于展开训练过程的边界传播技术。总体而言,这些方法仅限于简单的训练过程、特定的模型类别或任务,以及易于分析和组合的狭义的威胁模型。相比之下,我们开发了一个通用框架,能够利用差分隐私的工具来分析并组合更一般的随机化机制。因此,随机平滑可以应用于广泛威胁模型下的通用训练和推理过程。
**(无DP的)针对投毒攻击的认证**
除了联合认证,大量工作单独研究投毒鲁棒性。大多数基于RS的投毒认证方法依赖于聚合技术,通常是DPA的变体。另一条工作线使用带有任务特定平滑机制的随机平滑来应对标签翻转攻击。虽然这些方法在特定设置下有效,但它们与特定的随机化训练机制紧密耦合,因此局限于特定的威胁模型。相比之下,我们的框架支持广泛的随机化训练过程,这些过程在给定威胁模型下允许隐私配置文件刻画,并支持其原则性组合。
**(带DP的)针对投毒攻击的认证**
多项工作利用了差分隐私与鲁棒性认证之间的联系。Duet等人使用差分隐私进行对抗检测。这一联系也在规避鲁棒性的背景中被类似研究。现有方法依赖于通过ADP或Rényi差分隐私对差分隐私进行粗略刻画,导致鲁棒性界次优。相比之下,我们的工作使用基于隐私配置文件的差分隐私公式,该公式等价于随机平滑所依赖的假设检验公式。
**鲁棒性与差分隐私**
自适应随机平滑将f-DP与鲁棒性认证联系起来。然而,这一视角并未提供显式的组合规则,除了对基本机制(如添加高斯和拉普拉斯噪声)的同质组合。我们利用DP的原-偶视角将随机平滑的f-DP解释转化为偶形式(隐私配置文件)。这使得随机化机制的可组合性成为可能,并允许鲁棒性认证直接利用DP文献中的隐私分析,例如子采样高斯机制的紧致保证。隐私配置文件作为鲁棒性的最优刻画的视角在先前工作中已有隐含体现,这些工作推导了用于规避认证的RS保证,其形式类似于我们的偶到原转换。然而,这些工作并未建立与差分隐私的任何联系,因此无法利用DP文献中的现有工具和分析。本文扩展了Dissertation中提出的隐私核算的使用。
## 3 背景与预备知识
**联合训练-推理过程**
设每个训练/测试样本x来自空间X,相应的标签y来自集合Y:={1,...,C}。我们将分类器表示为函数f:X→Y,并记所有此类分类器的空间为Y^X。对于i∈N,集合T_i:=(X×Y)^i表示大小为i的训练数据集空间。训练算法A将任意大小的训练数据集映射到分类器,即A:∪_{i=1}^∞ T_i → Y^X。最后,联合训练和推理过程是一个函数J:∪_{i=1}^∞ T_i × X ↦ Y,它接收训练数据集X_train,生成分类器f=A(X_train),并输出对测试输入x_test∈X的预测,即J:(X_train, x_test) ↦ A(X_train)(x_test)。
**后门威胁模型**
设输入空间X配备距离d_input,训练数据集空间∪_{i=1}^∞ T_i配备距离d_train。后门鲁棒性要求对训练数据和测试输入的小扰动不会改变联合训练-推理过程的预测。具体地,对于(X_train, x_test)以及所有满足d_train(X'_train, X_train) ≤ R且d_input(x'_test, x_test) ≤ ρ的(X'_train, x'_test)相似文章
用于差分隐私的快速混合机制
本文介绍了一种基于快速变换的新型差分隐私草图机制,该机制实现了最先进的隐私保证并改善了运行时间,并将其应用于DP线性回归,从而获得了首个用于DP普通最小二乘法的快速方法。
从隐私到泛化:DP-SGD的线性最大信息界
本文证明了DP-SGD近似最大信息的一个有限样本界,该界最多与数据集大小成线性关系,从而为差分隐私训练的模型带来了PAC-Bayes泛化界。
差分隐私自然梯度下降
本文介绍了DP-NGD,一个实用框架,通过将曲率估计与私有数据解耦,并协调各向同性DP约束与各向异性二阶优化,将自然梯度下降与差分隐私相结合,在相同隐私预算下实现了最先进的准确率和高达10倍的收敛速度提升。
StraightDP:面向修正流Transformer的几何感知差分隐私
本文介绍了StraightDP,一个面向文本条件修正流Transformer的几何感知差分隐私框架。它将隐私预算进行划分,用于发布类条件矩并使用DP-SGD,在强隐私水平下相较于统一DP训练提高了准确率和FID。
揭示拜占庭鲁棒性下隐私对泛化的非单调影响
本文揭示了在拜占庭鲁棒分布式学习中隐私对泛化误差的非单调影响:在高噪声(强隐私)区域,增加隐私会降低泛化误差;而在低噪声(弱隐私)区域,增加隐私则会恶化泛化效果。