USAD: 不确定性感知统计对抗检测

arXiv cs.LG 论文

摘要

USAD提出了两种新的统计量:方差差异(Variance Discrepancy)和基于扰动的协方差差异(Perturbation-based Covariance Discrepancy),用于捕捉对抗样本的全局和局部不确定性模式,相较于基线方法实现了更优越的检测性能。

arXiv:2606.27832v1 公告类型:新 摘要:统计对抗检测(SAD)将检测视为一个双样本检验。给定一个干净样本(CE)的参考集和一批可能包含未知混合CE和对抗样本(AE)的查询,SAD在控制虚警率的同时判断查询分布是否偏离了CE分布。现有基于SAD的方法主要使用最大均值差异(MMD)来衡量分布差异。然而,MMD的分布特性限制了其捕捉对抗样本关键不确定性模式的能力:对抗样本通常表现出异常的特征扩散(即全局不确定性)和在扰动下的不稳定性(即局部不确定性)。为弥补这一不足,我们提出了不确定性感知统计对抗检测(USAD),通过两种新的统计量显式捕捉这些不确定性模式:(1)方差差异(VD),衡量AE与CE之间特征扩散的差异,以捕捉全局不确定性差异。(2)基于扰动的协方差差异(PCD),比较高斯扰动下的特征协方差,以捕捉局部不确定性差异。通过聚合VD和PCD,USAD在对抗各种对抗攻击时相较于基线方法取得了更优越的检测性能,凸显了考虑对抗样本特征行为对于有效SAD的重要性。我们的代码可在以下链接获取:https://anonymous.4open.science/r/USAD。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:26

# 1 引言 来源:https://arxiv.org/html/2606.27832 marginparsep 已被更改。topmargin 已被更改。marginparpush 已被更改。页面布局违反了 ICML 样式。请不要更改页面布局,或引入诸如 geometry、savetrees 或 fullpage 之类的包,这些包会为您更改它。我们无法可靠地撤消对样式的任意更改。请删除违规的包或更改布局的命令,然后重试。USAD:不确定性感知的统计对抗检测

周志坚*1 田迅野*1 张嘉程*1 叶泽盛1 郭仪仪1 张东浩1 彭柳华1 刘峰1††脚注文本:*同等贡献1墨尔本大学。通信作者:刘峰,叶泽盛。ICML 2026 假设检验研讨会,韩国首尔,2026。版权所有 2026 作者。

###### 摘要
*统计对抗检测*(SAD)将检测视为一个双样本检验。给定一个干净样本(CE)的参考集和一个查询批次(可能包含干净样本和对抗样本(AE)的未知混合),SAD 决定查询分布是否偏离干净样本分布,同时控制误报率。现有的基于 SAD 的方法主要使用*最大均值差异*(MMD)来衡量分布差异。然而,MMD 的分布特性限制了其捕捉对检测至关重要的 AE 特征不确定性模式的能力:AE 通常表现出异常的特征扩散(即全局不确定性)和在扰动下的不稳定性(即局部不确定性)。为了弥补这一差距,我们提出了*不确定性感知的统计对抗检测*(USAD),它通过两个新的统计量显式地捕捉这些不确定性模式:(1)方差差异(VD),它衡量 AE 和 CE 之间特征扩散的差异,以捕捉全局不确定性差异;(2)基于扰动的协方差差异(PCD),它比较高斯扰动下的特征协方差,以捕捉局部不确定性差异。通过聚合 VD 和 PCD,USAD 在针对各种对抗攻击时,其检测性能优于基线方法,这突显了在有效 SAD 中考虑 AE 特征行为的重要性。我们的代码可在以下网址获取:https://github.com/tmlr-group/USAD。

防御对抗样本(AE)仍然是深度学习中的一个长期挑战(Szegedy 等人,2014 (https://arxiv.org/html/2606.27832#bib.bib49);Goodfellow 等人,2015 (https://arxiv.org/html/2606.27832#bib.bib18);Madry 等人,2018 (https://arxiv.org/html/2606.27832#bib.bib38);Carlini & Wagner,2017b (https://arxiv.org/html/2606.27832#bib.bib6);Zhang 等人,2019 (https://arxiv.org/html/2606.27832#bib.bib54);Croce & Hein,2020b (https://arxiv.org/html/2606.27832#bib.bib11);Gao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib17);Cao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib4);Jing 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib29);Zhang 等人,2024 (https://arxiv.org/html/2606.27832#bib.bib55);Sun 等人,2025 (https://arxiv.org/html/2606.27832#bib.bib48);Han 等人,2025 (https://arxiv.org/html/2606.27832#bib.bib21))。对抗攻击最轻量级的防御是对抗检测,它在输入数据到达目标系统之前识别出其中的对抗样本(Ma 等人,2018 (https://arxiv.org/html/2606.27832#bib.bib37);Deng 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib13);Zhang 等人,2023 (https://arxiv.org/html/2606.27832#bib.bib57);Gao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib17))。现有方法通常将对抗检测视为二分类任务(Ma 等人,2018 (https://arxiv.org/html/2606.27832#bib.bib37);Deng 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib13);Zhang 等人,2023 (https://arxiv.org/html/2606.27832#bib.bib57))。它们通常训练一个针对特定分类器或攻击类型的二值检测器,这限制了对未知攻击的有效性(Tramèr,2022 (https://arxiv.org/html/2606.27832#bib.bib50);Bryniarski 等人,2022 (https://arxiv.org/html/2606.27832#bib.bib3))。尽管有一项研究利用扩散模型(Song & Ermon,2019 (https://arxiv.org/html/2606.27832#bib.bib46);Song 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib47);Huang 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib27)) 来消除这种依赖性(Zhang 等人,2023 (https://arxiv.org/html/2606.27832#bib.bib57)),但它容易受到基于扩散的自适应攻击(Xue 等人,2023 (https://arxiv.org/html/2606.27832#bib.bib52);Kang 等人,2023 (https://arxiv.org/html/2606.27832#bib.bib30))。这些局限性促使我们追求一个模型和攻击无关的检测框架。

*统计对抗检测*(SAD)提供了一个互补的方向,它将对抗检测表述为一个双样本假设检验:给定一个干净样本的参考池和一个查询集,SAD 询问查询分布是否已经偏离了干净分布(参见第 2.1 节 (https://arxiv.org/html/2606.27832#S2.SS1) 的正式设置)。具体来说,防御者需要维护一个干净样本的参考集 \(X\),并且对于传入查询的一个窗口 \(Y\),计算一个检验统计量 \(\mathcal{T}(X,Y)\) 来衡量它们的分布差异(Gao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib17))。然后置换检验确定一个阈值 \(t_\alpha\),使得 \(\Pr(\mathcal{T}(X,Y) > t_\alpha | Y \text{ 是干净的}) \leq \alpha\),从而提供统计上控制的第一类错误保证,这在高风险场景中通常是期望的。在操作上,这相当于维护一个最近查询的队列,并在窗口累积时运行检验,或者以滑动窗口方式在流上运行;每个这样的窗口可能包含对抗样本和干净样本的未知混合(Zhang 等人,2025 (https://arxiv.org/html/2606.27832#bib.bib56))。这样,SAD 作为一个统计监控层:一旦某个查询集被标记为可疑,防御系统可以触发其他防御措施或将流量路由至人工审查,同时将虚假告警率保持在控制之下(Gao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib17))。关于 SAD 实用性的进一步讨论,请参见附录 A (https://arxiv.org/html/2606.27832#A1)。

参照图注 (a) 不同对抗样本批量大小下 MMD 值的分布。(b) 干净样本和对抗样本批次的 MMD-方差关系。
图 1:使用语义特征的基于 MMD 的 SAD 的统计特性(Gao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib17))。(a):三种对抗样本批量大小 (\(n=\{20,50,100\}\)) 下 MMD 值的核密度估计。垂直虚线表示检验阈值。阈值右侧的阴影区域表示检测功率,其百分比显示在图例中 (\(n=100\) 时为 91.43%,\(n=50\) 时为 78.21%,\(n=20\) 时为 59.30%)。这清楚地表明,随着批量大小的减小,基于 MMD 的 SAD 的检测功率下降。(b):MMD 对对抗样本(红色叉号)和干净样本(蓝色圆圈)之间不确定性差异的敏感性,以及它们在 x 轴和 y 轴上的投影以作比较。尽管对抗样本的方差明显更高且与干净样本清晰分离,但 MMD 值在 y 轴上表现出大量重叠,表明基于 MMD 的 SAD 对方差差异不敏感。

当前的 SAD 主要使用*最大均值差异* (MMD) (Gretton 等人,2012 (https://arxiv.org/html/2606.27832#bib.bib19)) 作为检验统计量 \(\mathcal{T}(X,Y)\) (Gao 等人,2021 (https://arxiv.org/html/2606.27832#bib.bib17);Zhang 等人,2025 (https://arxiv.org/html/2606.27832#bib.bib56))。它们已经显示出对抗未知甚至自适应攻击的强大性能,同时继承了严格的误报控制。然而,现有的基于 MMD 的 SAD 方法是*样本低效率*的:它们通常需要足够大样本量(以及非平凡对抗样本比例)的查询窗口,以便检验统计量能够以高检验功率可靠地识别分布差异。如图 1(a) (https://arxiv.org/html/2606.27832#S1.F1.sf1) 所示,我们证实基于 MMD 的 SAD 的检验功率随着查询窗口大小的缩小而迅速下降。这限制了实际部署,因为等待大型查询集通常不现实,并且攻击量本身是不可控的。为了理解这一局限性,我们检查了检验统计量捕捉了哪些分布属性。由于 MMD 捕捉的是均值嵌入偏移(见等式 (2.1) (https://arxiv.org/html/2606.27832#S2.Ex1)),我们假设它对几何属性不敏感,例如区分对抗样本与干净样本的特征扩散(Ma 等人,2018 (https://arxiv.org/html/2606.27832#bib.bib37)) 和局部不稳定性(Li 等人,2019 (https://arxiv.org/html/2606.27832#bib.bib35))。这些几何线索与*不确定性*密切相关:对抗样本通常位于决策边界附近,并表现出比干净样本更高的特征方差和预测不确定性(Feinman 等人,2017 (https://arxiv.org/html/2606.27832#bib.bib16))。为了验证这一假设,我们测试 MMD 是否捕捉到对抗样本与干净样本之间的不确定性差异,使用*方差*作为不确定性度量。如图 1(b) (https://arxiv.org/html/2606.27832#S1.F1.sf2) 所示,尽管存在显著的方差差异,干净样本和对抗样本的 MMD 值大部分重叠,表明 MMD 对这种不确定性度量不敏感。这一发现揭示了一个根本性错配:*MMD 并非为 SAD 量身定制,因此,当对抗样本显示其特征性不确定性模式(而非均值嵌入偏移)时,基于 MMD 的 SAD 方法无法区分对抗样本与干净样本。* 这激发了直接对对抗样本不确定性模式敏感的新*检验统计量*。

为了弥补这一差距,本文提出了*不确定性感知的统计对抗检测* (USAD),它显式地考虑了两种已被证实的不确定性引发模式,即 (1) 对抗样本偏离干净数据流形,导致其语义特征分布出现异常扩散(Feinman 等人,2017 (https://arxiv.org/html/2606.27832#bib.bib16);Ma 等人,2018 (https://arxiv.org/html/2606.27832#bib.bib37))(即*全局不确定性*),以及 (2) 范数约束的对抗样本是通过跨越局部决策边界的小扰动生成的(Moosavi-Dezfooli 等人,2016 (https://arxiv.org/html/2606.27832#bib.bib39);Fawzi 等人,2016 (https://arxiv.org/html/2606.27832#bib.bib15)),并且常常利用脆弱的非鲁棒特征(Ilyas 等人,2019 (https://arxiv.org/html/2606.27832#bib.bib28)),导致在添加扰动下出现非典型的局部响应模式(Huang 等人,2019 (https://arxiv.org/html/2606.27832#bib.bib26);Roth 等人,2019 (https://arxiv.org/html/2606.27832#bib.bib43))(即*局部不确定性*),为此设计了两个新的检验统计量:(1) *方差差异* (VD),它衡量对抗样本与干净样本之间特征扩散的差异(见第 3.1 节 (https://arxiv.org/html/2606.27832#S3.SS1)),以及 (2) *基于扰动的协方差差异* (PCD),它比较高斯扰动下的特征协方差以捕捉局部稳定性差异(见第 3.2 节 (https://arxiv.org/html/2606.27832#S3.SS2))。VD 旨在捕捉由流形位移引起的*全局不确定性差异*,而 PCD 旨在捕捉由扰动敏感性引发的*局部不确定性差异*。为了同时捕捉全局和局部不确定性差异,我们遵循 Zhou 等人 (2025 (https://arxiv.org/html/2606.27832#bib.bib60)) 的方法,聚合 VD 和 PCD,同时考虑它们之间的相互依赖性(见第 4 节 (https://arxiv.org/html/2606.27832#S4))。USAD 的误报率在理论上得到控制(见第 5 节 (https://arxiv.org/html/2606.27832#S5))。第 6 节 (https://arxiv.org/html/2606.27832#S6) 在基准图像数据集(如 CIFAR-10 (Krizhevsky 等人,2009 (https://arxiv.org/html/2606.27832#bib.bib33)) 和 ImageNet-1K (Deng 等人,2009 (https://arxiv.org/html/2606.27832#bib.bib12)))上评估了 USAD 的有效性。具体来说,USAD *持续地*在针对各种不可见对抗攻击的不同威胁模型下,包括不同范数(例如,\(l_\infty\) 和 \(l_2\))、扰动预算(例如,\(\epsilon\) 从 \(8/255\) 到 \(1/255\))、批量大小(例如,从 80 到 10)以及查询批次中对抗样本的比例(例如,从 \(100\%\) 到 \(20\%\)),以显著优势优于基线 SAD 方法。值得注意的是,即使在查询批量大小小至 \(|Y|=10\) 的情况下,我们的方法在 \(\epsilon=4/255\) 时也能达到基本等于 1 的检验功率,比基线方法高出至少 24.8%。这标志着在克服限制基于假设检验方法的检测功率的样本量限制方面迈出了实质性的一步。更重要的是,我们的方法对精心设计的自适应攻击仍然鲁棒。

我们的贡献是:(1) 我们发现基于 MMD 的 SAD 无法捕捉对于区分对抗样本与干净样本至关重要的分布不确定性差异;(2) 为了解决这个问题,我们提出了*不确定性感知的统计对抗检测* (USAD),并使用了新的检验统计量,即*方差差异* (VD) 和*基于扰动的协方差差异* (PCD),以显式捕捉对抗样本与干净样本之间的*全局*和*局部*不确定性差异;(3) 理论上,我们证明了 USAD 保证了有效的误报率控制。实验上,我们展示了 USAD 在小的查询窗口大小以及每个查询批次中对抗样本与干净样本稀疏混合的情况下,在不同的不可见攻击、迁移攻击和自适应攻击上持续优于强基线方法。

## 2 统计对抗检测
我们首先将*统计对抗检测* (SAD) 形式化为一个假设检验任务,通过测量分布差异来区分对抗样本 (AE) 和干净样本 (CE)(第 2.1 节 (https://arxiv.org/html/2606.27832#S2.SS1))。然后我们指出现有 SAD 实践的局限性,并激发对新度量的需求(第 2.2 节 (https://arxiv.org/html/2606.27832#S2.SS2))。

### 2.1 从统计角度检测对抗样本
**对抗攻击。** 生成对抗样本的算法通常被称为对抗攻击(Szegedy 等人,2014 (https://arxiv.org/html/2606.27832#bib.bib49);Goodfellow 等人,2015 (https://arxiv.org/html/2606.27832#bib.bib18))。给定一个在数据集 \(D=\{(x_i, c_i)\}_{i=1}^N\)(其中 \(x_i\) 是来自输入空间 \(\mathcal{X} \subseteq \mathbb{R}^d\) 的样本,\(c_i\) 是其定义在标签空间 \(\mathcal{C}\) 中的真实标签)上训练良好的分类器 \(f: \mathcal{X} \to \mathcal{C}\),关于 \(x_i\) 且带有扰动 \(\zeta_i\) 的对抗样本 \(y_i\) 可以通过求解以下优化问题生成:
\[ y_i = x_i + \operatorname{argmax}_{\zeta_i} \mathcal{L}(f(x_i + \zeta_i), c_i), \quad \text{s.t. } \|\zeta_i\|_p \leq \epsilon, \tag{1} \]
其中 \(\epsilon\) 是扰动预算,\(\|\cdot\|_p\) 是 \(l_p\) 范数(例如,\(l_\infty\) 或 \(l_2\)),\(\mathcal{L}\) 是目标函数。等式 (1) (https://arxiv.org/html/2606.27832#S2.E1) 可以通过多种方法求解以生成对抗样本。例如,*快速梯度符号方法* (FGSM) 是一种单步攻击,它沿着损失梯度的方向扰动干净数据。

相似文章

使用分布对齐对抗性蒸馏估计黑盒LLM的不确定性

arXiv cs.CL

本文提出了一种分布对齐对抗性蒸馏(DisAAD)方法,该方法使用一个轻量级代理模型,仅以原始模型1%的规模来估计黑盒大语言模型的不确定性,实现了无需内部参数或多次采样的可靠量化。

测试对未知对手的鲁棒性

OpenAI Blog

# 测试对未知对手的鲁棒性 来源:[https://openai.com/index/testing-robustness/](https://openai.com/index/testing-robustness/) OpenAI 我们开发了一种方法来评估神经网络分类器是否能可靠地抵御训练期间未见过的对抗性攻击。我们的方法产生了一个新的指标 UAR(未知攻击鲁棒性),它评估单个模型对意外攻击的鲁棒性,并强调了需要在更多样化的未知攻击范围内测量性能

ADS-C:面向分类的反蒸馏采样方法

arXiv cs.LG

本文提出ADS-C,一种面向分类任务的反蒸馏防御方法。它可在证明保留top-1精度的同时,将学生模型性能降低高达29.7个百分点,且对教师模型实现零效用成本。

面向自然语言理解任务的混合对抗防御框架

arXiv cs.CL

来自南安普顿大学和曼彻斯特大学的研究人员提出了一种面向大语言模型的混合对抗防御框架,该框架将基于熵、基于不确定性和基于几何的模型相结合,旨在同时应对自然语言理解任务中的幻觉问题和对抗性攻击漏洞,最终实现了高达 64.92% 的对抗鲁棒性提升和 62.27% 的攻击成功率降低。