测试对未知对手的鲁棒性
摘要
# 测试对未知对手的鲁棒性 来源:[https://openai.com/index/testing-robustness/](https://openai.com/index/testing-robustness/) OpenAI 我们开发了一种方法来评估神经网络分类器是否能可靠地抵御训练期间未见过的对抗性攻击。我们的方法产生了一个新的指标 UAR(未知攻击鲁棒性),它评估单个模型对意外攻击的鲁棒性,并强调了需要在更多样化的未知攻击范围内测量性能
我们开发了一种方法来评估神经网络分类器是否能可靠地抵御训练期间未见过的对抗性攻击。我们的方法产生了一个新的指标 UAR(未知攻击鲁棒性),它评估单个模型对意外攻击的鲁棒性,并强调了需要在更多样化的未知攻击范围内测量性能。
查看缓存全文
缓存时间:
2026/04/20 14:56
# 针对未知对手的鲁棒性测试
来源:https://openai.com/index/testing-robustness/
OpenAI
我们开发了一种方法来评估神经网络分类器是否能够可靠地防御训练中未见过的对抗攻击。我们的方法产生了一个新的指标,UAR(未知攻击鲁棒性),它评估单个模型对未预期攻击的鲁棒性,并强调需要在更加多样化的未知攻击范围内衡量性能。
现代神经网络在广泛的基准任务上取得了很高的准确率。然而,它们仍然容易受到*对抗示例*(https://openai.com/index/adversarial-example-research/)的影响,这些是由对手创建的输入的细微但精心设计的扭曲,用来欺骗网络。例如,下面的L∞扭曲对抗示例与原始图像在每个RGB像素值中最多相差32;人类仍然可以正确分类更改后的图像,但标准神经网络会自信地对其进行误分类。
由不同扭曲类型的对抗攻击生成的样本图像(黑天鹅)。每个扭曲都经过优化来欺骗网络。
显示扭曲A和扭曲B之间负迁移的图表
对抗鲁棒性不能很好迁移的一个例子。针对扭曲A加强模型最初会增加对扭曲A和B的鲁棒性。但是,随着我们进一步加强,扭曲B的对抗鲁棒性会下降,但扭曲A保持大致相同;(A = L∞, B = L1)。模型对扭曲A的准确率在加强等级8处达到峰值,因为这足以防御攻击,进一步加强会损害干净准确率;详见完整论文。
我们创建了一个三步方法来评估模型对新的未见过的扭曲类型的性能。我们的方法在各种未知攻击中评估,覆盖范围广的扭曲大小,并将结果与了解扭曲类型的强防御进行比较。它也产生了一个新的指标UAR,用来评估模型对未见过的扭曲类型的对抗鲁棒性。
关于对抗防御的典型论文仅针对广泛研究的L∞或L2扭曲类型进行评估。但是,我们表明(https://arxiv.org/abs/1908.08016)针对这些扭曲进行评估提供了非常相似的对抗鲁棒性信息。A(https://openai.com/index/testing-robustness/#citation-bottom-A)我们的结论是,针对Lp扭曲进行评估不足以预测对其他扭曲类型的对抗鲁棒性。相反,我们建议研究人员针对与训练中使用的扭曲类型不相似的对抗扭曲来评估模型。我们提供L1、L2-JPEG、Elastic和Fog攻击作为起点。我们在代码包(https://github.com/ddkang/advex-uar)中提供各种攻击的实现、预训练模型和校准。
我们发现考虑过于狭窄的扭曲大小范围可能会推翻关于对抗鲁棒性的定性结论。为了选择范围,我们检查攻击在不同扭曲大小下产生的图像,并选择图像仍然可被人类识别的最大范围。但是,如下所示,具有大扭曲预算的攻击仅针对强防御才会使用。我们建议通过针对经过对抗训练的模型进行评估来选择经过校准的扭曲大小范围(我们也在代码包(https://github.com/ddkang/advex-uar)中为多种攻击提供了经过校准的大小)。
相同强攻击应用于不同防御模型的样本图像(意式浓缩咖啡机)。攻击较强的防御会导致更大的视觉扭曲。
我们开发了一个新的指标UAR,它将模型对某个攻击的鲁棒性与针对该攻击的对抗训练进行比较。对抗训练是一种强防御,利用对手的知识,通过对经过对抗攻击的图像进行训练。B(https://openai.com/index/testing-robustness/#citation-bottom-B)接近100的UAR分数表示对未知对抗攻击的性能与具有事先了解该攻击的防御相当,这是一个具有挑战性的目标。
我们计算了几种不同扭曲类型的对抗训练模型的UAR分数。如下所示,对抗训练提供的鲁棒性不能广泛迁移到未知扭曲。实际上,针对已知扭曲的鲁棒性可能会降低针对未知扭曲的鲁棒性。这些结果强调了需要针对Elastic、Fog、Gabor和Snow等更加多样化攻击进行评估。
对抗训练模型的UAR分数表
我们希望开发对抗鲁棒模型的研究人员将使用我们的方法论针对更多样化的未知攻击进行评估。我们的代码(https://github.com/ddkang/advex-uar)包括一套攻击、对抗训练模型和校准,允许轻松计算UAR。
*如果您对AI安全的主题感兴趣,考虑**申请*(https://openai.com/careers/)*加入OpenAI工作。*
相似文章
OpenAI Blog
OpenAI 研究人员展示了对抗性攻击(先前在计算机视觉中研究过)对强化学习中的神经网络策略也同样有效,即使在白盒和黑盒设置中进行微小的难以察觉的扰动也会导致显著的性能下降。
arXiv cs.LG
本文通过引入与机制对齐的白盒攻击代理 WB-Softmax,研究了流式神经架构模糊 ARTMAP 中的对抗鲁棒性。本文评估了渐进式训练和选择性更新策略,以在不进行数据重放的情况下提高鲁棒性,同时为结构性失效提供可解释的诊断。
OpenAI Blog
# 不同扰动类型之间对抗鲁棒性的迁移 来源: [https://openai.com/index/transfer-of-adversarial-robustness-between-perturbation-types/](https://openai.com/index/transfer-of-adversarial-robustness-between-perturbation-types/) OpenAI## 摘要 我们研究深度神经网络在不同扰动类型之间的对抗鲁棒性迁移。虽然大多数关于对抗样本的工作专注于L∞L\_∞和L2L\_2有界扰动,但这些并不能捕捉所有t
arXiv cs.LG
本文研究受大脑神经变异性启发的相关噪声如何增强人工神经网络对抗对抗攻击和自然图像修改的鲁棒性。
arXiv cs.LG
本文提出了一种针对LLM对抗鲁棒性的计算感知评估框架,提出了基于FLOPs的风险-计算曲线和度量指标,以更好地评估攻击成本,发现对齐训练具有非单调效应,且计算成本因模型和危害类别而异。