RL-FAT:公平对抗训练的强化学习

arXiv cs.LG 论文

摘要

RL-FAT 是一个用于公平对抗训练的强化学习框架,旨在提高模型鲁棒性并减少不同类别之间的鲁棒性差异。实验表明,与标准方法相比,该方法在准确性和公平性方面都表现出竞争力。

arXiv:2608.29247v1 公告类型:新 摘要:深度神经网络仍然高度易受对抗性扰动的影响,对抗训练已成为提高鲁棒性的广泛使用方法。然而,平均鲁棒准确性的提升往往掩盖了显著的类别间差异:有些类别变得更加鲁棒,而其他类别在攻击下可能仍然不成比例地脆弱。这种不平衡引发了重要的对抗公平性问题,特别是在视觉任务中,期望所有类别都具有可靠的鲁棒性。为了应对这一挑战,我们提出了 \textbf{RL-FAT},一个受强化学习启发的公平对抗训练框架,它使用基于策略梯度的对抗预测反馈。RL-FAT 将预测分布解释为策略,并结合基于正确性的预测奖励与类别价值估计来计算策略梯度优化的类别特定优势。这使得模型能够自适应地关注类别间的误分类。此外,我们引入了公平强调对抗损失,为具有高对抗损失的类别分配更强的训练压力,从而缓解类别间的鲁棒性差异。通过结合强化驱动的适应和公平强调正则化,RL-FAT 在提高对抗鲁棒性的同时,促进了更平衡的跨类别鲁棒性分布。大量实验表明,与标准对抗训练基线相比,我们的方法实现了有竞争力的鲁棒准确性,并显著减少了类别间的鲁棒性不平衡。
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:11

# RL-FAT:基于强化学习的公平对抗训练
来源:https://arxiv.org/html/2608.29247

RL-FAT

###### 摘要

深度神经网络对对抗性扰动仍然高度脆弱,而对抗训练已成为提高鲁棒性的一种广泛应用方法。然而,平均鲁棒准确性的提升往往掩盖了显著的类别间差异:某些类别变得更鲁棒,而其他类别在攻击下可能仍然不成比例地脆弱。这种不平衡引发了一个重要的对抗公平性问题,特别是在期望所有类别都能提供可靠鲁棒性的视觉任务中。为应对这一挑战,我们提出了 RL-FAT,一个受强化学习启发的公平对抗训练框架,它利用基于策略梯度的对抗预测反馈。RL-FAT 将预测分布解释为一种策略,并将基于正确性的预测奖励与类别价值估计相结合,为策略梯度优化计算类别特定的优势值。这使得模型能够自适应地关注类别间的误分类。此外,我们引入了一种强调公平性的对抗损失,为具有高对抗损失的类别分配更强的训练压力,从而减轻类别间的鲁棒性差距。通过结合强化驱动的适应性和公平性强调的正则化,RL-FAT 在提高对抗鲁棒性的同时,促进了类别间更均衡的鲁棒性分布。大量实验表明,与标准对抗训练基线相比,我们的方法实现了具有竞争力的鲁棒准确性,并显著降低了类别间的鲁棒性不平衡。

††邮箱:[email protected]††邮箱:[email protected]††邮箱:[email protected]††隶属机构:机器学习教席
曼海姆大学
德国††隶属机构:马克斯·普朗克信息学研究所
萨尔兰计算机科学园区
德国## 1引言

对抗训练是提高深度神经网络鲁棒性最有效的方法之一,通过在对抗性扰动样本上训练模型,从而在强攻击下显著提升平均鲁棒准确性(Athalye 等,2018 (https://arxiv.org/html/2608.29247#bib.bib20); Wang 等,2020 (https://arxiv.org/html/2608.29247#bib.bib36); Jia 等,2022 (https://arxiv.org/html/2608.29247#bib.bib14); Grabinski 等,2024 (https://arxiv.org/html/2608.29247#bib.bib26); Grabinski 等,2022b (https://arxiv.org/html/2608.29247#bib.bib45); Grabinski 等,2022c (https://arxiv.org/html/2608.29247#bib.bib35); Grabinski 等,2022a (https://arxiv.org/html/2608.29247#bib.bib29); Jung 等,2023 (https://arxiv.org/html/2608.29247#bib.bib34); Lukasik 等,2023 (https://arxiv.org/html/2608.29247#bib.bib27); Agnihotri 等,2024 (https://arxiv.org/html/2608.29247#bib.bib46))。在现有方法中,TRADES(Zhang 等,2019 (https://arxiv.org/html/2608.29247#bib.bib23))提供了一个具有理论依据的目标函数,它在自然准确性和对抗鲁棒性之间取得平衡,使其成为鲁棒优化中最广泛使用的基线之一。然而,平均鲁棒准确性的提升仍然可能隐藏着严重的类别间漏洞(Tian 等,2021 (https://arxiv.org/html/2608.29247#bib.bib17); Xu 等,2021b (https://arxiv.org/html/2608.29247#bib.bib21))。例如,在自动驾驶系统中,模型在识别汽车或路标等常见物体时可能保持鲁棒性,但在应对行人、骑行者或紧急车辆等频率较低但安全关键的类别上的微小对抗性扰动时可能失败。在这种情况下,模型平均表现可能显得可靠,但其在困难类别上的行为决定了实际的现实世界风险。因此,评估鲁棒分类器不仅要看平均鲁棒准确性,还要看最差类别鲁棒准确性和类别间鲁棒公平性。此类类别间差异通常被研究为鲁棒公平性问题(Xu 等,2021b (https://arxiv.org/html/2608.29247#bib.bib21); Zhang 等,2021 (https://arxiv.org/html/2608.29247#bib.bib22); Medi 等,2024 (https://arxiv.org/html/2608.29247#bib.bib38); Medi 等,2025 (https://arxiv.org/html/2608.29247#bib.bib25); Wei 等,2023 (https://arxiv.org/html/2608.29247#bib.bib37); Gupta 和 Tan,2023 (https://arxiv.org/html/2608.29247#bib.bib18); Li 和 Liu,2023 (https://arxiv.org/html/2608.29247#bib.bib33); Liu 和 Zhao,2022 (https://arxiv.org/html/2608.29247#bib.bib13))。

差距干净鲁棒平均
飞机.汽车.鸟猫鹿狗马船卡车202040406060808010010085.7152.48CIFAR-10 类别准确率 (%)(a) ResNet-18
飞机.汽车.鸟猫鹿狗马船卡车202040406060808010010090.0656.13CIFAR-10 类别(b) XCiT-S12

图1:在 CIFAR-10 上,ε=8/255\\epsilon=8/255 时每个类别的干净和 AutoAttack 鲁棒准确性。阴影区域表示干净到鲁棒的性能差距,而水平虚线表示相应的平均干净和鲁棒准确性。图1 (https://arxiv.org/html/2608.29247#S1.F1) 使用 ResNet-18He 等 (2016) (https://arxiv.org/html/2608.29247#bib.bib40) 和 XCiT-S12El-Nouby 等 (2021) (https://arxiv.org/html/2608.2927#bib.bib9) 作为基于 CNN 和基于 Transformer 的 RobustBench 模型的代表性架构(Addepalli 等,2022 (https://arxiv.org/html/2608.29247#bib.bib7); Debenedetti 等,2023 (https://arxiv.org/html/2608.29247#bib.bib28); Croce 等,2021 (https://arxiv.org/html/2608.29247#bib.bib24))说明了这一现象。对于这两种架构,对抗评估下平均与最差类别准确性之间的差距远大于干净评估下的差距。这表明鲁棒不公平性并非局限于单一架构系列,而是当前对抗训练鲁棒模型中一个更广泛的问题。因此,提高鲁棒公平性对于确保鲁棒模型在所有语义类别上可靠运行是必要的。

近期的鲁棒公平性方法旨在提高最差类别鲁棒性,同时保持有竞争力的平均鲁棒准确性。WATLi 和 Liu (2023) (https://arxiv.org/html/2608.29247#bib.bib33) 使用无遗憾动态优化最差类别目标,但仍受限于显式的类别级别最坏情况更新。BATSun 等 (2021) (https://arxiv.org/html/2608.29247#bib.bib12) 表明,鲁棒不公平性也可能在生成对抗样本时产生,原因是类别相关的攻击难度和有偏差的目标类别倾向,但主要通过设计的平衡规则来解决这些偏差。CFAWei 等 (2023) (https://arxiv.org/html/2608.29247#bib.bib37) 认为不同的类别偏好不同的对抗训练配置,例如扰动边界、正则化强度和类别权重,并分别对其进行校准。DAFALee 等 (2024) (https://arxiv.org/html/2608.29247#bib.bib39) 引入了一种类间距离感知策略,通过类别特定的扰动边界和损失权重为视觉或语义相似的类别分配更大的鲁棒性权衡。从分布的角度,FAALZhang 等 (2024) (https://arxiv.org/html/2608.29247#bib.bib31) 将鲁棒公平性表述为一个分布式鲁棒优化问题,并通过最小-最大-最大目标学习类别对抗权重。ABSLDZhao 等人 (2024) (https://arxiv.org/html/2608.29247#bib.bib32) 在对抗蒸馏中研究了鲁棒公平性,并通过不同的蒸馏温度调整类别特定的软标签平滑度。

尽管这些方法展示了自适应类别感知训练的重要性,但它们通常依赖于设计的类别规则、预定义的距离度量、蒸馏特定的设计或额外的优化机制,而不是直接从目标层面的训练反馈中学习公平性感知的调整。

为解决这一局限性,我们提出了 RL-FAT,一个受强化学习启发的公平对抗训练框架,旨在自适应地促进类别间的鲁棒公平性。关键思想是从对抗预测反馈中学习类别感知的训练重点。在 RL-FAT 中,模型的对抗预测被解释为一个动作,预测正确性提供正向或负向奖励,而类别基线估计每个类别的预期奖励。由此产生的类别特定优势值引导策略梯度优化,允许模型专注于减少类别间的误分类。我们进一步将这种强化驱动的目标与强调公平性的对抗损失相结合,其中具有高于平均对抗损失的类别会获得更强的训练重点。这些组件共同使 RL-FAT 能够执行自适应的类别感知鲁棒优化,而无需显式设计类别特定的对抗训练配置。

我们的贡献总结如下:
- •我们提出了 RL-FAT,一个受强化学习启发的公平对抗训练框架,它使用类别预测正确性反馈、类别特定优势估计和强调公平性的对抗损失来提高最差类别鲁棒性,同时保持有竞争力的平均鲁棒准确性。
- •我们使用最差类别鲁棒准确性和一个相对鲁棒公平性指标来评估鲁棒公平性,该指标衡量最差类别鲁棒性的改善是否超过平均鲁棒性的变化。
- •在 CIFAR-10、CIFAR-100 和 ImageNette 上的实验表明,RL-FAT 在 AutoAttack 等强攻击下持续提高最差类别鲁棒准确性和鲁棒公平性,同时保持有竞争力的整体干净和鲁棒准确性。

## 2相关工作

越来越多的研究关注鲁棒公平性,其中对抗训练模型可以实现高平均鲁棒准确性,同时在不同类别间表现出巨大差异。理论和实证研究都支持超越平均指标评估鲁棒性的必要性(Li 和 Liu (2023) (https://arxiv.org/html/2608.29247#bib.bib33); Sun 等 (2021) (https://arxiv.org/html/2608.29247#bib.bib12); Wei 等 (2023) (https://arxiv.org/html/2608.29247#bib.bib37); Lee 等 (2024) (https://arxiv.org/html/2608.29247#bib.bib39))。先前的分析表明,对抗训练可能会放大类别间差距,并且在更强的攻击下,鲁棒性-公平性权衡变得更加严重(Kumar 和 Singh, 2022 (https://arxiv.org/html/2608.29247#bib.bib15); Liu 和 Zhao, 2022 (https://arxiv.org/html/2608.29247#bib.bib13))。其他工作将鲁棒公平性与类别不平衡和长尾学习联系起来,将类别重加权策略应用于对抗训练(Benz 等, 2021 (https://arxiv.org/html/2608.29247#bib.bib16); Tian 等, 2021 (https://arxiv.org/html/2608.29247#bib.bib17))。这些研究表明,单独的平均鲁棒准确性无法捕捉鲁棒模型的可靠性,而在保持平均鲁棒准确性的同时提高最差类别鲁棒准确性是评估对抗鲁棒公平性的一个重要标准。

FRL(Xu 等, 2021a (https://arxiv.org/html/2608.29247#bib.bib10))是该方向最早的方法之一,通过在公平性约束被违反时调整损失权重和对抗边界来减轻类别间的鲁棒不公平性。FAT(Ma 等, 2021 (https://arxiv.org/html/2608.29247#bib.bib11))分析了鲁棒性-公平性权衡,并提议通过正则化类别对抗风险的方差来改进,其动机在于对抗风险方差与类别鲁棒准确性方差之间的联系。BAT(Sun 等, 2021 (https://arxiv.org/html/2608.29247#bib.bib12))进一步研究了生成对抗样本过程中的不公平性,并将鲁棒不公平性分解为源类别脆弱性(即不同源类别的攻击难度不同)和目标类别脆弱性(即对抗样本的有偏目标类别倾向)。这些方法表明鲁棒公平性需要类别感知的训练,但其公平性机制仍然通过显式的重加权、重设边界、风险方差正则化或平衡规则来指定。

更近期的方法引入了更丰富的类别训练配置。CFA(Wei 等, 2023 (https://arxiv.org/html/2608.29247#bib.bib37))表明,不同的类别偏好不同的对抗训练配置,包括类别特定的扰动边界、正则化强度和权重平均,因此为每个类别单独校准这些配置。DAFA(Lee 等, 2024 (https://arxiv.org/html/2608.29247#bib.bib39))认为鲁棒公平性问题与类间相似性密切相关:困难类别通常与语义或视觉相似的类别混淆,而不是任意简单的类别。基于此观察,DAFA 使用类间相似性距离分配类别特定的损失权重和对抗边界,鼓励主要在相似类别之间进行鲁棒性权衡。FAAL(Zhang 等, 2024 (https://arxiv.org/html/2608.29247#bib.bib31))将公平性感知对抗学习表述为一个分布式鲁棒优化问题,并引入最小-最大-最大目标,其中中间最大化步骤学习类别对抗权重以提高最差类别鲁棒性。ABSLD(Zhao 等人, 2024 (https://arxiv.org/html/2608.29247#bib.bib32))研究了对抗鲁棒性蒸馏中的鲁棒公平性,并通过不同的蒸馏温度调整类别特定的软标签平滑度。FAIR-TAT(Medi 等, 2025 (https://arxiv.org/html/2608.29247#bib.bib25))探索了定向对抗训练,并研究了其对跨攻击和损坏的公平性与鲁棒性权衡的影响。尽管有效,但这些方法通过预定义的类别统计信息、距离度量、温度调度、定向攻击设计或额外的鲁棒优化目标来实例化公平性。

与主要依赖预定义重加权规则、自适应扰动边界强度、类距离估计、温度调度、定向攻击设计或额外鲁棒优化目标的方法相比,RL-FAT 直接从对抗预测反馈中学习类别训练重点。在对抗训练过程中,脆弱的类别会随时间变化,并且改进一个类别可能会改变其他类别的鲁棒性。这促使我们采用一种受强化学习启发的表述,其中模型从对抗预测中接收基于正确性的反馈,并使用该信号在训练期间自适应地调整类别学习。相关工作表明,基于奖励的图像分类学习可以提高泛化能力和对抗准确性,与标准交叉熵训练相比(Gupta, 2020 (https://arxiv.org/html/2608.29247#bib.bib30));然而,它没有明确研究类别间的鲁棒公平性。我们的方法专门将这一视角用于公平对抗训练:对抗预测被视为动作,预测正确性定义奖励,类别奖励基线用于形成基于优势值的更新。我们将此反馈信号与强调公平性的对抗损失相结合,使具有高于平均对抗损失的类别获得更强的训练压力。这使得自适应类别感知鲁棒优化成为可能,旨在提高最差类别鲁棒性,同时保持有竞争力的平均鲁棒准确性。

## 3方法论

参见标题图2:提出的 RL-FAT 框架概述。模型首先初始化

相似文章

公平强化学习

Reddit r/AI_Agents

公平强化学习引入了民主对齐,以整合来自不同代理的多个竞争性价值集,克服了传统RLHF的局限性,并通过黑盒策略包装器实现了数量级更快的优化。

不要让收益FADE:解析强化学习中的策略梯度权重

arXiv cs.LG

本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。

偏好平均导致的RLHF程序公平性失败

arXiv cs.LG

本文指出,RLHF因平均化异质偏好而导致程序公平性失败:多数群体主导奖励学习,少数偏好代表性不足。文章提出了偏好感知RLHF(PA-RLHF),在受控实验中提升了对齐准确率并缩小了公平性差距。