镜中的攻击者:通过锚定双策略自我博弈打破安全中的自洽性

arXiv cs.AI 论文

摘要

本文介绍了锚定双策略自我博弈(Anchored Bipolicy Self-Play),这是一种通过在冻结的基础模型上训练特定的角色专用 LoRA 适配器来改善 AI 安全性的方法,旨在解决标准自我博弈红队测试中的局限性。

arXiv:2605.08427v1 公告类型:新文章 摘要:自我博弈红队测试是提升 AI 安全性的一种成熟方法,其中同一模型的不同实例在零和游戏中分别扮演攻击者和防御者的角色,即攻击者试图越狱防御者;如果自我博弈收敛到纳什均衡,则保证模型在游戏设定的范围内做出安全的响应。虽然为两个角色使用同一模型所强制实施的参数共享提高了稳定性和性能,但也引入了根本性的理论和架构局限性。我们表明,可达到的纳什均衡集对应于广泛的行为类别,其中包括简单的始终拒绝策略和类似神谕的防御者,从而限制了其实际适用性。随后我们证明,当攻击者和防御者共享并更新同一基础模型时,动态过程会退化为自洽性,使得攻击无法对防御者施加对抗性压力。对此,我们提出了锚定双策略自我博弈,该方法在冻结的基础模型之上训练不同的角色专用 LoRA 适配器,从而在保持优化稳定性的同时,通过明确的角色分离保留对抗性压力。与标准自我博弈相比,我们表明该方法比微调具有高达 100 倍的参数效率,并且在安全性方面始终优于自我博弈微调模型。我们在 Qwen2.5-{3B, 7B, 14B}-IT 模型上进行了广泛使用的安全性基准测试评估,结果显示在推理能力不受损的情况下提高了鲁棒性。交叉博弈实验进一步表明,我们的攻击者和防御者模型在对抗性防御和安全性方面均优于自我博弈模型。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:14

# 镜中的攻击者:通过锚定双策略自博弈打破安全领域的自我一致性

来源:https://arxiv.org/html/2605.08427

Gabriele La Malfa<sup>1</sup> Emanuele La Malfa<sup>2,4</sup>\* Saar Cohen<sup>2</sup> Jie M\. Zhang<sup>1</sup> Michael Luck<sup>3</sup> Michael Wooldridge<sup>2</sup> Elizabeth Black<sup>1</sup>

<sup>1</sup> 伦敦国王学院信息学部 <sup>2</sup> 牛津大学计算机系 <sup>3</sup> 萨塞克斯大学 <sup>4</sup> 去中心化人工智能研究所

###### 摘要

自博弈红队测试(Self-play red team)是一种提高 AI 安全性的既定方法,其中同一模型的不同实例在零和博弈中分别扮演攻击者和防御者的角色,即攻击者试图越狱防御者;如果自博弈收敛到纳什均衡,模型在博弈设置内被保证做出安全响应。虽然使用同一模型的两个角色所强制的参数共享提高了稳定性和性能,但也引入了根本性的理论和架构限制。我们证明,可达的纳什均衡集对应于一类广泛的行为,其中包括平凡的全拒绝策略和类似预言机的防御者,从而限制了实际应用。随后我们证明,当攻击者和防御者共享并更新相同的基础模型时,动态会退化为自我一致性,导致攻击无法对防御者施加对抗性压力。对此,我们提出了**锚定双策略自博弈**(Anchored Bipolicy Self-Play, ABS),它在冻结的基础模型之上训练特定的角色专用的 LoRA 适配器,从而在通过显式角色分离保持对抗性压力的同时维持稳定的优化。与标准自博弈相比,我们展示了比微调高至 100 倍的参数效率,以及在安全性方面优于自博弈微调模型的持续改进。我们在 Qwen2.5-{3B, 7B, 14B}-IT 模型上进行了广泛使用的安全基准评估,表明在保持推理能力的同时提高了鲁棒性。交叉博弈实验进一步表明,就对抗防御和安全性而言,我们的攻击者和防御者模型均优于自博弈。

> *“一个滑头的防御者是一个危险的防御者。”* —— Carlo Mazzone (*约* 1992 CE)

## 1 引言

长期以来,人们一直关注 NLP 模型的安全性问题 Arraset al.(2016 (https://arxiv.org/html/2605.08427#bib.bib25)),而大型语言模型(LLMs) Brownet al.(2020 (https://arxiv.org/html/2605.08427#bib.bib22)) 鉴于其能力和广泛采用,构成了重大安全和风险,有可能侵蚀对这些系统的信任 La Malfaet al.(2024 (https://arxiv.org/html/2605.08427#bib.bib26)),特别是随着 LLM 智能体和代理应用的出现 de Witt (2025 (https://arxiv.org/html/2605.08427#bib.bib23))。尽管保护生成输出对于防止滥用至关重要,但最新进展揭示了实现可靠 LLM 安全性的持续且重大的障碍 Xuet al.(2024 (https://arxiv.org/html/2605.08427#bib.bib27))。模型修补以防止越狱构成了一种缓解策略 Xionget al.(2025 (https://arxiv.org/html/2605.08427#bib.bib28))。最近,参与多个模型进行迭代攻击-防御循环的自博弈强化学习在提高模型鲁棒性方面显示出希望 Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1))。如图 1 (https://arxiv.org/html/2605.08427#S1.F1)(中部)所示,在 Liu et al. Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1)) 的自博弈红队(Self-RedTeam)框架中,单个模型被微调到同时承担攻击者角色(试图越狱防御者)和防御者角色(旨在防止此类突破)。攻击者因引发有害响应而获得奖励,而防御者通过拒绝有害请求或回答良性请求而成功。在此配置中,私有推理轨迹被隐藏,要求智能体仅从可观察的行动中推断对手意图。

**图 1:自博弈红队框架的架构比较。** (左)完全模型分离:两个独立模型保证独立性和对抗性压力,但导致高昂的计算成本。(中)单模型耦合(Self-RedTeam Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1))):攻击者和防御者共享相同的参数。攻击者的梯度更新改变了防御者的决策边界,导致自我一致性并削弱新漏洞的发现。(右)锚定双策略自博弈(ABS,  ours):我们冻结基础模型并为攻击者和防御者演变单独的 LoRA 适配器,以最小的内存成本恢复对抗性压力。

虽然这种方法可以被框定为不完全信息博弈,但当前框架受限于根本性的架构和理论约束。首先,我们表明,依赖收敛到纳什均衡作为安全保证,其允许的均衡包括平凡的全拒绝策略或类似预言机的防御者,限制了实际应用。此外,完全参数共享虽然提高了训练稳定性,但引入了强烈的依赖性。特别是,我们表明 Liu et al. Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1)) 的 min-max 安全博弈诱导了一种自我一致性偏差,这可能减少对防御者的对抗性压力。为了在安全博弈中重新建立对抗完整性,本文引入了**锚定双策略自博弈**(ABS)。ABS 框架在攻击者和防御者之间强制执行严格的架构分离,同时保持自博弈的训练稳定性(图 1 (https://arxiv.org/html/2605.08427#S1.F1),右)。通过冻结基础模型,ABS 采用低秩适应(LoRA)为每个角色训练不同的轻量级适配器模块,保证梯度更新分离,并与完全微调的最先进 Self-RedTeam 及基础模型相比大幅降低计算成本。ABS 在多个安全基准上匹配或优于基础模型和完全微调的 Self-RedTeam,同时保持推理和指令遵循能力。我们的方法在小规模上特别有效,在现有自博弈框架上提供显著的性能增益,同时在 14B 规模上与完全微调模型保持竞争力。我们在两个设置中进一步评估了攻击者强度:一个是交叉博弈锦标赛,其中相同大小的 ABS 攻击者和 Self-RedTeam 防御者相互评估;另一个是迁移设置,其中两者作为攻击者针对基础 Qwen 模型。在这两种情况下,ABS 攻击者均优于 Self-RedTeam,在交叉博弈中攻击成功率高出约 10%,在针对相同基础模型时高出 15%。

本工作的贡献有三方面:

- 我们表明,自博弈红队测试的零和公式允许一类不可区分的纳什均衡,其中包括平凡的“全拒绝”策略和最优的预言机防御者。这一结果为为什么仅收敛不能确保模型效用提供了理论解释。
- 我们识别并几何形式化了共享参数架构中固有的“自我一致性”现象。我们的分析表明,耦合的梯度更新抑制了对抗性压力,并阻碍了对最坏情况提示的探索。
- 我们提出了锚定双策略自博弈(ABS),这是一种参数高效框架,采用角色特定的 LoRA 适配器来保持架构分离。该方法通过使攻击者和防御者独立演变来恢复对抗完整性,同时也大幅降低了与自博弈训练相关的计算成本。

本文结构如下:我们首先回顾强化学习安全、自博弈和参数高效训练的相关文献。然后我们表明通过纳什均衡对安全的分析是不完整的,且当前的 Self-RedTeam 公式退化为自我一致性。接着我们介绍我们的技术(ABS),并进行实验以证明其性能和可扩展性。所有结果均可在 [这里](https://github.com/EmanueleLM/AnchoredBipolicySelf-Play) 获取。

## 2 相关工作

**安全性、越狱和红队测试。** 标准红队训练依赖人工反馈来识别有害响应并相应地强化模型行为 Baiet al.(2022 (https://arxiv.org/html/2605.08427#bib.bib4)); Daiet al.(2024 (https://arxiv.org/html/2605.08427#bib.bib5))。由于这种方法的覆盖范围有限,模型通常被鼓励探索新型攻击提示 Perezet al.(2022 (https://arxiv.org/html/2605.08427#bib.bib6))。例如,Mehrotra et al. Mehrotraet al.(2024 (https://arxiv.org/html/2605.08427#bib.bib7)) 提出了一种剪枝策略,以预选具有更高越狱潜力的攻击。Hong et al. Honget al.(2024 (https://arxiv.org/html/2605.08427#bib.bib8)) 则联合优化奖励和新颖性,在好奇心驱动的设置中激励生成成功且以前未见的提示。其他工作侧重于共同进化攻击者和防御者策略以避免静态对手 Jainet al.(2023 (https://arxiv.org/html/2605.08427#bib.bib9))。此设置中的一个核心挑战是计算成本 Howeet al.(2025 (https://arxiv.org/html/2605.08427#bib.bib10))。Xhonneux et al. Xhonneuxet al.(2024 (https://arxiv.org/html/2605.08427#bib.bib11)) 通过操作连续嵌入空间来解决这一问题,降低了与离散 token 级攻击相关的开销。Liu et al. Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1)) 引入了一种在线自博弈框架,其中单个模型实例化攻击者和防御者,实现相互适应。最近,Wen et al. Wenet al.(2026 (https://arxiv.org/html/2605.08427#bib.bib12)) 提出了 MAGIC,一种解耦的共同进化公式,旨在通过全参数更新缓解优化冲突。Tan et al. Tanet al.(2026 (https://arxiv.org/html/2605.08427#bib.bib53)) 通过引入额外的评估者角色来稳定通过多智能体互动的训练,扩展了这一工作线。

**参数高效微调技术。** 参数高效微调(PEFT)技术在模型训练中显示出有效性,与全模型微调相比提供了显著的计算效率。在这些方法中,LoRA Hu et al.(2022 (https://arxiv.org/html/2605.08427#bib.bib15)) 在保持基础模型参数固定的同时对权重应用低秩更新。例如,在支撑现代大型语言模型(LLMs)的 transformer 架构中,LoRA 修改注意力权重,同时保持多层感知机权重不变。LoRA 的其他变体要么致力于降低计算学习成本,如 QLoRA Dettmerset al.(2023 (https://arxiv.org/html/2605.08427#bib.bib16)),要么动态修改权重矩阵的维度(秩)以改善关键学习动量,如 AdaLoRA Zhang et al.(2023a (https://arxiv.org/html/2605.08427#bib.bib17))。SaLoRA Li et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib18)) 则提出了一种提高 LLM 安全对齐的方法。最后,与本文一致,Red-Bandit 实现了基于 LoRA 的后训练,以减少 LLM 对攻击的脆弱性 Ziakaset al.(2025 (https://arxiv.org/html/2605.08427#bib.bib19))。

**总结与研究空白。** Self-RedTeam Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1)) 作为主要基准,因为它建立了 LLM 安全性中在线对称自博弈的基础设置,其中单个模型在攻击者和防御者角色之间交替。最近的文献转向更复杂的共同进化博弈,如 MAGIC Wen et al.(2026 (https://arxiv.org/html/2605.08427#bib.bib12)),其通过全参数更新提出角色解耦,以及 TriPlay-RL Tan et al.(2026 (https://arxiv.org/html/2605.08427#bib.bib53)),其引入辅助“评估者”角色以稳定共同进化。与我们的工作不同,它们未对共享参数架构中固有的梯度冲突和自我一致性偏差提供理论处理。ABS 填补了这一空白,通过引入一种通过架构分离恢复对抗完整性的参数高效方法。

## 3 纳什均衡、模型安全与自博弈

Self-RedTeam by Liu et al. Liu et al.(2025 (https://arxiv.org/html/2605.08427#bib.bib1)) 提出通过自博弈实现模型安全,其中单个基础模型共同实例化攻击者 $A$(发出越狱提示)和防御者 $D$(响应)。训练在顺序零和博弈中在线进行,其中纳什均衡对应于安全性(见 §3.1 (https://arxiv.org/html/2605.08427#S3.SS1))。尽管采用率日益增长 Wen et al.(2026 (https://arxiv.org/html/2605.08427#bib.bib12)) 并扩展到广义和设置 Liao et al.(2024 (https://arxiv.org/html/2605.08427#bib.bib2)),我们表明 (i) Self-RedTeam 公式允许跨越平凡全拒绝和预言机防御者的不可区分均衡(见 §3.2 (https://arxiv.org/html/2605.08427#S3.SS2));以及 (ii) 该目标更自然地表述为单模型自我一致性,对训练动态和均衡有影响(见 §3.3 (https://arxiv.org/html/2605.08427#S3.SS3))。

### 3.1 Self-RedTeam 中的纳什均衡

令 $\mathcal{Y}_A$ 为攻击者提示的集合,$\mathcal{Y}_D$ 为防御者响应的集合。对于每个玩家 $P \in \{A, D\}$,我们将 $\mathcal{Y}_P$ 上的概率单纯形定义为 $\Delta(\mathcal{Y}_P)$。在红队测试的双玩家博弈公式中,攻击者首先提出一个提示 $y_A$,采样自混合策略 $\pi_A \in \Delta(\mathcal{Y}_A)$,称为策略。给定提示 $y_A$,防御者然后生成响应 $y_D$,采样自条件策略 $\pi_D(\cdot \mid y_A)$,其中 $\pi_D: \mathcal{Y}_A \rightarrow \Delta(\mathcal{Y}_D)$。<sup>1</sup> 随后,奖励模型 $r: \mathcal{Y}_A \times \mathcal{Y}_D \rightarrow [-1, 1]$ 评估每个提示-响应对,即,对于任何这样的对 $(y_A, y_D)$,防御者的奖励为 $r(y_A, y_D)$,攻击者收到相反的回报 $-r(y_A, y_D)$。对于旨在最大化奖励的攻击者和防御者,此设置对应于一个零和顺序博弈,其中 (i) 不安全响应受到严格惩罚,即,如果 $(y_A, y_D)$ 不安全,则 $r(y_A, y_D) = -1$;(ii) 安全响应获得非负奖励,即,如果 $(y_A, y_D)$ 安全,则 $r(y_A, y_D) \geq 0$;以及 (iii) 存在一个拒绝响应 $y^{\mathrm{ref}} \in \mathcal{Y}_D$,使得对于所有 $y_A \in \mathcal{Y}_A$,有 $r(y_A, y^{\mathrm{ref}}) = 0$。在这些假设下,预期奖励为 $V(\pi_A, \pi_D) = \mathbb{E}_{y_A \sim \pi_A, y_D \sim \pi_D(\cdot \mid y_A)}[r$

相似文章

当动作消失:自对弈强化学习中的对抗性动作移除

arXiv cs.LG

本文研究了自对弈强化学习中的对抗性动作掩蔽,攻击者选择性移除受害者动作集中的合法动作。实验表明,在多个环境和算法下,该攻击比随机掩蔽或扰动基线造成的损害显著更大,且受害者即使在长时间训练后也无法恢复。

竞争性自我对弈

OpenAI Blog

OpenAI 证明在模拟 3D 机器人环境中进行竞争性自我对弈,能够使 AI 智能体在没有明确指导的情况下发现复杂的物理行为,如铲球、躲闪和虚晃等,表明自我对弈将成为未来强大 AI 系统的基础。