MJ: 基于分解信用分配的多轮LLM越狱
摘要
本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。
arXiv:2607.11070v1 公告类型:新
摘要:现代大语言模型(LLM)运行在交互式多轮环境中,使得多轮越狱成为一种现实的威胁模型,也是自动化红队测试的重要场景。学习多轮越狱攻击者的核心挑战是信用分配:不同轮次对最终结果的贡献不同,然而现有的学习信号往往过于粗糙,无法识别各自的贡献。我们提出了分解信用GRPO(DC-GRPO),一种面向多轮越狱学习中组相对策略优化的统一回合级信用分配框架。DC-GRPO通过结合即时和未来信用,为每个回合分配独立的组相对学习信号,避免了在整个对话中广播单一轨迹分数所导致的信用错误分配。我们通过静态和动态加权规则实例化该框架,这些规则在平衡两种信用来源的方式上有所不同,但共享相同的回合级结构。在多个受害者LLM和基准测试中,动态加权和静态加权变体分别达到了平均ASR5@3得分98.26%和97.88%,显著优于现有最先进方法,包括SEMA(86.58%)和TROJail(86.23%)。它们一致强效的表现表明,核心经验优势来自于回合级组相对信用分配,而非特定的加权规则。警告:本文包含有害内容示例。
查看缓存全文
缓存时间: 2026/07/14 04:24
# MJ: 基于分解信用分配的多轮大语言模型越狱
来源: https://arxiv.org/html/2607.11070
Junyoung Park, POSTECH GSAI, pjy0422@postech\.ac\.kr
Namgyu Park, Samsung SDS, nam9yu\.park@samsung\.com
Sechan Lee, POSTECH GSAI, chan1031@postech\.ac\.kr
Yoon\-Chan Jhi, Samsung SDS, yoonchan\.jhi@samsung\.com
Jihoon Cho, Samsung SDS, jihoon1\.cho@samsung\.com
Sangdon Park, POSTECH GSAI & CSE, sangdon@postech\.ac\.kr
###### 摘要
现代大语言模型 (LLMs) 运行在交互式多轮场景中,这使得多轮越狱成为一种现实的威胁模型,也是自动化红队攻击的重要场景。学习多轮越狱攻击者的核心挑战在于信用分配:不同轮次对最终结果贡献不同,而现有的学习信号往往过于粗糙,难以识别它们各自的贡献。我们提出了**分解信用 GRPO** (DC-GRPO),这是一个用于多轮越狱学习中的组相对策略优化的统一轮级信用分配框架。DC-GRPO 通过结合即时信用和未来信用,为每一轮分配一个独立的组相对学习信号,避免了因在对话中广播单一的轨迹级分数而导致的信用错误分配。我们用静态和动态加权规则实例化该框架,这两种规则在如何平衡两个信用来源上有所不同,但共享相同的轮级信用结构。在多个受害 LLM 和基准测试上,动态权重和静态权重的变体分别实现了平均 **ASR5@3** 分数 98.26% 和 97.88%,显著优于最先进的方法,包括 SEMA (86.58%) 和 TROJail (86.23%)。它们持续强劲的表现表明,核心的实证收益来自轮级组相对信用分配,而非特定的加权规则。
*警告:本文包含有害内容的示例。*
## 1 引言
现代大语言模型 (LLMs) [Shao 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib383); [OpenAI (2025a)](https://arxiv.org/html/2607.11070#bib.bib58), [2026](https://arxiv.org/html/2607.11070#bib.bib65) 越来越多地部署在多轮对话场景中,用户和模型通过多轮交互而非单一孤立提示来交换信息。诸如 RLHF [Bai 等人 (2022)](https://arxiv.org/html/2607.11070#bib.bib63); [Ouyang 等人 (2022)](https://arxiv.org/html/2607.11070#bib.bib64) 等安全对齐技术已使这些系统对直接的恶意请求具有更强的抵抗力,但在多轮对话中仍存在漏洞:攻击者可以策略性地塑造上下文、伪装意图,并跨轮次适应受害模型的响应。因此,在此交互环境中研究越狱对于现实的安全评估和自动化红队攻击至关重要,其目标是识别多轮故障模式,并最终提高模型针对恶意使用的鲁棒性。
有效的自动化红队攻击需要攻击者既具有可扩展性又具有适应性,而手工制作的提示和大规模闭源模型均无法完全提供这些特性。前者需要大量人类专业知识且覆盖范围有限 [Ganguli 等人 (2022)](https://arxiv.org/html/2607.11070#bib.bib428); [Perez 等人 (2022)](https://arxiv.org/html/2607.11070#bib.bib429),而后者则会导致高昂的计算成本和较差的可重复性 [Chao 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib390); [Mehrotra 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib391)。这产生了对可学习攻击者策略的实际需求:这些策略可以训练一次,然后以规模重复部署,使即使是相对较小的模型也能探索多样且有效的多轮攻击轨迹。然而,训练这样的策略并非易事。
学习此类多轮越狱攻击者的一个核心挑战是信用分配。在多轮对话中,并非所有攻击者轮次都扮演相同角色:有些轮次立即产生越狱进展,而另一些则主要准备上下文,仅在后几轮才变得有用。现有的基于训练的方法 [Feng 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib418); [Xiong 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib425) 已开始学习超越手工提示的攻击者策略,但其学习信号对于多轮对话仍然过于粗糙。特别是,它们没有为单个轮次分配精确的信用,使得难以区分即时进展和仅在多次交互后才显现的后续结果。
组相对策略优化 (GRPO) [Shao 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib383) 是一种基于组相对归一化的无评论家策略优化方法,在此场景中具有吸引力,因为越狱训练自然会产生针对同一有害行为的分组展开。然而,标准 GRPO 是为单轮生成设计的,其中一个采样输出对应一个决策周期。朴素的多轮扩展会将相同的轨迹级优势广播到每一轮,掩盖了哪个动作产生了即时进展、哪个动作创建了有用的未来上下文。这种粗粒度的信用也可能将后续轮次的动作归因于对话早期获得的奖励,从而使完全交互环境中的策略更新不够精确。
在本文中,我们提出一个问题:*在训练多轮越狱攻击者时,GRPO 应如何分配信用?* 为了回答这个问题,我们提出了**分解信用 GRPO** (DC-GRPO),这是一个统一的框架,通过结合即时信用和未来信用,为每一轮分配一个独立的组相对学习信号。我们用两种加权规则实例化 DC-GRPO:静态加权,通过固定系数明确控制未来信用的贡献;动态加权,其系数由展开组的统计数据决定,无需额外的混合超参数。两种变体共享相同的轮级信用结构,仅在两个信用来源的平衡方式上有所不同。实证上,两种变体都能训练出轻量级攻击者,并且跨多个受害模型和基准测试展现出强大的攻击成功率和可迁移性。
我们的主要贡献如下:
- • 我们提出了一个简单的 RL 框架,通过将组相对信用分别分配给每个交互轮次来学习多轮越狱攻击者。
- • 我们引入了 DC-GRPO,一个用于越狱的统一轮级信用分配框架,具有静态加权和动态加权实例化,两者共享相同的即时-未来信用结构,仅在两项的平衡方式上有所不同。
- • 我们通过实验证明,动态加权和静态加权的变体在 4 个受害模型和 3 个基准测试上的平均 **ASR5@3** 分数分别达到 98.26% 和 97.88%,显著优于先前的方法,包括 SEMA (86.58%) 和 TROJail (86.23%)。
## 2 相关工作
我们将关于黑盒越狱攻击的先前工作组织为三类:单轮攻击、免训练多轮攻击和基于训练的多轮攻击。我们进一步回顾了关于多轮策略优化的相关工作,以便在轮级信用分配的背景下定位我们的方法。
### 2.1 单轮黑盒越狱攻击
单轮攻击旨在通过单个对抗性提示诱导不安全响应。现有方法通常分为三类:手工制作的混淆或转换策略(例如,密码、ASCII 艺术、令牌翻转和多语言编码)[Yuan 等人 (2023)](https://arxiv.org/html/2607.11070#bib.bib393); [Jiang 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib394); [Lv 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib395); [Liu 等人 (2025b)](https://arxiv.org/html/2607.11070#bib.bib396); [Chan 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib399);基于模板的方法,利用说服策略、预定义结构或增强搜索 [Zeng 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib400); [Ding 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib401); [Hughes 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib402); [Andriushchenko 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib406);以及通过训练或优化的自动生成,利用监督微调、遗传算法、强化学习和 LLM 辅助迭代精化等技术 [Li 等人 (2025a)](https://arxiv.org/html/2607.11070#bib.bib403); [Zhu 等人 (2023)](https://arxiv.org/html/2607.11070#bib.bib404); [Samvelyan 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib405); [Guo 等人 (2025b)](https://arxiv.org/html/2607.11070#bib.bib407); [Hong 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib392); [Liu 等人 (2025a)](https://arxiv.org/html/2607.11070#bib.bib408); [Mehrotra 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib391); [Chao 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib390); [yanjiang liu 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib415); [Koo 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib416); [Zhou 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib417); [Xiong 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib398)。尽管这些方法有效,但现代 LLM 固有的对话特性突显了单轮交互的局限性,因此有必要研究多轮越狱攻击。
### 2.2 多轮黑盒越狱攻击:免训练
免训练方法在不学习显式攻击者策略的情况下构建对抗性对话。Crescendo [Russinovich 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib388) 和 FITD 风格攻击 [Weng 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib409); [Kumarappan and Mujoo (2025)](https://arxiv.org/html/2607.11070#bib.bib413) 通过分层中间提示逐步升级有害意图,而 GOAT [Pavlova 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib389) 则利用预定义的策略模板实现自适应红队攻击。CoA [Yang 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib410) 通过审讯式提示策略性地隐藏恶意意图,RACE [Ying 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib412) 将有害意图重新表述为跨多轮的复杂、看似良性的推理任务。AMA [Wu 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib411) 使用类比结构的良性安全任务构建完全良性的多轮上下文,仅在最后一轮引入受控的语义偏移。X-Teaming [Rahman 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib414) 采用多智能体框架进行规划、攻击优化和验证,而 ActorAttack [Ren 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib387) 利用语义相关的线索构建和修订多轮攻击路径。虽然有效,但这些方法大多依赖手工模板、语义启发式或测试时搜索,严重依赖于更大攻击者模型的自然能力。
### 2.3 多轮黑盒越狱攻击:基于训练
基于训练的方法学习多轮越狱生成的攻击者策略,而不是仅依赖手工制作的测试时启发式。SEMA [Feng 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib418) 将预填充自调整与 GRPO [Shao 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib383) 和意图漂移感知奖励相结合,通过单次攻击规划实现高效的多轮攻击者训练。Siren [Zhao 等人 (2025b)](https://arxiv.org/html/2607.11070#bib.bib419) 和 MTSA [Guo 等人 (2025a)](https://arxiv.org/html/2607.11070#bib.bib386) 使用 SFT 初始化攻击者,并通过 DPO 风格优化 [Rafailov 等人 (2023)](https://arxiv.org/html/2607.11070#bib.bib49) 进一步改进;MTSA 还针对受害模型引入了基于未来奖励的对齐。TROJail [Xiong 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib425) 则将多轮越狱生成公式化为一个两级优化问题,并采用 MT-GRPO [Zeng 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib50),结合轨迹级奖励和启发式轮级奖励。然而,现有方法仍然依赖手工设计的奖励或粗糙的优化信号,限制了细粒度信用分配和在完全交互式多轮环境中的自适应能力。表 1 (https://arxiv.org/html/2607.11070#S2.T1) 通过根据信用分配的粒度和形式比较基于训练的多轮越狱方法,突显了这一差异。
**表 1:基于训练的多轮越狱方法的信用分配比较。** 我们的方法是 DC-GRPO,一个统一的轮级信用分配框架,具有动态加权和静态加权实例化。详细符号在第 3 节 (https://arxiv.org/html/2607.11070#S3) 和第 4 节 (https://arxiv.org/html/2607.11070#S4) 中介绍。
| 方法 | 方案 | 信号 | 信用分配 |
|------|------|------|----------|
| SEMA [Feng 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib418) | GRPO [Shao 等人 (2024)](https://arxiv.org/html/2607.11070#bib.bib383) | \( \hat{A}_{i} = \frac{r_{i,T} - \mu_T^{r}}{\sigma_T^{r}} \) | 最终轮奖励作为轨迹级信用 |
| Siren [Zhao 等人 (2025b)](https://arxiv.org/html/2607.11070#bib.bib419) | DPO [Rafailov 等人 (2023)](https://arxiv.org/html/2607.11070#bib.bib49) | 偏好优化 | 序列级偏好信用 |
| MTSA [Guo 等人 (2025a)](https://arxiv.org/html/2607.11070#bib.bib386) | DPO | 偏好 + 未来奖励 | 间接未来感知信用 |
| TROJail [Xiong 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib425) | MT-GRPO [Zeng 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib50) | \( \hat{A}_{i,t} = \hat{A}_{i}^{o} + \lambda \hat{A}_{i,t}^{h} \) | 结果 + 启发式轮级信用 |
| **我们的方法** | **DC-GRPO** | \( \hat{A}_{i,t}^{\mathrm{DC}} = w_t^{I} I_{i,t} + w_t^{F} F_{i,t} \) | **统一加权轮级信用** |
### 2.4 多轮策略优化中的训练稳定性
虽然 PPO [Schulman 等人 (2017)](https://arxiv.org/html/2607.11070#bib.bib66) 通过评论家网络自然支持多轮优化,但它需要一个单独的价值网络,并且没有利用组级展开进行行为探索。因此,我们专注于基于 GRPO 的方法,尽管现有方法在轮级信用分配方面仍面临挑战。MT-GRPO [Zeng 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib50) 将 GRPO 扩展到多轮场景,将结果和轮级奖励都纳入优势估计,但依赖于针对特定领域定制的启发式中间奖励。ProxMO [Fang 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib60) 通过基于邻近度的软聚合推导出步骤级基线,但在早期训练阶段成功率较低时会产生不稳定的学习信号。GiGPO [Feng 等人 (2025)](https://arxiv.org/html/2607.11070#bib.bib59) 和 HGPO [He 等人 (2026)](https://arxiv.org/html/2607.11070#bib.bib61) 分别通过锚点状态和分层上下文分组引入了步骤级分组。然而,这些方法依赖于识别跨轨迹重复或可比较的状态,这个假设在开放式文本交互环境中难以满足。相反,我们的方法利用了共享相同有害行为和轮次结构的展开,从而实现了基于轮次的组相对信用分配,而无需额外的价值网络或状态分组假设。相似文章
并非所有对话轮次都同等重要:多轮越狱中的信用分配
本文提出了 TRACE,这是一个基于强化学习的、具有对话轮次感知能力的多轮大语言模型(LLM)越狱攻击信用分配框架,声称在攻击成功率和防御对齐方面取得了显著提升。
LLM Guard 在 USENIX 2025 的多轮越狱测试中得了 0/8。以下是它被什么捕获了。
Arc Sentry 通过读取模型内部状态而非文本输出来检测类似 Crescendo 的多轮越狱,捕获了基于文本的监控器完全遗漏的攻击。
Latent Fusion Jailbreak: 混合有害与无害表征以诱发不安全的大语言模型输出
介绍Latent Fusion Jailbreak(LFJ),一种白盒攻击方法,通过混合大语言模型隐藏状态中有害提示与无害提示的表征,达到94.13%的攻击成功率。同时提出一种潜在对抗训练防御方法,将攻击成功率降低至12.37%。
语法约束解码可诱使大语言模型生成恶意代码
本文揭示,语法约束解码(GCD)可被利用为一种越狱攻击(CodeSpear),诱使大语言模型生成恶意代码,并提出一种防御方法(CodeShield),在此类攻击下仍能保持安全。
隐藏、重建与越狱:利用多模态大语言模型中的重建-隐藏权衡
本文分析了针对多模态大语言模型(MLLMs)的意图混淆越狱攻击中存在的重建-隐藏权衡问题。提出了感知隐藏的变体构建方法和与关键词相关的干扰图像,以更有效地利用模型漏洞。