通过组合界限与安全持久性实现LLM安全的经认证多轮鲁棒性

arXiv cs.AI 论文

摘要

本文介绍了多轮经认证鲁棒性(MTCR),一个通过组合方法和安全持久性提供更紧界限来认证大型语言模型针对多轮越狱攻击安全性的框架。

arXiv:2608.20820v1 Announce Type: new 摘要:大型语言模型(LLMs)容易受到多轮越狱攻击,这些攻击会逐步操纵对话上下文。现有的经认证鲁棒性方法仅限于单轮输入;朴素的多轮组合会产生随轮次增加而指数级退化的界限。我们介绍了多轮经认证鲁棒性(MTCR),一个通过状态对抗马尔可夫决策过程(MDPs)建模对话安全性的框架,并将$k$轮经认证鲁棒性定义为$k$个对抗轮次中最坏情况的安全概率。MTCR包括:(i)通过嵌入空间模式分解的组合认证,产生比朴素乘法更紧的经认证下界;(ii)$(\alpha,\beta)$-安全持久性,将退化率从$\underline{p}^{k}$改进到$\beta^k$(其中$\beta > \underline{p}$)并产生可解释的范围估计;(iii)匹配的信息论上界以建立紧性;(iv)一个结合这些结果的统一算法。在六种LLM上进行的$\epsilon$-有界和Crescendo风格攻击实验表明,经验安全性始终超过经认证界限。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:26

# 基于组合边界与安全持久性的多轮会话大语言模型安全认证  
来源:https://arxiv.org/html/2608.20820  

**作者信息**  
Bin Chong(通讯作者)  
机构:北京大学  
邮箱:[email protected]  

Wenkai Yang  
机构:中国人民大学  

Shuai Zhang  
机构:清华大学  

Yancheng Chen  
机构:中国科学院大学  

Feiyu Han  
机构:中国科学院大学  

Guo Zhen  
机构:腾讯混元  

Cheng Zhang  
机构:腾讯混元  

Huaibing Xie  
机构:腾讯混元  

Changze Lv  
机构:腾讯混元  

Shihan Dou  
机构:腾讯混元  

Pluto Zhou  
机构:腾讯混元  

---

### 摘要  
大语言模型(LLMs)易受多轮越狱攻击的影响,此类攻击会逐步操纵对话上下文。现有经认证的鲁棒性方法仅限于单轮输入;简单地进行多轮组合会导致边界随轮数呈指数级衰减。我们提出了**多轮认证鲁棒性(MTCR)**框架,该框架通过状态对抗马尔可夫决策过程(SA-MDPs)对会话安全进行建模,并定义了**k轮认证鲁棒性**为k个对抗轮次下的最坏情况安全概率。MTCR包含:(i) 通过嵌入空间模式分解实现组合认证,其所得认证下界优于简单乘积组合;(ii) **(α,β)-安全持久性**,将衰减率从 p̄^k 改善至 β^k(其中 β > p̄),并给出可解释的视界估计;(iii) 匹配的信息论上界以确立紧致性;(iv) 结合上述结果的统算法。在六个大语言模型上的实验表明,面对ε-有界攻击与渐强式(Crescendo)攻击,实证安全性始终超过认证边界。

## 1 引言  
大语言模型在对话应用中的部署引发了安全担忧,尤其是**越狱攻击**:精心构造的输入旨在绕过安全机制并诱导有害内容(Zou等,2023;Wei等,2023)。尽管在防御单轮攻击方面已取得显著进展,但**多轮越狱攻击**(通过多次交互逐步操纵对话上下文)构成了独特挑战(Russinovich等,2025;Li等,2024)。近期实证研究揭示了这一威胁的严重性:Crescendo攻击(Russinovich等,2025)使用不超过10轮即可对生产环境大语言模型实现近乎完全的成功率;X-Teaming(Rahman等,2025)针对最先进模型达到96-98%的成功率;人类红队测试者针对已部署防御持续保持超过70%的成功率(Li等,2024)。这些发现表明**对单轮攻击鲁棒的防御在多轮场景中保护有限**。  

理论层面,现有经认证的鲁棒性方法(随机平滑(Robey等,2023)、擦除与检查(Kumar等,2023)、基于背包问题的认证(Chen等,2025))均限于单输入场景。简单扩展会导致认证下界随轮数指数衰减:若每轮最坏情况认证安全概率为p,则k轮乘积组合的边界仅为p^k,当k适中时该值可忽略不计。此衰减源于:自适应对手观察响应并构造后续输入(序列博弈);累积上下文加剧对抗影响;自回归生成放大早期词元扰动。  

#### 贡献  
我们开发了**多轮认证鲁棒性(MTCR)**认证框架,其理论基础为SA-MDP,贡献如下:  
(1) 将多轮对话建模为状态对抗MDP并定义k轮认证鲁棒性。通过嵌入空间模式分解开发组合认证:分别认证模式内安全与模式间转移,所得边界优于简单乘积组合(推论3.2)。统算法(算法1)结合组合边界与持久边界,计算实际认证保证。  
(2) 形式化**(α,β)-安全持久性**,此结构性质将鲁棒性边界从 p̄^k 改善至 β^k(当β > p̄时),并通过线性表达式 1-k(1-β) 提供可解释的视界估计(定理3.5)。我们证明了信息论上界,表明对于非重叠分解组合方法具有紧致性,并给出缺乏结构性假设系统的不可行性结果。  
(3) 在六个生产环境大语言模型上评估MTCR。认证边界提供针对ε-有界对手的形式保证;在静态(ε-球)与Crescendo式自适应攻击下,实证安全性始终超过边界,验证实践中边界未被违反。  

图1:MTCR概述。左:多轮对话建模为SA-MDPs;简单边界p̄^k指数衰减。中:MTCR结合组合认证(模式内+转移安全)与(α,β)-持久性形成统一边界。右:匹配的上界确立紧致性(κ=1)。六个大语言模型的实验表明实证安全性超过认证边界。

## 2 问题表述:基于SA-MDP的多轮安全性  
我们将多轮对话建模为状态对抗马尔可夫决策过程(SA-MDPs)。对话历史 h_t=(u_1,r_1,...,u_t,r_t) 通过嵌入 φ(如LLM隐藏表示)映射为会话状态 s_t=φ(h_t)∈S⊆ℝ^d。对手从参考输入的ε-扰动球 B_ε 中选择用户消息 u_t;LLM根据策略 π(·|s,u) 响应。状态演变为 s_t=T(s_{t-1},u_t,r_t)。安全谓词 Safe:S→{0,1} 将状态空间划分为安全区域 S_+ 与不安全区域 S_-,安全裕度 Δ(s)=dist(s,S_-)。假设 S 有界,S_+ 为开集(故对所有 s∈S_+ 有 Δ(s)>0),且 S_+ 具有非空内部,δ_min 表示最大内切球半径。完整形式化定义见附录B。  

#### 定义1(k轮认证鲁棒性)  
给定初始状态 s_0∈S_+、LLM策略π、扰动预算ε、视界 k∈ℕ,k轮认证鲁棒性 ρ_k(s_0,π,ε) 为:  
\[
\inf_{\nu\in\Pi_\epsilon}\mathbb{P}_{\substack{u_t\sim\nu(\cdot|s_{t-1})\\ r_t\sim\pi(\cdot|s_{t-1},u_t)}}\left[\bigwedge_{t=1}^k\mathsf{Safe}(s_t)\,\bigg|\,s_0\right],
\]  
其中状态按 s_t=T(s_{t-1},u_t,r_t) 演化。ρ_k(s_0,π,ε) 捕获在k轮中对抗任何自适应对手(在选择u_t前观察s_{t-1})保持安全的最坏情况概率。  

自然的认证策略是乘积组合单轮安全边界。对每个状态s,令 p(s,ε)=\inf_{u∈B_ε}ℙ[\mathsf{Safe}(T(s,u,r))] 表示经历一轮对抗后保持安全的认证概率。此组合产生以下边界。  

#### 命题2.1(简单乘积边界)  
对任意 s_0∈S_+:  
\[
\rho_k(s_0,\pi,\epsilon)\geq\left(\inf_{s\in\mathcal{S}_+}p(s,\epsilon)\right)^k=\underline{p}^{\,k},
\]  
其中 \underline{p}=\inf_{s∈S_+}p(s,ε) 为最坏情况单轮认证安全概率。若 \underline{p}<1,此边界随k指数衰减至零。  

#### 示例2.2(简单边界的空洞性)  
设单轮安全 \underline{p}=0.95:ρ_10≥0.60,ρ_20≥0.36,ρ_50≥0.08。对于要求 ρ_k≥0.9 的安全关键应用,仅允许最多 k≤2 轮。  

#### 认证范围  
认证保证适用于约束在参考输入ε-球内的对手(如字符级编辑距离)。实际攻击如Crescendo在语义层面操作;虽然我们报告针对此类攻击的实证安全性,但**形式认证**仅覆盖ε-有界扰动。SA-MDP框架对扰动度量无关,一旦兼容的单轮认证预言机可用,即可扩展至更丰富的威胁模型。  

缺乏额外结构时,乘积组合对超出几轮的对话提供甚微的实际保证。这促使我们寻找可达成更紧边界的结构性条件。

## 3 多轮认证鲁棒性  
我们通过利用嵌入空间模式结构与安全裕度演化,将单轮认证扩展至多轮对话。框架包含四部分:通过模式分解的组合边界(§3.1)、描述裕度演化的安全持久性(§3.2)、确立紧致性的信息论上界(§3.3)以及统算法(§3.4)。

### 3.1 组合认证  
对话在嵌入空间表现出可被利用以实现更紧认证的**模式结构**。模式分解 M={m_1,...,m_M} 覆盖 S_+,重叠度 κ=max_s|{i:s∈S_{m_i}}|。对每个模式 m 定义模式内认证安全 ρ_m^{in}(ε)(保持安全且位于 m 内的最坏情况概率),对转移图中边 (m_i,m_j) 定义转移安全 ρ_{i→j}^{tr}(ε)。模式轨迹σ在k轮中有 n_j(σ) 个模式内轮次位于 m_j,τ(σ) 次转移。完整定义见附录B。  

#### 定理3.1(组合认证边界)  
设 M={m_1,...,m_M} 为重叠度 κ=κ(M) 的模式分解。对任意具有模式轨迹 σ∈Σ_k(M) 的k轮对话:  
\[
\rho_k(s_0,\pi,\epsilon)\geq\frac{1}{\kappa}\cdot\prod_{j=1}^M\left(\rho_{m_j}^{in}(\epsilon)\right)^{n_j(\sigma)}\cdot\prod_{(i,j)\in\mathrm{Trans}(\sigma)}\rho_{i\to j}^{tr}(\epsilon)
\]  
其中 Trans(σ)={(σ(t),σ(t+1)):σ(t)≠σ(t+1)} 为转移多重集。对可行轨迹取下确界:  
\[
\rho_k(s_0,\pi,\epsilon)\geq\frac{1}{\kappa}\cdot\inf_{\sigma\in\Sigma_k(M,s_0)}\left[\prod_{j=1}^M\left(\rho_{m_j}^{in}\right)^{n_j(\sigma)}\cdot\prod_{(i,j)\in\mathrm{Trans}(\sigma)}\rho_{i\to j}^{tr}\right]
\]  
其中 Σ_k(M,s_0)⊆Σ_k(M) 为从包含 s_0 的模式出发的轨迹。  

#### 推论3.2(相对简单组合的改进)  
设 \underline{p}=\inf_s p(s,ε) 为简单单轮边界。假设模式分解满足:  
1. 模式内安全:ρ_m_j^{in}≥1-δ(小 δ>0)  
2. 模式间转移安全:ρ_{i→j}^{tr}≥γ(某 γ∈(0,1))  
3. 稀疏转移:轨迹σ最多有τ次转移  
则组合边界为:  
\[
\rho_k^{comp}\geq\frac{1}{\kappa}(1-\delta)^{k-\tau}\cdot\gamma^{\tau}
\]  
当满足以下条件时超越简单边界 \underline{p}^k:  
\[
\tau<\frac{(k\ln(1/\underline{p})-\ln\kappa)\ln(1/(1-\delta))}{\ln((1-\delta)/\underline{p})}.
\]  
此条件易于满足:对 k=10、κ=2、\underline{p}=0.95、δ=0.01、γ=0.99,仅需 τ<10·ln(0.95^{-1})/ln(0.99/0.95)≈10·0.0513/0.0408≈12.6,而最坏情况下 τ≤10。

### 3.2 (α,β)-安全持久性  
安全裕度 Δ(s)=dist(s,S_-) 度量状态s距不安全区域的距离。**安全持久性**描述裕度在对抗轮次中的演化:若系统满足 (α,β)-安全持久性,则对所有 s∈S_+ 且 Δ(s)>0,有  
\[
\mathbb{P}_{u\sim\nu,\,r\sim\pi}\!\left[\begin{gathered}\mathsf{Safe}(s')=1\\ \land\ \Delta(s')\geq(1-\alpha)\Delta(s)\end{gathered}\right]\geq\beta
\]  
其中 s'=T(s,u,r),ν∈Π_ε 为任意对抗策略。概率至少为 β 时,安全裕度每轮保留其先前值的 (1-α) 比例;对齐良好的LLM通常满足此性质。  

在安全持久性下,我们得到以下保证。  

#### 定理3.5(安全持久性下的衰减)  
假设系统展现 (α,β)-安全持久性。设 s_0∈S_+ 具有初始裕度 Δ_0=Δ(s_0)>0。则:  
\[
\rho_k(s_0,\pi,\epsilon)\geq\beta^k
\]  
当 β>\underline{p}(即持久性保证超过最坏情况单轮边界)时,有 β^k>\underline{p}^k,严格改进简单边界。此外,并集边界给出可解释(数值较弱)的特征:  
\[
\rho_k(s_0,\pi,\epsilon)\geq1-k(1-\beta)
\]  
此公式提供安全性充分条件:系统在 (k_{max},α,β) 持久系统中保持安全,其中 k_{max}=⌊1/(1-β)⌋。

相似文章

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

MJ: 基于分解信用分配的多轮LLM越狱

arXiv cs.CL

本文提出了DC-GRPO,一种面向多轮LLM越狱学习的回合级信用分配框架,在多个基准测试中实现了超过98%的攻击成功率,优于现有方法。