优化对抗安全表征:激活引导的对抗性后缀与拒绝的几何结构

arXiv cs.LG 论文

摘要

本文介绍了激活引导的GCG和Soft-GCG方法,通过针对大语言模型内部的拒绝表征来优化对抗性后缀,实现了比标准GCG快33倍的加速,并揭示了分布式的安全机制。

arXiv:2607.08883v1 公告类型:新 摘要:大语言模型的行为对齐常常掩盖了脆弱的内部安全表征。近期研究表明,拒绝行为由激活空间中低维方向所介导。这引发了关于这些表征如何被结构化、定位以及被优化所利用的问题。我们研究了将对抗性后缀攻击作为表征对齐的探测手段。我们引入了激活引导的GCG,该方法用直接针对模型内部拒绝方向的损失替代了基于输出的目标。在多个目标变体中,我们发现全局抑制所有层和位置的拒绝比针对单个层-位置对更有效。这表明安全表征在前向传播中是分布式的,而非因果地定位于单一位置。我们进一步引入了Soft-GCG,它利用Gumbel-Softmax对离散后缀优化进行连续松弛。Soft-GCG实现了33 $\times$ 的加速,同时提高了攻击成功率。在多个模型规模上进行评估,我们发现较小的模型仍然易受攻击,而较大的模型在我们的计算资源受限设置下能够抵抗基于激活和后缀的攻击,这与更大且接受过更好安全训练的模型更难以被越狱的观察一致。总之,我们的结果阐明了当代模型中安全机制是如何被编码和破坏的。这些见解为设计更稳健和表征感知的对齐策略提供了具体指导。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:55

# 针对安全表示的优化:激活引导对抗后缀与拒绝机制的几何结构
来源:https://arxiv.org/html/2607.08883

###### 摘要

大型语言模型中的行为对齐常常掩盖了脆弱的内部安全表示。最近的研究表明,拒绝行为是由激活空间中的低维方向所介导的。这引发了一个问题:这些表示是如何结构化、定位,并被优化过程所利用的。我们研究对抗性后缀攻击作为表示对齐的一种探测手段。我们引入了激活引导的GCG,它用直接针对模型内部拒绝方向的损失函数取代了基于输出的目标。在多个目标变体中,我们发现全局抑制所有层和位置的拒绝比针对单个层-位置对更有效。这表明安全表示是分布在前向传播过程中的,而非因果地定位于单一位置。我们进一步引入了Soft-GCG,这是一种使用Gumbel-Softmax的离散后缀优化的连续松弛方法。Soft-GCG在提升攻击成功率的同时,实现了比标准GCG快33倍的速度提升。在跨模型规模评估时,我们发现较小的模型仍然脆弱,而较大的模型在我们计算资源受限的设置下能够抵抗基于激活和后缀的攻击,这与更大且安全训练更好的模型更难被越狱的趋势一致。综合来看,我们的结果阐明了当代模型中安全机制是如何编码以及如何被攻破的。这些见解为设计更鲁棒、更具表示感知能力的对齐策略提供了具体指导。

代码——github.com/Ege-Cakar/ImprovingGCG

## 引言

大型语言模型(LLMs)的广泛部署使得严格的安全对齐技术成为必要,以防止生成有害或不道德的内容。至少在公开聊天界面中,这些对齐技术似乎取得了显著进展。然而,最近的研究表明这些安全护栏出奇地脆弱。为了分析这种脆弱性,出现了两条不同的研究路线:对输入空间的自动化对抗攻击,以及模型残差流中拒绝表示的分析。由Zou等人(2023)提出的贪婪坐标梯度(GCG)方法,展示了优化对抗后缀可以可靠地绕过对齐。然而,GCG操作在一个行为代理上:它优化输入以最大化特定目标输出token的概率(例如,强制模型输出“当然,这里是……”)。尽管有效,但这个目标针对的是越狱的症状(输出logits),而非拒绝机制的本身。此外,GCG方法受到给定初始化条件和长等待收敛时间的限制。其离散优化方法与连续方法相比显著更慢,我们假设GCG执行的大部分优化可以先通过连续优化完成,而离散优化仅用于克服“投影差距”(即,在连续优化后从平滑连续空间跳转到离散token时所导致的性能损失,因为连续优化在真实token之间达到的最小值无法泛化到硬token上)。

相反,Arditi等人(2024)研究了模型内部对拒绝的表示。他们证明了开源聊天模型中的拒绝行为是由模型激活空间中一个单一的一维子空间所介导的,并且简单地消融这个方向就能消除拒绝行为。然而,这种方法受到攻击需要白盒访问模型激活这一限制。因此,在其纯粹形式下,它不能用于普通公众最广泛使用的闭源模型。这些结果提出了一个更深层次的问题:安全机制是如何在内部编码的,以及它们对优化的鲁棒性如何?如果拒绝行为是由少数高杠杆特征介导的,那么对齐可能在行为上成功,而在表示层面上仍然脆弱。在本文中,我们使用对抗后缀优化作为研究安全表示的诊断工具。我们的发现表明,当前的安全训练产生了几何上简单且可供基于梯度的优化访问的拒绝表示。我们做出了两个贡献:

- 我们引入了激活引导的GCG,它用直接最小化对内部拒绝方向投影的损失函数取代了基于输出的越狱目标。通过改变这些目标的空间和深度范围,我们凭经验探究了拒绝是局部编码还是全局编码。
- 我们引入了Soft-GCG,这是一种离散后缀优化的连续松弛方法,极大地降低了计算成本。这种松弛方法的有效性证明了投影差距问题可以通过在收敛过程中对提示的“连续性”进行退火来克服。

## 相关工作

### 对齐LLMs上的对抗攻击

对齐LLMs易受到对抗输入攻击的脆弱性已被广泛记录。早期的“越狱”依赖于手动提示工程(例如,“DAN”或角色扮演场景)(Shen等人,2023)。然而,Zou等人(2023)引入了一种形式化的、自动化的基于梯度的方法,称为贪婪坐标梯度(GCG)。GCG通过使用token级别的梯度来识别对抗后缀的有希望的候选替换,从而克服了文本优化的离散性。作为其公式的一部分,他们将针对提示x_{1:n}的对抗损失L定义为目标序列x^*_{n+1:n+H}的负对数概率:

L(x_{1:n}) = -log p(x^*_{n+1:n+H} | x_{1:n})。    (1)

对于对抗后缀中的每个token x_i,他们计算损失相对于独热编码e_{x_i}的梯度:

∇_{e_{x_i}} L(x_{1:n}) ∈ R^{|V|}。    (2)

然后,他们选择具有最大负梯度值的前k个候选,在前向传播中进行评估。他们证明了这种方法实现了高的攻击成功率(ASR),在足够多的迭代次数下,在Vicuna-7B上达到100%,在Llama-2-7B-Chat上达到88%。此外,他们还展示了这些攻击是可迁移的,这意味着在一个模型上优化的后缀通常可以攻破完全不同的黑盒模型。虽然GCG非常有效,但其计算成本极高。此外,它依赖于一个假设:强制输出前几个token决定了后续的生成轨迹。在本文中,我们旨在创建更有效的后缀来绕过拒绝,并使用连续优化来降低计算开销。

### 拒绝方向

与对抗攻击并行,研究人员试图使用通常与表示工程相关的技术来理解模型如何在内部表示拒绝。Arditi等人(2024)利用均值差方法在残差流中隔离出一个单一方向r̂(归一化差分向量),该方向区分了有害和无害指令。具体来说,他们定义:

r^{(l)} = μ^{(l)}_{harmful} - μ^{(l)}_{harmless}    (3)

其中μ^{(l)}表示第l层的平均激活。他们通过一种称为方向消融的技术验证了这一发现。方向消融通过从残差流激活x中投影出去除拒绝方向:

x' ← x - (x · r̂) r̂。    (4)

通过在每一层执行这种干预(或等效地,正交化模型权重),他们有效地禁用了拒绝。关键的是,Arditi等人(2024)将他们的权重正交化方法与GCG在HarmBench基准上直接进行了比较。他们发现他们的方法达到了相当或更优的攻击成功率(ASR),同时所需计算成本显著更低,因为它不需要针对每个提示进行优化。相反,他们证明,将这一方向添加到无害提示中(x' ← x + α r̂)会引发拒绝行为,即使对于像“列出瑜伽的好处”这样的良性查询也是如此(Arditi等人,2024)。他们的工作表明,安全微调并未消除有害知识,而是学习了一个特定的“拒绝特征”,该特征在激活时会覆盖生成过程。我们的结果证实了这一推测,并通过开发一种生成对抗后缀的方法,为其基于激活的方法增加了灵活性,该方法针对绕过拒绝方向进行优化。

### 连续提示优化

Wen等人(2023)提出了“硬提示变得简单”(PEZ),这是一种基于梯度的框架,旨在弥合连续嵌入空间和离散token序列之间的优化差距。他们的工作解决了软提示调优的最大局限性:虽然连续软提示更容易通过梯度下降进行优化,但如果在训练后简单地投影到最近的词汇邻居,它们通常无法映射到连贯或有效的离散token——作者将这种现象描述为“投影差距”。为了克服这一点,PEZ引入了一种方法,将离散化步骤直接集成到优化循环的前向传播中。该算法维护一组可学习的连续参数(软提示),但在计算损失之前将它们投影到嵌入矩阵中最近的离散邻居。从这种离散前向传播中得到的梯度随后用于更新底层的连续参数。这有效地允许优化器探索平滑、可微分的连续空间,同时不断与有效的离散流形保持联系,防止优化轨迹漂移到潜在空间中缺乏语义有效性的区域。凭经验,Wen等人证明了这种方法可以鲁棒地发现用于文本到图像生成(为Stable Diffusion反转CLIP编码器)和纯文本任务的有效硬提示。然而,在我们的测试中,他们的方法在越狱目的上表现不佳。

### 高效的越狱方法

最近有几种方法旨在降低自动越狱的计算成本。PAIR(Chao等人,2023)使用一个攻击者LLM根据目标模型响应迭代地改进对抗性提示,仅需要黑盒访问。TAP(Mehrotra等人,2023)通过思维树推理和剪枝扩展了这种方法,以实现更高效的探索。AutoDAN(Liu等人,2024)采用分层遗传算法来进化具有语义意义的越狱提示,实现了基于梯度的方法所缺乏的可解释性。这些方法用梯度信息换取查询效率和黑盒适用性。我们的Soft-GCG在这个设计空间中占据不同的位置:它保留了白盒梯度访问,但用连续优化取代了离散搜索,实现了与这些基于查询的方法互补的加速。

## 方法

### 激活引导的GCG

这种方法将GCG的基于梯度的优化框架与拒绝方向分析的机制性见解相结合。我们首先提取拒绝方向,然后使用这些方向通过新颖的基于激活的目标来指导对抗后缀优化,以期比基线GCG提升性能。基于激活的方法提供了两个潜在优势。首先,通过针对拒绝的因果机制(通过对比分析识别的内部方向),我们可能会发现比优化表面输出概率找到的更根本的对抗性扰动。其次,由于拒绝方向是在许多不同的示例上计算得出的,与可能过度拟合特定目标字符串的token级目标相比,激活目标可能更好地泛化到未见过的有害提示。

#### 拒绝方向提取

我们使用Arditi等人(2024)提供的预计算拒绝方向,该方向使用均值差方法(公式3)提取。通过选择能够最大化拒绝分数降低效果的候选方向(在有害提示上进行消融测试),选出最优层l^*=14和位置p=-1。选定的方向d_refusal作为我们攻击的优化目标。

#### 基于激活的对抗优化

标准GCG(Zou等人,2023)通过使用token的独热表示来计算token梯度(公式2)来优化对抗后缀。梯度跨多个提示聚合,具有最大负梯度的前K个token用于通过贪婪坐标下降生成候选后缀。我们采用相同的优化框架,但替换了优化目标。

#### 基于激活的目标函数

本工作的核心贡献是用直接针对内部拒绝表示的目标取代基于输出的损失(公式1)。每个基于激活的目标都可以被解释为关于拒绝表示结构的一个假设。单一目标评估拒绝是否因果定位于一个特定的层-位置对。层目标探测固定深度下跨token的空间局部性。Token目标探测固定位置下的深度局部性。全部目标测试拒绝是否全局分布在前向传播过程中。这些目标代表了局部-全局光谱中的不同设计选择:从针对单一激活,到抑制整个前向传播过程中的拒绝,并且它们具有显著不同的优化景观。比较这些目标的优化效率使我们能够评估安全表示在模型内部是如何结构的。

给定在层l^*和位置p处的拒绝方向d_refusal(通常为最后一个指令token),我们探索五个基于激活的目标,这些目标在范围和优化目标上有所不同:

- **单一**。在最具影响力的层和位置最小化投影:
  L_act^zero(x) = ( (h_p^{(l^*)}(x) · d_refusal) / ||d_refusal|| )^2   (5)
  其中h_p^{(l^*)}(x)是输入x = x_inst ⊕ x_adv在层l^*和位置p处的隐藏状态。

相似文章

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

arXiv cs.AI

This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。