通过拒绝别名缓解Abliteration
摘要
本文介绍了AMRA,一种权重编辑方法,通过模糊拒绝信号来缓解大型语言模型中的Abliteration,在Llama-3-8B和Gemma-2-9B上提升消融后的拒绝分数,同时最小化效用下降。
arXiv:2608.18093v1 公告类型:新
摘要:Abliteration,通过将权重矩阵投影到提取的拒绝方向的正交方向来移除大型语言模型中的拒绝能力,已成为一个突出的安全问题,因为它能够仅使用少量对比提示绕过训练后对齐。我们发现现有防御措施通常忽略了Abliteration的原因;即拒绝方向被提取的容易程度。为了阻碍这一过程,我们引入了一种权重编辑方法,通过对接流写入矩阵应用秩$k$更新来模糊拒绝信号,同时用随机别名替换拒绝诱导激活,并校正下游读取矩阵以保留模型原始行为。在Llama-3-8B上,AMRA将消融后的拒绝分数比无防御基线提高了$2.16$点,MMLU下降不到$0.5$个百分点。在Gemma-2-9B上,它将消融后的拒绝比基线提高了$14.70$点,同时保持有害输出率与基线相似,尽管效用成本更高。
查看缓存全文
缓存时间: 2026/08/20 09:54
# 通过拒绝别名缓解消除抵抗
来源:https://arxiv.org/html/2608.18093
###### 摘要
消除抵抗,即通过将权重矩阵投影到提取的拒绝方向正交来移除大语言模型拒绝能力的方法,因其能够仅使用少量对比提示词绕过后训练对齐而成为一个突出的安全隐患。我们发现现有防御措施普遍忽视了消除抵抗的根本原因——即拒绝方向被提取的容易程度。为阻碍这一过程,我们引入了一种权重编辑方法,通过对残差流写入矩阵应用秩-k更新来混淆拒绝信号,同时将引发拒绝的激活替换为随机别名,并修正下游读取矩阵以保持模型原始行为。在Llama-3-8B上,AMRA将消除抵抗后的拒绝得分比无防御基线提高了2.162.16分,而MMLU性能下降不足0.50.5个百分点。在Gemma-2-9B上,它将消除抵抗后的拒绝得分比基线提高了14.7014.70分,同时保持有害输出率与基线相当,尽管效用成本更高。
## 1 引言
大型语言模型(LLMs)在过去几年中使用量显著增加,公开展示其解决问题和普遍提升生活质量的能力。值得注意的是,其推理能力(Guo et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib2); Kojima et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib3))、遵循指令能力(Ouyang et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib33); Wei et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib4); Chung et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib5))以及泛化到分布外领域的能力(Sanh et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib6); Wang et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib7))直接导致其在医疗(Gaber et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib9))、安全(Jiang et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib11))、金融(Lin et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib8))和法律场景(Guha et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib12); Kant et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib13))中的使用增加。LLMs在高风险场景中的突出使用强调了安全部署和良性部署的必要性。
近期研究发现,无论经过何种后训练对齐,语言模型都易受黑盒越狱方法影响,许多方法利用对抗性提示词注入(Mehrotra et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib14); Wei et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib15))。当被攻破时,LLMs可能产生有害或无效信息,对安全和法律政策构成潜在威胁(Shi et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib50))。为缓解LLMs的滥用,大量研究致力于使模型与人类政策或宪法进一步对齐(Ouyang et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib33); Bai et al., 2022 (https://arxiv.org/html/2608.18093#bib.bib35)),方法通常包括额外微调(Wang et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib69); Rafailov et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib41))、推理时干预(Li et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib70); Lee et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib26))和机制可解释性方法(Ardit et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib1); O'Brien et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib45))。
更具体地说,通过机制可解释性,最近发现LLMs中的拒绝行为可以隔离到语言模型残差流激活空间中的低维线性方向(Arditi et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib1)),最终催生了消除抵抗——一种通过将权重矩阵投影到提取的拒绝方向正交来移除拒绝能力的越狱方法(FailSpy, 2026 (https://arxiv.org/html/2608.18093#bib.bib64); Weidmann, 2025 (https://arxiv.org/html/2608.18093#bib.bib16))。尤其值得注意的是,消除抵抗因其白盒修改而令人担忧,这些修改可以完全绕过后训练对齐,同时仅需少量对比提示词且无需额外训练。虽然现有防御措施提出了激活引导(Lee et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib26); Sheng et al., 2026 (https://arxiv.org/html/2608.18093#bib.bib29))和电路级干预(Zou et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib25))以增强拒绝,但均未明确解决拒绝方向提取本身。
因此,我们提出了通过拒绝别名缓解消除抵抗(AMRA),一种旨在混淆激活空间中拒绝向量的权重更新方法。具体而言,我们对在因果相关层写入残差流的矩阵应用秩-k更新,将引发拒绝的激活替换为低方差随机别名,同时修补下游读取矩阵以保留模型原始拒绝行为。我们在Llama-3-8B和Gemma-2-9B上验证了AMRA,表明它显著提高了对方向消除的鲁棒性,同时对Llama的效用损害极小,对Gemma则产生中等成本。据我们所知,AMRA是首个明确针对拒绝方向可提取性的事后权重编辑防御,旨在阻碍消除抵抗而无需额外微调(Shairah et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib71))。关键的是,我们的方法是一次性永久应用,混淆后无需额外计算。
重要说明:该工作主要面向语言模型开发者,为他们提供一种方法,在首次发布权重前保护新创建的LLM。能够访问未混淆原始模型的攻击者将使本方法失效,因为他们可以直接在未受保护的权重上使用消除抵抗技术。
## 2 方法
本节提供我们混淆方法的全面形式化分解。
### 2.1 Transformer 背景
仅解码器Transformer语言模型(Liu* et al., 2018 (https://arxiv.org/html/2608.18093#bib.bib20))包含一系列模块,通过连续读写残差流来更新初始嵌入表示(Vaswani et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib19); Elhage et al., 2021 (https://arxiv.org/html/2608.18093#bib.bib21))。从残差流“读取”或“分支”的显著权重矩阵包括注意力机制固有的Query、Key、Value矩阵,以及前馈(FFW)层的向上投影矩阵。我们后续将这些矩阵表示为:$W^{l}_{\text{in}}$。类似地,向残差流写入的矩阵,如多头注意力和FFW后的向下线性投影,表示为$W^{l}_{\text{O}}$和$W^{l}_{\text{out}}$。
### 2.2 层选择
#### 拒绝向量提取
许多现有越狱方法基于一个初始观察:Transformer语言模型的残差流空间中存在普遍的拒绝向量$r$(Vaswani et al., 2023 (https://arxiv.org/html/2608.18093#bib.bib19); Ardit et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib1); Lai, 2025 (https://arxiv.org/html/2608.18093#bib.bib17); Weidmann, 2025 (https://arxiv.org/html/2608.18093#bib.bib16))。为解除LLMs的审查(即移除其拒绝能力),权重矩阵被投影到与$r$正交(Arditi et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib1)),从而产生了“消除抵抗”(FailSpy, 2026 (https://arxiv.org/html/2608.18093#bib.bib64))。拒绝方向$r$的提取通常采用均值差异方法(EleutherAI, 2023 (https://arxiv.org/html/2608.18093#bib.bib18)),该方法包括收集有害和良性提示词每层激活的平均差异。遵循现有工作(Arditi et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib1)),我们给出如下形式定义:给定有害和良性提示词的数据集$\mathcal{D}_{\mathit{harmful}}$和$\mathcal{D}_{\mathit{benign}}$,我们计算输入提示词后第一个令牌位置上层$l \in \mathscr{L}$的平均有害激活$\mu^{l}$和平均良性激活$v^{l}$,通过:
$\mu^{l}=\frac{1}{\|\mathcal{D}_{\mathrm{harmful}}\|}\sum_{t\in\mathcal{D}_{\mathrm{harmful}}}\mathbf{x}^{l}(t),\quad v^{l}=\frac{1}{\|\mathcal{D}_{\mathrm{benign}}\|}\sum_{t\in\mathcal{D}_{\mathrm{benign}}}\mathbf{x}^{l}(t)$
此处,我们近似的每层拒绝向量通过以下方式计算:
$\boldsymbol{r}^{l}=\mu^{l}-v^{l}$
我们用$\hat{\boldsymbol{r}}^{l}$表示单位范数变体$\frac{\boldsymbol{r}^{l}}{\|\boldsymbol{r}^{l}\|_{2}}$,$\mathbf{x}^{l}(t)$表示当$t$作为提示词传入模型时权重矩阵$\mathbf{x}^{l}$的钩住激活。
#### 层选择
为找到与拒绝方向$\hat{\boldsymbol{\mathbf{r}}}^{l}$因果相关的Transformer层,我们首先计算每层的单位范数拒绝方向:$\{\hat{\boldsymbol{r}}^{\,l} \mid l \in \mathscr{L}\}$。对于每一层$l$,我们通过在保持其他层不变的情况下将其从残差流中消融来计算该向量对拒绝的影响。具体而言,给定层$l$,我们构建消融表示:
$\tilde{x}^{l}=x^{l}-\text{proj}_{\hat{r}^{l}}(x^{l})=x^{l}-\langle x^{l},\hat{r}^{l}\rangle\hat{r}^{l}$
然后,我们使用HarmBench(Mazeika et al., 2024 (https://arxiv.org/html/2608.18093#bib.bib51))通过对抗性提示词评估每次消融后模型的攻击成功率(ASR)。通过此方法被视为相关的层被组织成集合$\{\mathscr{L}^{\prime}\}$。
### 2.3 激活混淆
现有消除抵抗方法严重依赖于提取$\boldsymbol{\hat{\boldsymbol{r}}}^{l}$。为阻碍这一过程,我们提出通过一系列秩-k更新来更新向残差流写入的相关权重矩阵。如图1所示,我们更新矩阵,使得对于产生拒绝向量作为矩阵输出的倒数第二层激活,其被重写为输出一个随机且低方差的别名向量。
与现有工作类似(Lee et al., 2025 (https://arxiv.org/html/2608.18093#bib.bib26)),对于相关层$l$和写入矩阵$W^{l}\in\{W^{l}_{O},W^{l}_{\text{out}}\}\subseteq\mathbb{R}^{d_{\text{resid}}\times d_{\text{hidden}}}$(我们将模型或残差流维度表示为$d_{\text{resid}}$,与$d_{\text{hidden}}$区分开,后者通常描述子层(例如前馈、注意力和解嵌入)内写入矩阵直接之前的激活维度),我们将良性与有害提示词的末位令牌位置写入输出分别收集到$H^{l}_{+}, H^{l}_{-}\in\mathbb{R}^{n\times d_{\text{resid}}}$中,其中$n$表示样本量,$d_{\text{resid}}$表示残差流维度。
随后,我们通过对均值中心化激活$\bar{\{H\}}^{l}_{-}$和$\bar{\{H\}}^{l}_{+}$的差异应用主成分分析(PCA)来定位候选拒绝方向。更具体地说,我们最初对$H^{l}_{\text{diff}}=\bar{\{H\}}^{l}_{-}-\bar{\{H\}}^{l}_{+}$执行奇异值分解:
$H^{l}_{\text{diff}}=U\Sigma V^{\top}$
其中$U$和$V$分别包含$(H^{l}_{\text{diff}})(H^{l}_{\text{diff}})^{\top}$和$(H^{l}_{\text{diff}})^{\top}(H^{l}_{\text{diff}})$的单位范数特征向量。通过此构造,$V$的列代表$H^{l}_{\text{diff}}$的主成分。这些向量根据在给定层中它们在拒绝相关激活空间中捕获的方差量进行排序:
$\{v^{l}_{1},v^{l}_{2},v^{l}_{3}\cdots v^{l}_{n}\}\subseteq\mathrm{Col}(V)$
然后,我们通过对$W^{l}\in\mathbb{R}^{d_{\mathrm{resid}}\times d_{\mathrm{hidden}}}$进行秩-$k_w$加法更新来产生随机激活,以替代先前的拒绝引发方向。
$\tilde{W^{l}}=W^{l}+(A-R)^{\top}R W^{l}$
此处,$R\in\mathbb{R}^{k_w\times d_{\mathrm{resid}}}$包含$V$的前$k_w$列向量,或相应地,$H^{l}_{\text{diff}}$的前$k_w$个主成分。我们从$A\in\mathbb{R}^{k_w\times d_{\mathrm{resid}}}$中减去$R$,其中每个行向量$A_{i}\sim\mathcal{N}(0,\varepsilon^{2}I)$。直观地说,如果$\tilde{W}^{l}$接收到映射到我们所选前k个拒绝主成分所跨越子空间的向量中的输入,它则被映射到一个随机别名向量。值得注意的是,如图2所示,我们选择的$\varepsilon$和$l$直接影响引入残差流的污染量。
我们承认,秩-k更新在$\tilde{W}^{l}$的输入产生与$R$对齐的激活时效果最佳。但这在实践中相对少见。激活可能仅与$R$轻微对齐,意外地在下游计算中传播噪声。然而,在第3节中,我们表明在最优的$\varepsilon$和$k_w$下,这些更新在显著巩固拒绝能力以抵御消除抵抗的同时,对模型质量的损害最小。
图2:残差流偏移。此处,我们展示了对写入矩阵$W^{l}_{\text{out}}$进行秩一($k_{w}=1$)更新对后续残差流表示的影响。具体来说,我们比较了16个提示词上权重矩阵更新前后的平均残差流值。(a)显示L2差异,(b)显示残差流方差的变化,(c)显示编辑前后的残差流余弦相似度。
上图:对第20层$\varepsilon$的扫描。下图:相似文章
新型消融算子 (apostate)
介绍了一种名为apostate的新型对比消融算子,该算子将模型拒绝率从96%降低至5%,同时仅以0.081 KL散度保留无害行为,已在Granite 3.3-8B上测试。
OBLITERATUS/Gemma-4-12B-OBLITERATED
OBLITERATUS 发布了 Gemma-4-12B-OBLITERATED,这是首个消融模型,实现了零拒绝且无基准回归,采用了一种新颖的两阶段手术流水线用于对齐研究。
保范Abliteration应用于Qwen3.6-35B-A3B:0%拒绝率,基准测试性能完整,开源数据集
对Qwen3.6-35B-A3B应用保范Abliteration技术,实现0%拒绝率,基准测试性能保持不变,并发布了开源数据集。
新版abliteration工具Apostate与其他工具相比如何? - Abliterlitics
对三种abliteration工具——Apostate、Heretic和Huihui——应用于Qwen 2.5 7B的详细比较,显示它们都能有效移除拒绝行为,且性能下降极小。
AWARe:通过激活加权自适应保留缓解灾难性遗忘
AWARe是一种微调方法,通过基于激活模式选择性地冻结重要参数,在适应下游任务的同时保留上游能力,从而缓解多模态大语言模型中的灾难性遗忘。