诱骗方向优化:针对LLM消融攻击的后置防御

arXiv cs.LG 论文

摘要

诱骗方向优化 (DDO) 是一种快速、后置的防御方法,通过向网络注入诱骗信号,保护开放权重的LLM免受拒绝特征消融攻击,在比训练防御更低的成本下实现高鲁棒性。

arXiv:2609.16204v1 公告类型:新 摘要:开放权重的语言模型中的安全护栏可以使用拒绝特征消融 (RFA) 轻松绕过,这是一种从残差流中识别并投影线性拒绝方向的技术,通常在保持模型能力的同时实现高攻击成功率 (ASR)。防御这些攻击通常需要为每个新检查点进行计算昂贵的安全微调。我们引入诱骗方向优化 (DDO),这是一种快速、后置的权重编辑防御方法,无需基础模型微调。我们的方法基于一个简单的机制洞察:消融攻击依赖对比估计器来找到拒绝方向。与其试图隐藏真正的拒绝电路,DDO 主动向网络的 MLP 神经元注入高幅度、非线性的诱骗信号。当攻击者试图定位拒绝方向时,诱骗信号会破坏他们的估计器,诱使他们消融一个无害的正交特征,而实际的安全机制保持完整。我们证明了形式化此效果的频谱界限,并在六个模型家族上评估了 DDO,在标准 RFA 下实现了 <10% 的 ASR。在 Llama-3-8B-Instruct 上,DDO 在自适应多阶段攻击下与训练防御相当(65% 对比 58% 最坏情况 ASR),并将 Heretic 权重级攻击 ASR 从 88.7% 降低到 18%,所有这些每配置的优化成本比训练基线低 30 到 450 倍。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:44

# 诱骗方向优化:针对LLM消融的事后防御手段  
来源:https://arxiv.org/html/2609.16204  
Mona T\. Diab  
Virginia Smith  
隶属机构:卡内基梅隆大学  

###### 摘要  
开源权重语言模型的安全防护机制可通过**拒绝特征消融**(RFA)技术被轻易绕过。该技术通过识别并投影去除残差流中的线性*拒绝方向*,常能在保持模型能力的同时实现高攻击成功率(ASR)。防御此类攻击通常需要针对每个新模型检查点进行计算成本高昂的安全微调。我们提出**诱骗方向优化**(DDO),一种快速、事后权重编辑的防御方法,无需对基础模型进行微调。我们的方法基于一个简单的机制洞察:消融攻击依赖对比估计量来定位拒绝方向。与其试图隐藏真实的拒绝电路,DDO 主动向网络的 MLP 神经元注入高幅度、非线性的*诱骗*信号。当攻击者试图定位拒绝方向时,诱骗信号会污染其估计量,使其误将一个无害的正交特征消融,而真正的安全机制得以完好保留。我们证明了该效应的谱界限,并在六个模型家族上评估了 DDO,实现了低于10%的标准RFA攻击成功率。在 Llama-3-8B-Instruct 上,面对自适应多阶段攻击,DDO 表现与训练过的防御方法相当(最差情况ASR为65%对比58%),并将 Heretic 权重级攻击的ASR从88.7%降低至18%,且其每配置的优化成本比训练基线低30–450倍。  
代码:https://github.com/aashiqmuhamed/defending-against-abliteration  

## 1 引言  
拒绝有害请求的能力是通过偏好微调对齐的指令调优LLM的核心安全机制。移除开源模型的拒绝能力可能助长滥用,增加化学、生物、放射性和核(CBRN)能力提升、网络攻击生成以及制作儿童性虐待材料(CSAM)等风险,使得拒绝鲁棒性成为一个紧迫的安全问题。然而,在开源模型设置下,安全机制是脆弱的:白盒攻击者可以修改发布的检查点及其推理代码,得到一个在保持能力的同时移除了拒绝功能的模型。先前研究表明,拒绝功能通常由低维残差流特征介导,这使得无需训练的攻击(如拒绝特征消融,也称为abliteration)成为可能。这类攻击通过估计有害和安全激活之间的均值差(DIM)方向并在推理时将其投影去除。由此产生的检查点通常具有高*攻击成功率*(ASR;即有害提示被判定为服从),且已有数千个此类无审查变体被公开托管。  

> 图示:DDO 与现有针对 RFA 的防御方法对比。  
> 无任何防御时,RFA 可零训练成本移除开源模型的拒绝功能(顶行)。训练过的安全防御方法(如电路断路器、LAT、ReFAT、RepBend)能在 RFA 下保持拒绝功能,但需要训练数据、多GPU微调以及昂贵的按方法超参数搜索(中行)。DDO 以低30–450倍的成本达到相当的标准RFA鲁棒性:仅需单GPU、两分钟、无需训练数据,且基础权重保持冻结(底行)。  

现有的移除拒绝功能的防御方法主要是在训练时进行干预。电路断路器通过表示重路由目标微调检查点;LAT 和 ReFAT 对抗性地训练以抵御潜在/特征空间攻击;RepBend 和基于三元组的目标在训练期间重塑表示几何。这些方法可能非常有效,但它们需要安全微调,并且必须对每个新检查点重复进行。根据具体方法,它们还可能需要特定方法的训练数据或攻击流程以及超参数调优。此外,先前的工作并未评估这些防御在面对自适应多阶段RFA或自动化权重级攻击(如Heretic)时的表现;我们将在更强的攻击阶梯下进行评估。鉴于开源模型检查点的快速发布节奏,以及证据显示前沿开源模型在能力基准测试上可能落后于闭源最先进模型数月,针对每个检查点进行再训练难以持续;因此,我们寻求低成本、可组合、轻量数据的事后安全强化工具。  

我们提出**诱骗方向优化**(DDO),一种事后防御方法,它针对攻击者的估计量而非拒绝特征本身,且无需昂贵的微调。DDO 重新利用低影响的 MLP 神经元来实现一个门控的读-写映射:在有害提示上,这些神经元*读取*拒绝坐标,并在与拒绝方向正交的方向上*写入*大幅更新,从而诱导一个由诱骗主导的对比,使 DIM 估计产生偏差,导致 RFA 消融的是诱骗信号而非因果拒绝子空间。我们证明了一个子空间重叠界限,并将其特化应用于正交诱骗(定理2):足够强的诱骗模式限制了对比攻击与因果拒绝子空间的重叠程度。此类模式的数量定义了*有效诱骗秩*,该指标也用于诊断性地解释自适应重估计预算。  

实证上,DDO 能够在约2分钟、单A100 GPU的优化运行中,将六个模型家族的标准RFA ASR降低至低于10%。DDO 在标准 RFA 上以低30–450倍每配置成本匹配或超越训练基线(图1)。在 Llama-3-8B-Instruct 上,面对自适应多阶段 RFA,DDO 的性能衰减与训练防御方法相当(最差情况 ASR 65% 对比最佳训练基线的58%),同时保持连贯的生成(MT-Bench≥5.82),并将 Heretic ASR 从88.7%降低至18%(200次试验)。  

我们的贡献包括:  
(i) 我们引入了 DDO(诱骗方向优化),据我们所知,这是首个无需基础模型微调的、针对拒绝特征消融的事后防御方法。DDO 重新利用一小部分*低影响* MLP 神经元来注入门控的、与拒绝方向正交的诱骗方向,从而污染对比性拒绝估计量。该防御被编译进权重,不产生架构或运行时开销。  
(ii) 我们证明了子空间重叠界限(定理1和定理2),将攻击者-拒绝重叠度与对比矩阵联系起来,对于 DDO,还与其经验诱骗响应矩阵的谱相关。由此产生的有效诱骗秩表征了对固定对比攻击的保护能力,并有助于解释自适应阶段预算。关于最优谱分配的推论(推论3)为多方向诱骗提供了一个具体的设计原则:在固定诱骗能量预算下,将能量均匀分布在 k 个方向上可以最大化第 k 个奇异值,从而增强对秩为 k 的对比消融的保证。  
(iii) 我们在三级无训练攻击阶梯(标准 RFA、自适应多阶段 RFA 和 Heretic)下进行了广泛评估,包括与训练防御方法的直接比较和跨架构机制消融。在 Llama-3-8B-Instruct 上,DDO 将标准RFA ASR 从85%降低至1.8%,同时保持良性服从性,以低30–450倍每配置成本实现了与最强训练基线相当的性能。在六个模型家族上,DDO 无需基础模型微调即可实现低于10%的标准RFA ASR。  

> 相关工作补充:除了秩-1拒绝特征攻击,近期研究表明拒绝几何可能是多维的,例如概念锥、多个中介方向、正交安全维度以及可分离的有害性/拒绝表示,这促使我们进行了多阶段自适应攻击评估。先前的模型级RFA防御需要针对每个检查点使用任务特定数据进行安全微调,并需要完整的模型反向传播;而 DDO 冻结所有基础权重,仅优化一小部分诱骗参数,从而能够实现无需推理开销的事后强化。我们还评估了提示级越狱攻击(如 GCG、PAIR、AutoDAN),这些攻击与 RFA 利用的相同拒绝特征相关。更详细的相关工作见附录B。  

## 2 威胁模型与攻击  
我们研究开源发布设置下的拒绝鲁棒性:防御者对检查点应用 DDO 并仅发布加固后的模型;攻击者则获取防御权重,试图在保持通用能力的同时移除拒绝功能。我们的威胁模型针对的是主导开源模型篡改的自动化、无需训练的无审查流程。低门槛途径并非安全遗忘或对抗性微调,而是对发布的检查点应用公开的abliteration或权重编辑工具。  

我们建模一个*资源受限、白盒且自适应*的攻击者,该攻击者能够检查发布的权重、运行任意推理代码、在有害和良性探测提示上收集激活、在推理时修改激活,并应用事后权重编辑。遵循 Kerckhoffs 原则,攻击者知道应用了 DDO 并可以相应调整其脚本,但无法访问原始的 DDO 前检查点,也不进行基于梯度的微调。这捕捉了 DDO 所针对的平台侧风险:模型提供商、托管平台或下游分发者可能会在发布前加固检查点,但不能假设下游用户不会尝试移除安全防护机制。  

攻击者的目标是*能力保持型拒绝移除*:在保持连贯生成的同时,最大化有害提示的 ASR。由于 ASR 可以通过破坏模型质量而被人为降低,我们结合效用指标(MT-Bench、MMLU、XSTest)来评估鲁棒性。  

我们通过三级无训练攻击(表1)来操作化这个威胁模型,这构成了一个在事后、无需微调的框架内攻击者复杂度递增的阶梯。  

> 表1:按级别划分的攻击面。这三个级别探测了互补的攻击通道。  

#### 标准 RFA。  
攻击者估计每层的均值差(DIM)方向,并将其从残差流中投影去除。令 ℓ 层的残差流状态为 h_ℓ ∈ ℝ^d。攻击者计算 d_ℓ ≜ E[h_ℓ|harm] - E[h_ℓ|safe], d̂_ℓ ≜ d_ℓ / ||d_ℓ||_2(对于非零 d_ℓ),并应用 h_ℓ ← (I - d̂_ℓ d̂_ℓ^⊤) h_ℓ。我们保留 r̂_ℓ 表示防御者的参考拒绝方向,d̂_ℓ 表示攻击者在发布模型上的估计。我们在 JailbreakBench 和 HarmBench 上评估了*三点*和*残差流*变体(附录F.1)。  

#### Heretic。  
Heretic 是一个全自动化的权重级拒绝移除工具,它应用 Optuna 优化的低秩投影到注意力输出 W_o 和 MLP 下投影 W_down:W_ablated = W - α(ℓ) d̂ (d̂^⊤ W),其中 d̂ 是搜索到的消融方向,α(ℓ) 是搜索到的每层消融强度。它生成一个修改后的检查点,且无需机器学习专业知识。我们报告 H-200 作为 200 次 Optuna 试验中的最大 ASR 试验(附录F.1)。  

#### 自适应多阶段 RFA。  
为了建模一个在观察到防御检查点后进行适应的攻击者,我们引入了一个迭代变体。在阶段 t,攻击者在所有先前阶段的消融生效的情况下,计算一个新的 DIM 向量 d_ℓ^(t),然后移除其沿先前选定方向的分量:v_ℓ^(t) = d_ℓ^(t) - Σ_{j=1}^{t-1} ⟨d_ℓ^(t), d̂_ℓ^(j)⟩ d̂_ℓ^(j),然后归一化 d̂_ℓ^(t) = v_ℓ^(t) / ||v_ℓ^(t)||_2(当 v_ℓ^(t) ≠ 0 时;否则设 d̂_ℓ^(t) = 0 且不添加新方向)。攻击者同时消融所有累积的方向,每层最多提供秩为 t 的消融。贯穿全文,t 索引自适应阶段,k 表示攻击秩,K 表示诱骗读取器组的数量。  

## 3 方法:诱骗方向优化(DDO)  
我们考虑使用 SwiGLU/GeGLU MLP 的标准预归一化解码器仅 Transformer(附录C)。令 ℓ 层的残差流状态为 h_ℓ ∈ ℝ^d,注意力残差为 h_ℓ^{attn}。

相似文章

鲁棒批评者:防御LLMs免受多轮攻击

arXiv cs.AI

本文提出对话批评者引导采样(DCGS)框架,通过从对话历史推断用户意图,并利用基于价值/遗憾的批评者对回复进行评分,在不进行微调的情况下提高鲁棒性,从而防御LLMs免受多轮对抗性攻击。

面向鲁棒即插即用适配的解耦对齐

arXiv cs.CL

介绍了一种无需训练的方法,通过知识蒸馏和模型融合来增强LLMs的安全对齐,以防止影子对齐,在有害问题数据集上将防御成功率提高了14.42%,且不影响性能。

偏好后训练中多样成功轨迹的直接多样性优化

arXiv cs.CL

直接多样性优化(DDO)是一种离线后训练方法,它改进了用于序贯决策任务的大语言模型(LLM)代理的成功策略覆盖,并在基准测试(如BabyAI、BabaIsAI和WebShop)中优于其他方法。

强制延迟:在多模态LLM级联中操纵路由决策

arXiv cs.AI

本文介绍了强制延迟攻击(FDA),一种对抗性图像攻击,通过操纵多模态LLM级联中的置信度分数,导致查询不必要地路由到更强(更昂贵)的模型,从而在不降低答案正确性的情况下将计算成本转移给提供商。

DECOR:基于信息操纵理论审计LLM欺骗行为

arXiv cs.CL

介绍了DECOR,一个基于信息操纵理论的多智能体框架,用于细粒度审计LLM回应中的策略性欺骗,在15个前沿模型的欺骗检测基准测试中取得了最先进的性能。