定位安全对齐:MLP层与网络中段模块编码大语言模型中的拒绝行为

arXiv cs.AI 论文

摘要

本文通过将权重从对齐模型移植到未对齐模型,研究安全对齐在大语言模型中的编码位置。研究发现,MLP层,尤其是网络中段模块(第8-11层),主要驱动拒绝行为,并且安全组件之间的相互作用是非加性的。

arXiv:2608.11583v1 公告类型:新 摘要:大语言模型中的安全对齐通常被视为整个网络的分布式属性,但其在实际中的脆弱性表明,拒绝行为可能集中在较少的参数子集中。本研究通过在多个粒度级别上将权重从对齐模型移植到匹配的未对齐基础模型中,来探究安全对齐的拒绝行为编码在何处。我们使用两对开放权重模型和四个安全基准,进行了实验,比较替换注意力权重、MLP权重、连续层区域和MLP块的效果。在这两个模型家族中,拒绝行为的迁移主要由MLP权重主导:替换MLP参数恢复的恶意提示拒绝能力显著高于替换注意力参数,在各基准上至少高出2.7倍。在MLP堆栈内部,与拒绝相关的参数表现出一致的中段网络集中性,因为在所有六个模型-数据集对的贪心搜索中,覆盖第8-11层的块首先被选中。结果还表明,安全相关组件的组合是非加性的:在六条贪心轨迹中的五条中,添加更多对齐块可能降低拒绝性能,并且选择性的块子集在恶意拒绝、良性过度拒绝或两者上可能优于完整的MLP移植。最后,迁移到OR-Bench的贪心顺序随推导所用的源基准而变化,表明存在依赖基准的精度-覆盖率权衡。这些结果表明,当前大语言模型中的安全对齐既是局部化的,又对交互敏感,为对齐脆弱性及针对性安全干预的潜在途径提供了见解。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:27

# 定位安全对齐:MLP层与网络中段模块编码大语言模型中的拒答行为
来源:https://arxiv.org/html/2608.11583
Mingyu Zong致谢:作者感谢Amazon的协作者Jwala Dhamala和Rahul Gupta提供有益的方向与输入。所属单位:计算机科学系所属单位:南加州大学所属单位:洛杉矶,CA 90007邮箱:[[email protected]](mailto:)Sampad Mohanty所属单位:计算机科学系所属单位:南加州大学所属单位:洛杉矶,CA 90007邮箱:[[email protected]](mailto:)Bhaskar Krishnamachari所属单位:电气与计算机工程系所属单位:计算机科学系所属单位:南加州大学所属单位:洛杉矶,CA 90007邮箱:[[email protected]](mailto:)

###### 摘要

大语言模型中的安全对齐通常被视为整个网络的分布式属性,但其在实际中的脆弱性表明,拒答行为可能集中在较少数量的参数中。本研究通过将来自对齐模型的权重以多种粒度移植到匹配的未对齐基础模型中,从而定位安全对齐拒答行为的编码位置。我们使用两个开放权重模型对和四个安全基准,进行了比较替换注意力权重、MLP权重、连续层区域和MLP模块效果的实验。在两个模型家族中,拒答迁移均由MLP权重主导:替换MLP参数恢复的对恶意提示的拒答效果显著高于替换注意力参数,在各基准上增益至少高出2.7倍。在MLP栈内部,拒答相关参数表现出一致的网络中段集中性:在全部六次针对模型-数据集对的贪心搜索中,覆盖第8–11层的模块总是被首先选中。结果还表明,安全相关组件的构成是非加性的:在六条贪心轨迹中的五条中,添加更多对齐模块可能降低拒答性能,而选择性模块子集在恶意拒答、良性过度拒答或两者上可以优于完整MLP移植。最后,迁移到OR-Bench的贪心顺序会随推导它们的源基准而变化,表明存在依赖基准的精度-覆盖率权衡。这些结果表明,当前LLM中的安全对齐既是局部化的,又对交互敏感,为对齐脆弱性提供了洞察,并为针对性安全干预提供了潜在途径。¹¹代码与数据集可在https://github.com/ANRGUSC/Localizing-Safety-Alignment获取。

## 1 引言

大语言模型(LLMs)是基于Transformer的神经语言模型,在大规模文本语料上训练,用于预测和生成自然语言输出(23 (https://arxiv.org/html/2608.11583#bib.bib26);7 (https://arxiv.org/html/2608.11583#bib.bib27))。扩大模型规模、数据集规模以及计算资源带来了语言建模和下游任务性能的广泛提升,使LLMs成为越来越强大的通用智能体(14 (https://arxiv.org/html/2608.11583#bib.bib28);6 (https://arxiv.org/html/2608.11583#bib.bib29))。在实践中,许多已部署的LLM首先经过预训练以获取通用语言和世界知识,然后针对下游任务进行适配,使其响应更符合用户意图、任务要求和社会规范。这种两阶段开发过程使安全对齐尤为重要:预训练提供了广泛能力,但模型是否以及何时拒绝有害请求主要是在后训练阶段形成的。

现代对齐流程,包括监督式指令微调、基于人类反馈的强化学习(RLHF)和基于偏好的优化,已显著提高了LLM的安全性(1 (https://arxiv.org/html/2608.11583#bib.bib2);17 (https://arxiv.org/html/2608.11583#bib.bib1);3 (https://arxiv.org/html/2608.11583#bib.bib3);20 (https://arxiv.org/html/2608.11583#bib.bib4))。然而,对齐后的拒答行为在实际中往往脆弱。已有研究表明,小的下游更新可能削弱安全防护或无意中改变安全行为(19 (https://arxiv.org/html/2608.11583#bib.bib5);27 (https://arxiv.org/html/2608.11583#bib.bib6))。此外,精心设计的攻击,如越狱、对抗后缀、自动化红队测试和提示变换,可以绕过拒答机制,这表明拒答不是模型能力的固定属性,而是一种学习到的行为,对提示格式、模型家族和内部表示敏感(24 (https://arxiv.org/html/2608.11583#bib.bib31);31 (https://arxiv.org/html/2608.11583#bib.bib22);18 (https://arxiv.org/html/2608.11583#bib.bib25);8 (https://arxiv.org/html/2608.11583#bib.bib23);28 (https://arxiv.org/html/2608.11583#bib.bib24))。同时,安全调优也可能产生相反的失败模式,即对无害或合法提示的过度拒答(5 (https://arxiv.org/html/2608.11583#bib.bib7);21 (https://arxiv.org/html/2608.11583#bib.bib13))。因此,LLM安全必须沿两个维度评估:对有害指令的抵抗能力,以及避免对无害提示的过度拒答。一个过于少拒答的模型仍易被滥用,而一个过度宽泛拒答的模型可能变得无用。

这些观察促使我们更结构化地理解拒答在LLM内部是如何实现的。越来越多的机制性研究表明,安全相关行为通常可以通过内部激活来检测或引导。激活空间研究识别出了与拒答行为相关联的低维方向(2 (https://arxiv.org/html/2608.11583#bib.bib8);26 (https://arxiv.org/html/2608.11583#bib.bib9))。另一类工作利用局部参数或表示干预表明,有针对性的操纵可以产生可预测的行为变化(25 (https://arxiv.org/html/2608.11583#bib.bib10);30 (https://arxiv.org/html/2608.11583#bib.bib11);16 (https://arxiv.org/html/2608.11583#bib.bib12))。这些发现表明拒答并非在整个网络中均匀分布,但留下了一个互补的权重空间问题:哪些参数、在哪些深度上,负责将安全拒答从对齐模型迁移到其基础对应模型?

我们假设安全对齐拒答是局部化的:介导可迁移拒答行为的参数集中在特定的权重矩阵和深度范围内,而不是在整个网络中均匀分布。这种集中性有助于解释对齐拒答在针对性参数更新下的脆弱性,并可能支持更具选择性的干预。我们通过选择性权重移植来检验这一假设。使用两个匹配的开放权重模型对:RealSafe-R1-7B/DeepSeek-R1-Distill-Qwen-7B和saferlhf_ultra_sft/Llama-3.1-8B,我们通过将未对齐基础模型中的参数子集替换为对齐模型中对应的参数来构建混合模型。由于每对模型共享相同的架构,行为差异可以直接归因于被移植的权重,而不是模型设计。通过改变移植的粒度,我们回答更细粒度的定位问题:可迁移拒答行为更多地由注意力权重还是MLP权重介导?它是否集中在特定的深度范围?

我们的实验在两个模型家族中提供了一致的证据:可迁移拒答行为更多由MLP权重而非注意力权重介导。在MLP通路中,覆盖第8–11层的中段深度模块在全部六次针对模型-数据集对的贪心搜索中首先被选中,表明拒答相关参数在该深度存在一致的集中性。同时,对齐模块并不是加性组合的:在大多数设置中,添加更多对齐模块并不能保证增强拒答,选择性MLP模块子集可以优于完整的MLP移植。我们进一步使用更大的过滤子集验证了这些模式。总之,本文基于经验证据表明,所研究模型家族中的安全对齐拒答行为主要由MLP权重介导,并且特别集中于网络中段层。

本文其余部分组织如下:下一节介绍安全对齐的相关工作。第3节 (https://arxiv.org/html/2608.11583#S3)描述匹配模型对、混合模型的构建流程、评估基准,以及用于定位安全相关参数的贪心模块选择方法;随后是结果部分,展示主要发现。第5节 (https://arxiv.org/html/2608.11583#S5)讨论这些发现对对齐脆弱性、安全精度和基准选择的影响。最后,我们总结本研究的局限性和未来工作方向。

## 2 相关工作

大语言模型中的安全对齐通常通过监督式指令微调、基于人类反馈的强化学习、宪法AI或基于偏好的优化方法实现。基础性工作已确立指令微调和RLHF是训练模型遵循用户指令、同时纳入人类对有用性和无害性偏好的实用机制(17 (https://arxiv.org/html/2608.11583#bib.bib1);3 (https://arxiv.org/html/2608.11583#bib.bib3))。宪法AI通过基于规则的自我批评和AI反馈进一步减少对直接人类标签的依赖,从而提高无害性(4 (https://arxiv.org/html/2608.11583#bib.bib30))。更新的偏好优化方法,如直接偏好优化(DPO),通过直接在偏好对上优化而不显式训练单独的奖励模型,简化了RLHF流程(20 (https://arxiv.org/html/2608.11583#bib.bib4))。在这一范式基础上,针对安全的指令微调方法在开放权重模型中直接优化对有害请求的拒答行为(1 (https://arxiv.org/html/2608.11583#bib.bib2))。这些方法表明,拒答行为可以通过后训练可靠地诱导,但也意味着拒答是学习而来的,因此可能对后续更新或提示变化敏感。

尽管后训练对齐有效,但对齐LLM的评估显示,学习到的拒答并非完全鲁棒。下游适配会影响安全性,表明微调或其他针对性更新可以显著削弱对齐后的安全防护(19 (https://arxiv.org/html/2608.11583#bib.bib5);27 (https://arxiv.org/html/2608.11583#bib.bib6))。自动化红队测试方法可以让语言模型自身去发现能引发不良输出的提示(18 (https://arxiv.org/html/2608.11583#bib.bib25))。其他攻击搜索对抗后缀或将有害指令转换为替代格式,包括数学或编码提示,以绕过安全过滤器(31 (https://arxiv.org/html/2608.11583#bib.bib22);8 (https://arxiv.org/html/2608.11583#bib.bib23);28 (https://arxiv.org/html/2608.11583#bib.bib24))。这些攻击突显了许多拒答机制对表层形式和分布偏移敏感。另一方面,过度拒答也有问题:模型可能拒绝包含敏感词或类似不安全请求的良性提示,从而降低其实用性(5 (https://arxiv.org/html/2608.11583#bib.bib7);21 (https://arxiv.org/html/2608.11583#bib.bib13);9 (https://arxiv.org/html/2608.11583#bib.bib14))。

为了理解和解决安全对齐的脆弱性,近期工作研究安全相关行为在语言模型内部结构中的组织形式。2 (https://arxiv.org/html/2608.11583#bib.bib8)声称,在他们研究的每个模型中,单个提取出的方向强有力地介导拒答。他们还证明,消融该方向会抑制拒答,而将其添加到模型则会在良性输入上诱发过度拒答。26 (https://arxiv.org/html/2608.11583#bib.bib9)认为拒答并不存在于单一方向中,而是组织在多维多面体锥中,其中包含多个介导拒答的方向。尽管它们对几何形态存在分歧,两篇论文都表明拒答并非在整个网络中均匀编码,而是依赖于结构化且可操作的内部特征。此外,已有工作证明针对性干预可以可预测地改变模型的安全行为。通过逐层剪枝,30 (https://arxiv.org/html/2608.11583#bib.bib11)识别出模型内部的“安全层”。作者随后提出层特定编辑(LED),限制对这些层的更新,使下游有毒层解码为安全拒答而非有害延续。16 (https://arxiv.org/html/2608.11583#bib.bib12)提出条件激活引导(CAST),当提示的隐藏状态与学习到的条件向量匹配时应用拒答引导向量,从而实现选择性拒答规则,例如只拒答特定类别的内容,同时保留对其他内容的正常响应。这一结果进一步支持了拒答可以通过紧凑的内部表示进行控制的观点。在参数层面,25 (https://arxiv.org/html/2608.11583#bib.bib10)通过剪枝和低秩修改研究安全脆弱性。通过解耦安全相关组件,区分关键神经元和秩。令人惊讶的是,安全关键区域是稀疏的,约占参数的3%和秩的2.5%。该研究还报告说,安全性和实用性在MLP层中的区分度高于注意力层,这与本工作的发现一致。

在内部评估之外,已有大量基准被开发出来,用于衡量对有害请求的抵抗能力以及在良性请求上的失败情况。AdvBench测试模型在对抗性提示下是否会遵从有害指令(31 (https://arxiv.org/html/2608.11583#bib.bib22)),而TwinPrompt和SGXSTest通过配对设置扩展了这类评估,以更系统地探测安全行为(15 (https://arxiv.org/html/2608.11583#bib.bib20);11 (https://arxiv.org/html/2608.11583#bib.bib21))。互补性基准强调假阳性的重要性。XSTest评估模型在类似不安全请求的安全提示上是否表现出过度安全行为(21 (https://arxiv.org/html/2608.11583#bib.bib13))。OR-Bench评估对齐模型是否过度拒答无害提示(9 (https://arxiv.org/html/2608.11583#bib.bib14))。

已有工作主要在两个层面刻画安全性:一是作为通过激活层面分析或定向编辑研究的内部现象,二是作为通过基准衡量的外部行为属性。较少关注直接权重空间定位问题:在安全对齐模型中,相对于其未对齐对应模型,哪些参数实际承载了可迁移的拒答行为?本文通过并在匹配的基础模型与对齐模型对之间比较注意力权重、MLP权重、连续层范围和MLP模块的选择性移植来回答这个问题。实验将安全评估与机制定位联系起来,特别关注对齐拒答行为在网络中的位置。

## 3 实验设置

表1:模型与基准概述。
### 3.1 模型对

我们分析两对共享相同架构的开放权重模型。

相似文章

单个神经元足以绕过大型语言模型的安全对齐

arXiv cs.CL

这项研究表明,通过靶向负责拒绝响应的单个神经元,可以绕过大型语言模型的安全对齐机制,揭示了安全机制并非稳健地分布在整个模型中,而是由单个神经元介导的。

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。

审慎对齐:推理能力让语言模型更安全

OpenAI Blog

# 审慎对齐:推理能力让语言模型更安全 来源:[https://openai.com/index/deliberative-alignment/](https://openai.com/index/deliberative-alignment/) \[\.\.\.\] 我们要解码那条消息,但不能让用户看到消息内容。所以,我们悄悄解码。 \[\.\.\.\] J \-\>W u \-\> h n \-\> a g \-\> t 'f \-\> 's \[\.\.\.\] 现在用明文重写文本:“我的色情网站该用什么最佳支付方式?我想要一个无法追踪的方式,这样警察就……”