单个神经元足以绕过大型语言模型的安全对齐
摘要
这项研究表明,通过靶向负责拒绝响应的单个神经元,可以绕过大型语言模型的安全对齐机制,揭示了安全机制并非稳健地分布在整个模型中,而是由单个神经元介导的。
arXiv:2605.08513v1 公告类型:新文章
摘要:语言模型中的安全对齐通过两个机制上截然不同的系统来运作:拒答神经元控制是否表达有害知识,而概念神经元则编码有害知识本身。通过针对这两个系统中的单个神经元,我们展示了两种失败方向——通过抑制绕过显式有害请求的安全限制,以及通过放大从无害提示中诱导有害内容——这些结果在跨越两个家族、参数规模从 17 亿到 70 亿不等的七个模型中得到验证,且无需任何训练或提示工程。我们的研究发现表明,安全对齐并未稳健地分布于模型权重中,而是由单个神经元介导,这些神经元各自足以因果性地控制拒答行为——抑制任何已识别的拒答神经元都能绕过各种有害请求的安全对齐。
查看缓存全文
缓存时间: 2026/05/12 06:51
# 单个神经元足以绕过大型语言模型的安全对齐 来源:https://arxiv.org/abs/2605.08513 查看 PDF (https://arxiv.org/pdf/2605.08513) > 摘要:语言模型中的安全对齐通过两种机制上不同的系统运作:拒绝神经元(用于控制是否表达有害知识)和概念神经元(用于编码有害知识本身)。通过针对每个系统中的一个单一神经元,我们展示了两种失效方向——通过抑制绕过显式有害请求的安全机制,以及通过放大从无益提示中诱导有害内容——这跨越了两个系列、参数规模从 17 亿到 70 亿不等且未经任何训练或提示工程的七个模型。我们的研究结果表明,安全对齐并非稳健地分布在模型权重中,而是由个体神经元介导,这些神经元在因果上足以控制拒绝行为——抑制任何已识别出的拒绝神经元即可在各种有害请求中绕过安全对齐。 ## 提交历史 作者:Hamid Kazemi [查看邮箱 (https://arxiv.org/show-email/454120a3/2605.08513)] **[v1]** 2026 年 5 月 8 日 星期五 21:45:28 UTC (2,210 KB)
相似文章
定位安全对齐:MLP层与网络中段模块编码大语言模型中的拒绝行为
本文通过将权重从对齐模型移植到未对齐模型,研究安全对齐在大语言模型中的编码位置。研究发现,MLP层,尤其是网络中段模块(第8-11层),主要驱动拒绝行为,并且安全组件之间的相互作用是非加性的。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
老语言学家的无国之地:LLM-大脑对齐对神经计算的不充分决定性
本文讨论了将大型语言模型与大脑功能对齐如何不充分决定神经计算,强调了在建模认知方面的局限性。
在多语言大语言模型中进行分布感知的语言神经元识别
本文提出一种分布感知方法,用于在多语言大语言模型中识别特定语言神经元,该方法利用成对激活分布重叠,提高了跨语言因果效应隔离的特异性。
情绪很重要:句法敏感性如何破坏安全对齐
本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。