单个神经元足以绕过大型语言模型的安全对齐

arXiv cs.CL 论文

摘要

这项研究表明,通过靶向负责拒绝响应的单个神经元,可以绕过大型语言模型的安全对齐机制,揭示了安全机制并非稳健地分布在整个模型中,而是由单个神经元介导的。

arXiv:2605.08513v1 公告类型:新文章 摘要:语言模型中的安全对齐通过两个机制上截然不同的系统来运作:拒答神经元控制是否表达有害知识,而概念神经元则编码有害知识本身。通过针对这两个系统中的单个神经元,我们展示了两种失败方向——通过抑制绕过显式有害请求的安全限制,以及通过放大从无害提示中诱导有害内容——这些结果在跨越两个家族、参数规模从 17 亿到 70 亿不等的七个模型中得到验证,且无需任何训练或提示工程。我们的研究发现表明,安全对齐并未稳健地分布于模型权重中,而是由单个神经元介导,这些神经元各自足以因果性地控制拒答行为——抑制任何已识别的拒答神经元都能绕过各种有害请求的安全对齐。
查看原文
查看缓存全文

缓存时间: 2026/05/12 06:51

# 单个神经元足以绕过大型语言模型的安全对齐
来源:https://arxiv.org/abs/2605.08513
查看 PDF (https://arxiv.org/pdf/2605.08513)

> 摘要:语言模型中的安全对齐通过两种机制上不同的系统运作:拒绝神经元(用于控制是否表达有害知识)和概念神经元(用于编码有害知识本身)。通过针对每个系统中的一个单一神经元,我们展示了两种失效方向——通过抑制绕过显式有害请求的安全机制,以及通过放大从无益提示中诱导有害内容——这跨越了两个系列、参数规模从 17 亿到 70 亿不等且未经任何训练或提示工程的七个模型。我们的研究结果表明,安全对齐并非稳健地分布在模型权重中,而是由个体神经元介导,这些神经元在因果上足以控制拒绝行为——抑制任何已识别出的拒绝神经元即可在各种有害请求中绕过安全对齐。

## 提交历史

作者:Hamid Kazemi [查看邮箱 (https://arxiv.org/show-email/454120a3/2605.08513)] **[v1]** 2026 年 5 月 8 日 星期五 21:45:28 UTC (2,210 KB)

相似文章

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。