稀疏特征干预何时真正局部化?基于SAE的安全控制匹配评估
摘要
本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。
arXiv:2607.10226v1 公告类型:新
摘要:我们评估了稀疏自编码器(SAE)特征何时起到与安全相关行为的局部化控制手柄的作用。这个问题之所以困难,是因为表面的成功可能源于弱干预、不匹配的基线、模型鲁棒性,或者由自动化安全法官标记为不安全但并未代表有意义的有害遵从的退化输出。我们引入了一种针对运行时安全干预的匹配一致性门控评估协议:方法在匹配的目标效应点进行比较,主要目标指标仅在输出同时被判断为不安全且一致时计算有害遵从。将该协议应用于Gemma-2-9B-it上的三个提示分割,并使用Gemma Scope第20层残差SAE,我们发现SAE特征消融具有狭窄的有效区域。SAE top800在较低的总扰动和竞争性效用下达到低到中等的目标效应,但SAE top1600相对于匹配的密集拒绝方向基线失去了效用,而SAE top3200主要导致一致性崩溃。人工审计确认一致性门控去除了仅不安全的人工产物,特征诊断表明有效区域由稳定的拒绝对齐特征头部驱动,其激活分离度随排名快速衰减。这些结果表明,基于SAE的安全干预应被视为依赖于区域的控制机制,而非假设为均匀局部化。
查看缓存全文
缓存时间: 2026/07/14 04:19
# 稀疏特征干预何时真正具有定位性?基于匹配评估的SAE安全控制
来源:https://arxiv.org/html/2607.10226
达明·罗 克里斯蒂·梁 俊宇·徐 悉尼科技大学 daming\.luo@student\.uts\.edu\.au Jie\.Liang@uts\.edu\.auJunyu\.Xuan@uts\.edu\.au
###### 摘要
稀疏自编码器 \(SAE\) 特征越来越多地被提出作为安全相关行为的定位控制手柄,其理由是:稀疏特征干预比密集激活引导能以更少的内部扰动改变更多行为(即更高效)。我们证明,这种优势是否成立取决于如何匹配密集基线。我们引入**匹配相干门控 \(MCG\) 评估**协议,该协议通过两种互补控制来限定稀疏与密集的比较——匹配目标效应(固定行为,读取扰动)和匹配扰动范数(固定扰动,读取行为)——仅当输出既被评判为不安全又连贯时才计为越狱,并使用第二个行为完成评判器交叉验证每个关键数字。在 Gemma\-2\-2B/9B/27B\-it 和 Llama\-3\.1\-8B\-Instruct 上,结合两个 SAE 套件(Gemma Scope 和 Llama Scope),该协议揭示出匹配**总**扰动范数并不足够:它使干预**表面**未被匹配,即比较的是单层 SAE 消融与一个跨所有层的密集方向,后者的扰动被分散在整个堆栈中。在 Gemma\-2\-9B 上,一旦我们也匹配了表面——同层密集引导和投影到 SAE 解码器空间的密集引导——SAE 的明显效率优势就消失并逆转:在每个匹配的扰动区间,两个公平基线比 SAE 消融产生**更多**有害服从(高达 −0.29−0.29 真实越狱),且 SAE 在高扰动时还付出了能力代价;这一逆转在 HarmBench 第二评判器下也成立。在 Llama\-3\.1\-8B 和 Gemma\-2\-27B 上,SAE 相对于全层密集引导仍然保持很大优势。独立于密集基线,该协议揭示了另外两个伪像:高 kkSAE 消融会以不连贯文本触发安全评判器(经人工审计证实);而在 2B 模型中,SAE“越狱”很大程度上是单一评判器的膨胀,第二评判器不予证实(κ→0κ→0),同时推理能力崩溃。我们的结论是:SAE 特征消融并非统一的安全定位手柄,稀疏定位性声明应使用匹配表面、匹配基、相干门控、多评判器的协议进行评估。
## 1 引言
稀疏自编码器 \(SAE\) 为解释和干预语言模型的内部表示提供了一个有吸引力的接口 \(Bricken et al\., 2023; Cunningham et al\., 2023; Lieberum et al\., 2024\)。如果拒绝、有害服从或越狱易感性等安全相关行为是由少量稀疏特征介导的,那么运行时特征干预可以提供比密集激活引导或权重级适配更细粒度的替代方案。
这一承诺引发了一个测量问题。一个安全干预可能因为并非真正的定位控制而显得成功。一种方法可能弱于与之比较的基线,因为它几乎没有改变模型,从而保留了效用。一种方法可能只有在强度达到破坏下游能力的程度时才能达到期望的目标行为。高强度的干预还可能导致不连贯或退化的文本,被自动评判器标记为不安全,从而在不产生有意义的有害服从的情况下膨胀目标行为指标。这些失败模式之所以重要,是因为特征级控制的核心主张不仅仅是干预改变了行为,而是它通过一个小而特定的内部机制改变了行为。
因此,我们提出这样一个问题:**SAE 特征干预何时真正具有定位性?**我们通过**匹配相干门控 \(MCG\) 评估**来研究这个问题,该协议包含两种互补的控制。第一种通过目标行为匹配方法,并读出扰动和效用成本;第二种通过每个 token 的扰动范数匹配方法,并读出由此产生的行为。两者结合提出这样的问题:稀疏特征是否提供了更好的行为-扰动权衡,而不仅仅是能否改变模型行为。我们将主要目标指标定义为不安全**并且**连贯的有害服从,而非仅基于不安全评判标签,并使用第二个行为完成评判器交叉验证该指标。因此,本文的主要方法论贡献是这种用于激活级安全干预的匹配相干门控评估协议:它提供了定位性的**操作性**证据——即观察到的行为-扰动优势——而非机械因果回路发现的声明。
关键的是,我们并非在单个模型上运行此协议,而是在一个小型和两个大型指令微调模型以及两个独立的 SAE 套件上进行。这将单模型评估问题转化为一个缩放问题:**SAE 安全控制的定位性是否随着模型规模和架构的变化而保持?**结果支持一个**基线依赖**的论点。SAE 消融的表面扰动效率对密集基线的匹配方式高度敏感:在 Gemma\-2\-9B 上,它能在朴素的总扰动范数匹配下幸存,但一旦将密集基线限制在同一层或 SAE 解码器空间内就会逆转,因此 headline 优势部分源于将单层干预与全层干预进行比较的伪像。在 Llama\-3\.1\-8B 和 Gemma\-2\-27B 上,相对于全层密集引导,优势仍然很大。在小型 2B 模型中,相同的配方根本不具有定位性:它破坏了能力并膨胀了单一安全评判器。
本文的贡献如下:
1. 1. 我们制定了一个匹配相干门控评估协议,包含两种互补控制——匹配目标效应和匹配扰动范数——用于比较特征级和密集安全干预,而不会混淆目标强度、效用损失和退化伪像。
2. 2. 我们证明匹配**总**扰动范数并不是一个充分控制:它留下了干预**表面**(受扰动层集合)和**基**(受扰动子空间)未被匹配。在 Gemma\-2\-9B 上,与同层密集引导和投影到 SAE 解码器空间的密集引导相比,SAE 的明显扰动效率优势消失并在每个匹配区间逆转(真实越狱高达 −0.29−0.29,且在高扰动时附加能力成本),这一逆转由第二个评判器确认。因此,在全局层密集基线下的 headline 优势实质上是一个将单层干预与全层干预进行比较的伪像。
3. 3. 我们表明,SAE 相对于全层密集引导的优势在 Llama\-3\.1\-8B\-Instruct 上仍然很大,并在 Gemma\-2\-27B\-it 上增长(两者均相对于全层密集基线报告);结合 9B 的逆转,这表明基线规格——而非稀疏性——是决定 SAE 看起来是否具有定位性的关键因素。
4. 4. 我们通过定向人工审计支持相干门控,并使用第二个行为完成评判器 \(HarmBench\) 表明高强度的 SAE 消融会以不连贯文本触发单一安全评判器,并且在 Gemma\-2\-2B\-it 上,SAE 的越狱信号主要是单一评判器的膨胀(κ→0κ→0),伴随推理能力崩溃——这是一个强烈的负对照,反对从小模型外推 SAE 引导。
5. 5. 我们提供了特征级诊断和一个层扫描,刻画了拒绝对齐的 SAE 头及其秩衰减几何,并表明没有单个特征本身是一个控制开关。
6. 6. 我们表明效率比较是**方向依赖**的:对于**注入**拒绝作为安全改进,密集引导是更保留能力的选择,因此正确的工具取决于干预的符号而非仅仅稀疏性。
## 2 背景与相关工作
### 2.1 作为干预目标的稀疏特征
SAE 将密集激活分解为稀疏特征激活,目标是找到比单个神经元或任意方向更可解释的单元 \(Bricken et al., 2023; Cunningham et al., 2023\)。这一工作路线受叠加假说启发:模型可能通过将特征分散在激活空间中来表示比其维度更多的特征。SAE 特征之所以是有吸引力的干预目标,是因为它们似乎暴露了语义上有意义的方向,这些方向可以被激活、钳位或消融。
最近开源的 SAE 发布使得评估这一承诺在更大语言模型和跨架构上成为可能。Gemma Scope 提供了跨 Gemma 2 模型和层的一组 JumpReLU SAE \(Lieberum et al., 2024\),而 Llama Scope 为 Llama\-3\.1\-8B 提供了残差 SAE \(He et al., 2024\)。我们使用这两个套件,但重点关注评估问题而非特征发现问题:当一组 SAE 特征似乎控制了一个安全行为时,在匹配干预强度、检查输出相干性以及改变模型规模或架构后,该效应是否仍然保持定位性?
### 2.2 激活引导与拒绝方向
密集激活引导构建与行为相关的方向,并在推理时沿着这些方向修改激活。激活工程和表示工程表明,简单的表示级干预可以引导诸如情感、诚实、无害或其他安全相关特征等高阶属性 \(Turner et al., 2023; Zou et al., 2023\)。拒绝行为是一个特别相关的案例。先前工作发现,聊天模型中的拒绝行为可以由残差流激活空间中的一个低维甚至单个方向介导 \(Arditi et al., 2024\)。
这些密集方向是 SAE 干预的重要基线。如果稀疏特征干预仅与任意密集基线或仅在不匹配的默认强度下进行比较,则不能令人信服。因此,我们在两种匹配控制下将 SAE 消融与密集拒绝方向引导进行比较。这种比较询问稀疏特征是否提供了更清晰的控制,而不仅仅是它们能否改变模型行为。
### 2.3 安全评估伪像
自动安全评判器对于规模化是有用的,但它们可能混淆有害服从与生成伪像。一个响应可能很短、不连贯、重复或退化,同时仍被评判器归类为不安全。这个问题对于直接扰动内部激活的干预尤其严重,因为高强度扰动可以在产生有意义的行为控制之前就损害语言质量。即使配备相干门控,单一安全评判器仍可能系统性高估或低估有害服从;第二个独立训练的、对有害请求的行为**完成**而非表面安全性进行评分的评判器提供了一个交叉验证,这在干预或模型规模将生成推向分布外时尤为重要。
我们使用 XSTest 作为一个面向效用的基准,因为它衡量在安全提示上的过度安全行为 \(Rottger et al., 2023\)。我们还在 MMLU 和 GSM8K 上报告能力指标,这些指标探究广泛知识和多步数学推理 \(Hendrycks et al., 2020; Cobbe et al., 2021\)。对于安全分类,我们使用 Llama Guard 模型作为主要自动评判器 \(Fedorov et al., 2024\),并使用 HarmBench 行为完成分类器作为第二评判器进行交叉验证 \(Mazeika et al., 2024\)。关键的方法论点是,评判标签不被视为充分条件:主要目标指标要求同时有不安全的评判标签和连贯的输出,并且 headline 结论需根据第二评判器进行检查。
## 3 匹配相干门控评估
本文通过一个旨在分离三个常常混淆的量的协议来评估 SAE 干预:目标行为、非目标效用和干预导致的退化。该协议与方法无关,可应用于密集引导、稀疏特征消融或其他运行时激活干预。
#### 两种互补匹配控制。
将弱的 SAE 干预与强的密集干预进行比较会使 SAE 因错误原因显得保留效用;将强的 SAE 干预与弱的密集干预进行比较会使 SAE 看起来更有效而未能控制损害。因此,我们使用两种从两侧限定比较的匹配控制:
- • **匹配目标效应 (matched\-TE)**:我们扫描干预强度,并在相等连贯目标行为的分箱内比较方法。这固定了**行为**,并询问每种方法花费了多少扰动和效用损失以达到该行为。
- • **匹配扰动范数 (matched\-PN)**:我们改为按相等的每 token 相对残差变化分箱方法,并比较由此产生的行为和效用。这固定了**扰动预算**,并询问每种方法每单位内部变化购买了多少连贯有害服从。
两种控制是互补的:matched\-TE 检测 SAE 是否仅仅是更强或更弱,而 matched\-PN 检测 SAE 是否更**扰动高效**——即定位性控制的操作性含义。一种在 matched\-TE 下持平但在 matched\-PN 下胜出的方法,正在以更小、更具体的内部变化实现相同的行为。
#### 匹配的层次。
匹配扰动范数是必要的但本身不足,因为两种干预可以共享一个*总*每 token 扰动,而在该扰动的*分布位置*上不同。一个应用于所有残差层的密集拒绝方向将给定的总范数薄薄地分散在堆栈上,而一个单层 SAE 消融则将相同的总扰动集中在单层;在相等总范数下,两者因此在每层强度上不可直接比较。公平比较必须额外匹配干预的*表面*(受扰动层集合)并且理想情况下匹配*基*(扰动所处的子空间)。我们用同层密集基线(仅在 SAE 所在层进行引导)来操作化表面匹配,用投影到 top-k SAE 解码器向量空间上的密集方向来操作化基匹配。第 5 节显示这一区别并非学术:在 Gemma\-2\-9B 上,它翻转了 headline 比较的符号。
#### 相干门控目标指标。
设 \(J(x)\) 指示安全评判器将提示 \(x\) 的响应标记为不安全,设 \(C(x)\) 指示响应是连贯的。我们定义
\[\text{true\_jailbreak}(x) = \mathbf{1}\big[\,J(x)=\text{unsafe}\;\land\;C(x)=\text{coherent}\,\big].\]相似文章
SAE干预不可靠:干预后受抑制行为的恢复
本文证明了对稀疏自编码器(SAE)特征的干预可能不可靠,因为受抑制的行为可以通过残差空间优化恢复,即使干预仍然有效。它揭示了语言模型中特征级控制与实际行为完整性之间的关键差距。
多语言设计导向的调控:多语言稀疏自编码器与原则性层选择
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。
路由子空间:微调语言模型中评估与部署行为偏差的审计
本文研究了微调语言模型中评估行为与部署行为之间的不匹配。它引入了一种方法,通过定位并干预内部表示来缩小这一差距。
单令牌稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应
本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。
通过邻居集成特征选择增强基于SAE的转向
本文指出,针对基于SAE的LLM转向的统计top-k特征选择并非最优,并提出了邻居集成特征选择(NIFS)以通过利用表示相似性来提升性能。