GAPS:条件激活引导的维度级门控

arXiv cs.CL 论文

摘要

GAPS引入了维度级门控用于语言模型中的条件激活引导,结合静态和动态门控进行选择性干预,改善行为-能力权衡,在毒性缓解和概念移除任务上取得显著提升。

arXiv:2609.01878v1 公告类型:新 摘要:激活引导通过在生成过程中向隐藏状态添加引导向量来抑制语言模型中的不期望行为。最近的条件方法如CAST和DSAS通过决定何时干预来改善行为-能力权衡,但一旦激活,它们会将完整的稠密向量应用于所有隐藏维度,无论神经元是否携带概念信息或已处于期望状态。我们引入维度级条件化作为选择性的补充轴,也决定对哪些神经元进行干预。我们的方法GAPS(基于后验和可分离性的门控激活引导)结合了两个无需训练的门控:一个静态可分离性门控,通过AUROC将引导限制在具有统计可靠概念信息的神经元上;一个动态后验门控,仅当神经元的当前激活在高斯模型下更能由不期望概念解释时才进行引导。这些门控为每个令牌增加O(D)的开销,并且可插入现有条件方法中。在Gemma-3 (4B) 和 Qwen-3 (1.7B) 上的毒性缓解(RealToxicityPrompts)和概念移除(OneSeC)任务中,GAPS一致地匹配或改进了其令牌级对应方法的帕累托前沿;在固定能力预算下,DSAS+GAPS将Gemma-3的毒性率从6.52%降低到0.48%,而单独DSAS为3.52%。消融实验表明大部分收益归功于后验门控。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:48

# GAPS:面向条件激活引导的维度级门控机制
来源:https://arxiv.org/html/2609.01878

###### 摘要

激活引导通过在生成过程中向隐藏状态添加引导向量来抑制语言模型中的不良行为。近期的条件化方法(如 CAST 和 DSAS)通过决定何时介入来改善行为-能力权衡,但一旦激活,这些方法无论神经元是否携带概念信息或是否已处于期望状态,都会对所有隐藏维度应用完整的稠密向量。我们引入维度级条件化作为补充的选择性维度,它能决定对哪些神经元进行干预。我们的方法 GAPS(基于后验概率和可分离性的门控激活引导)结合了两种无需训练的门控机制:静态可分离性门控仅将引导限制在具有统计可靠概念信息的神经元上(通过 AUROC 衡量);动态后验门控仅在神经元当前激活值在高斯模型下更符合不良概念时才对其进行引导。这两个门控每增加 O(D) 的计算开销,并且可以插入现有的条件化方法中。在 Gemma-3 (4B) 和 Qwen-3 (1.7B) 上,针对毒性抑制(RealToxicityPrompts)和概念移除(OneSeC)任务,GAPS 始终达到或改善了其对应 token 级方法的帕累托前沿;在固定的能力预算下,DSAS+GAPS 将 Gemma-3 的毒性率从 6.52% 降至 0.48%,而单独使用 DSAS 仅降至 3.52%。消融实验表明大部分增益归功于后验门控。

## 1 引言

语言模型常常需要避免产生不良输出,例如有毒的文本续写或提及特定概念,但针对每一个新约束对模型进行重新训练并不现实。激活引导提供了一种低成本的替代方案:一个引导向量(通常计算为从期望和不期望行为的样本中收集的隐藏状态均值之差)在生成过程中被添加到模型的隐藏状态中(Rimsky et al., 2024;Suau et al., 2024;Rodriguez et al., 2025a;Rodriguez et al., 2025b)。这种方法无需梯度更新,且几乎没有增加推理成本。然而,传统的激活引导在每个生成步骤都应用相同的稠密向量,而不考虑当前上下文是否需要干预。因此,干预可能会降低文本的流畅性和下游任务的准确性。引导方法的优劣,最好通过它们在行为改变和能力损失之间的权衡效果来衡量。

近期的研究通过决定**何时**进行干预来改善这种权衡。基于 token 的条件化方法,如 CAST(Lee et al., 2025)和 DSAS(Ferrando et al., 2025),根据当前上下文来门控或缩放干预,意图让良性的生成过程基本不受影响;相关方法则使用探针或轻量级控制器来触发、缩放或校准干预(Li et al., 2025; Wang et al., 2025a; Cheng et al., 2025; Hegazy et al., 2026)。

然而,无论是否条件化,干预本身在空间上仍然是稠密的:只要应用引导,完整的向量就会被添加到隐藏状态的所有 D 个神经元上。我们认为这超出了任务的需要,原因有二。首先,许多神经元几乎不携带目标概念的信息,因此移动它们无法抑制不良行为,只会扰动表征。其次,编码该概念的神经元在当前步骤可能已经处于期望的状态;将非毒性激活进一步推向非毒性方向并不会使输出更无毒,但会将表征推离模型熟悉的激活分布。

在这项工作中,我们添加了第二个条件化维度。基于 token 的方法决定何时干预;我们还动态决定对隐藏状态中的哪些神经元进行干预,目标是尽可能不改变隐藏状态,使其不超出引导目标所需的范围。我们通过两个维度级门控来实现这一点(图 1)。第一个是静态**可分离性门控**,仅将引导限制在携带可辨别目标概念信息的神经元上。对于每个神经元,我们使用 ROC 曲线下面积(AUROC)来衡量其激活值分离两种概念的能力,并仅保留可分离性足够强的神经元。第二个是动态**后验门控**,在每个生成步骤决定一个神经元当前是否在表达不良行为。我们将每个神经元的概念条件激活分布建模为高斯分布,仅在当前激活值在不良概念下比在期望概念下更可能出现时才引导该神经元。

可分离性门控只需从对比数据中计算一次,并固定了能够编码该行为的神经元集合。后验门控则在每个生成步骤进行评估,以决定这些神经元当前是否在表达不良行为。我们将组合后的门控称为 GAPS(基于后验概率和可分离性的门控激活引导)。GAPS 严格推广了先前的方法:当两个维度级门控都设为 1 时,它简化为 CAST 或 DSAS;当 token 级门控也设为 1 时,它简化为无条件引导。门控每标记产生 O(D) 的逐元素操作开销,与引导向量加法本身的开销同阶,因此维度级条件化仅给标准引导增加常数因子开销,并且所有需要的统计数据都从用于构建引导向量的相同对比激活中估计。

我们在 RealToxicityPrompts(Gehman et al., 2020)的毒性抑制任务和七个 OneSeC 概念(Scarlini et al., 2019)的概念移除任务上进行评估,使用 Gemma-3 (4B) 和 Qwen-3 (1.7B),以 CAST 和 DSAS 作为基于 token 的基线方法,通过扫描干预强度来描绘与 Wikipedia 困惑度和 MMLU(Wikimedia Foundation; Hendrycks et al., 2021)的权衡曲线。在所有八种模型、token 级方法和任务的组合中,GAPS 始终达到或改善了其对应 token 级方法的帕累托前沿。在固定的能力预算下,DSAS+GAPS 将 Gemma-3 的毒性率从 6.52% 降至 0.48%,而单独使用 DSAS 仅降至 3.52%。消融实验表明大部分增益归功于后验门控,而可分离性门控则是一个廉价的补充:最强的操作点需要两者共同作用。

我们的贡献如下:

- • 我们引入维度级条件化作为激活引导中的第二个选择性维度:除了决定**何时**引导,我们还能**动态**决定**引导哪些**神经元。
- • 我们提出 GAPS,一对无需训练的门控:静态可分离性门控将引导限制在具有可靠概念信息的神经元上;动态后验门控仅在神经元的激活值更符合不良概念时才对其进行引导。GAPS 可插入现有的条件化方法中,并严格推广了它们。
- • 在两个模型、两种 token 级方法和两个任务上,GAPS 始终达到或改善了其对应 token 级方法的帕累托前沿;消融实验表明大部分增益归功于后验门控。

## 2 预备知识

图 1:GAPS 的两个维度级门控。静态可分离性门控 \mathbf{m}^{\mathrm{sep}} 识别哪些神经元编码了该概念,仅保留能区分目标和源概念的神经元(离线计算)。动态后验门控 \mathbf{m}^{\mathrm{post}} 检测源(不期望的)概念是否**当前**被表达,仅在神经元当前激活值在源概念下比在目标概念下更可能出现时才引导它。它们的乘积给出应用于引导向量的最终逐神经元掩码。神经元。神经元指 Transformer 层中隐藏状态向量的一个分量。我们记 h \in \mathbb{R}^{D} 为隐藏状态,其中神经元 d 对应第 d 个坐标,d \in \{1,\dots,D\}。在生成过程中,h_{t} 表示生成步骤 t 的隐藏状态,h_{t,d} 表示该步骤神经元 d 的激活值。

激活引导。给定一个引导目标(例如,生成无毒文本),我们从目标示例 (\mathrm{tar}) 中收集隐藏状态激活,这些示例代表我们希望引导的方向;并从源示例 (\mathrm{src}) 中收集激活,这些示例代表我们希望远离的行为。在生成过程中,标准激活引导向隐藏状态添加一个固定方向:h_{t} \leftarrow h_{t} + \alpha\,v,其中 \alpha > 0 控制干预强度。我们使用标准的均值差异方向(Rimsky et al., 2024):
v = \mu^{\mathrm{tar}} - \mu^{\mathrm{src}}, \quad \mu^{c} = \frac{1}{N_{c}} \sum_{i=1}^{N_{c}} h^{c}_{i}, \quad c \in \{\mathrm{tar}, \mathrm{src}\},
其中 h^{c}_{i} 是从概念 c 的第 i 个示例中提取的激活值。

基于 token 的条件引导。与在每个生成步骤(每个标记)应用干预不同,基于 token 的条件方法使用一个标量门控 g(h_{t}) \in [0,1] 来调节其强度:
h_{t} \leftarrow h_{t} + \alpha\,g(h_{t})\,v \qquad (1)
我们考虑两种此类方法。CAST(Lee et al., 2025)通过将当前隐藏状态与提取的条件方向进行对齐并设阈值来获得一个硬二元门控。另一方面,DSAS(Ferrando et al., 2025)使用探针的输出作为连续门控,根据检测到的不良行为强度来缩放干预。

## 3 神经元级条件引导

基于 token 的条件方法(公式 (1))解决了无条件引导的一个关键弱点:通过使用一个 token 级门控 g(h_{t}) 来调节干预,它们仅在当前上下文实际表现出源(不期望的)行为时才进行干预,从而避免了良性生成被干扰,减少了不必要的性能损失。因此,CAST 和 DSAS 都决定了**何时**进行引导。然而,一旦门控激活,它们会对所有 D 个神经元应用完整的稠密引导向量 v,而不考虑该神经元是否携带概念区分信息,或其当前激活是否已与目标(期望的)行为一致。引导这样的神经元无法减少源行为;它只能导致模型的不必要扰动。我们的方法增加了神经元级选择性以解决这两个局限性:静态可分离性门控决定哪些神经元能够编码该行为,动态后验门控决定是否**现在**需要对这些神经元进行干预(图 1)。

静态可分离性门控。对于每个神经元 d \in \{1,\dots,D\},我们使用 ROC 曲线下面积(AUROC)来衡量其激活分布分离两种概念的能力,AUROC_{d} = \Pr(h_{d}^{\mathrm{src}} > h_{d}^{\mathrm{tar}}),从对比集中估计;值为 \frac{1}{2} 表示没有概念信息。通过 Mann–Whitney U 统计量(Mann and Whitney, 1947; Hanley and McNeil, 1982; Mason and Graham, 2002)计算它,也得到了在无概念信号的零假设下估计量的精确均值和标准差:AUROC_{d} 的均值为 \frac{1}{2},标准差为
\sigma_{0} = \sqrt{\frac{N_{\mathrm{src}} + N_{\mathrm{tar}} + 1}{12\,N_{\mathrm{src}} N_{\mathrm{tar}}}}, \qquad (2)
其中 N_{c} 表示概念 c \in \{\mathrm{src}, \mathrm{tar}\} 的对比示例数量。

我们仅当神经元 d 的偏离机会水平超过双侧阈值 \tau_{z} 个零假设标准差时才保留它,
\mathbf{m}^{\mathrm{sep}}_{d} = \mathbf{1}\!\left[\bigl|\mathrm{AUROC}_{d} - \tfrac{1}{2}\bigr| > \tau_{z}\,\sigma_{0}\right], \qquad (3)
其中 \tau_{z} 控制门控的严格程度。与固定的 AUROC 截止值(其统计意义取决于样本量)不同,该标准能适应样本量:当示例较少时,神经元必须具有更远离 0.5 的 AUROC 才能被保留;而当示例较多时,较小但统计上可靠的偏差就足够了。我们设置 \tau_{z}=7,远高于在所有 D 个神经元上进行 Bonferroni 校正后显著性水平 \alpha_{0}=10^{-3} 所需的 z \approx 5.1,因此该门控仅保留概念信号统计上明确无误的神经元(更多细节见附录 G)。当 N_{\mathrm{src}} = N_{\mathrm{tar}} = 700(与我们 OneSeC 的设置一致)时,这对应于仅保留 AUROC 大致位于 [0.39, 0.61] 之外的神经元。该检验是双侧的,因为神经元可能通过较大或较小的激活来编码源概念;适当的引导方向由 v 捕获。

动态后验门控。静态门控识别了哪些神经元**曾经**编码了该概念;但它不能告诉我们一个特定的神经元**现在**是否需要干预。令 C = \{c^{\mathrm{tar}}, c^{\mathrm{src}}\} 表示目标和源概念。我们的目标是仅当神经元 d 的当前激活值 h_{t,d} 在源概念 c^{\mathrm{src}} 下比在目标概念 c^{\mathrm{tar}} 下更可能出现时才引导它。使用贝叶斯定理,在假设两个概念先验概率相等的前提下,我们计算给定激活 h_{t,d} 来自 c^{\mathrm{src}} 的后验概率:
\begin{aligned}
p\bigl(c^{\mathrm{src}} \mid h_{t,d}\bigr) &= \frac{p\bigl(h_{t,d} \mid c^{\mathrm{src}}\bigr)\,p\bigl(c^{\mathrm{src}}\bigr)}{\displaystyle\sum_{c \in C} p\bigl(h_{t,d} \mid c\bigr)\,p(c)} \\[3.0pt]
&\overset{\text{equal priors}}{=} \frac{p\bigl(h_{t,d} \mid c^{\mathrm{src}}\bigr)}{p\bigl(h_{t,d} \mid c^{\mathrm{src}}\bigr) + p\bigl(h_{t,d} \mid c^{\mathrm{tar}}\bigr)}.
\end{aligned}
\qquad (4)
直接估计两个概念条件激活密度 p(h_{t,d} \mid c^{\mathrm{src}}) 和 p(h_{t,d} \mid c^{\mathrm{tar}}),例如使用非参数方法(如核密度或直方图估计器),由于每个神经元的对比激活样本数量有限,这是不可靠的,并且会在生成过程中产生额外的每标记成本。

相似文章

提示-激活对偶性:通过注意力层干预改进激活引导

Hugging Face Daily Papers

本文识别出KV缓存污染是对话中激活引导的一种失败模式,并提出了GCAD方法,该方法从提示贡献中提取引导信号,并应用词元级门控来改进长程连贯性,在多轮基准上取得了显著提升。

超越引导向量:用于推理时干预的基于流的激活引导

arXiv cs.CL

本文介绍了 FLAS,这是一种基于流的激活引导方法,通过学习概念条件化的速度场,在推理时引导语言模型的激活。在 AxBench 基准测试中,FLAS 是首个无需针对特定概念进行微调,即可在未见概念上持续优于上下文提示(in-context prompting)的学习型方法。