转向信号的来源:激活转向中的激活源选择
摘要
本文研究了源激活的选择如何影响语言模型中的激活转向,发现执行边界状态(模型即将产生目标行为的状态)能产生更强的信号,并引入了尾部减法来提高转向稳定性。
arXiv:2607.25270v1 公告类型:新
摘要:激活转向通过在推理时间向隐藏状态添加向量或特征来控制语言模型,但这些转向信号的上游来源通常被视为次要细节。我们将这种来源选择作为激活源选择来研究:即用于收集构建转向信号的隐藏状态的源上下文和激活读取策略的组合。在固定下游干预的情况下,我们展示了在三个指令调优模型和四个转向任务族中,仅改变源激活就能显著改变转向成功率。我们进一步发现,有效的转向并不能简单地通过期望行为是否出现在源文本来解释。相反,强信号来自执行边界状态,即模型即将产生或继续目标行为的状态。这种实现前/后区别解释了为什么基于答案的源有时有效:其有用成分与执行边界方向对齐,而不仅仅是目标出现本身。基于这一观点,我们引入了尾部减法,它从边界状态中移除共享的提示和延续语义,从而产生更干净、更稳定的转向信号。总体而言,我们的结果表明转向依赖于模型即将做什么的表征,而不仅仅是已经出现的东西。
查看缓存全文
缓存时间: 2026/07/29 09:54
# 激活导向中的激活源选择
来源:https://arxiv.org/html/2607.25270
## 导向信号从何而来:激活导向中的激活源选择
叶嘉然1,3,\*冉令旭3,\*姚子俊3王晨鹏6 江勇5侯磊3李娟子3潘良明1,2,4,† 1计算语言学教育部重点实验室,北京大学 2计算机学院,北京大学 3计算机科学与技术系,清华大学 4北京人工智能研究院,北京,中国 5清华大学深圳国际研究生院 6一信-AILab,一信,北京,中国 \{yejr23,rlx22\}@mails\.tsinghua\.edu\.cnliangmingpan@pku\.edu\.cn
###### 摘要
激活导向通过在推理时向隐藏状态添加向量或特征来控制语言模型,但这些导向信号的上游来源通常被视为次要细节。我们将这种来源选择研究为 *激活源选择*:用于收集构建导向信号所需隐藏状态的源上下文和激活读取策略的组合。在保持下游干预固定的情况下,我们在三个指令微调模型和四个导向任务家族中证明,仅改变源激活就会显著改变导向效果。我们进一步发现,有效的导向并不能简单地用目标行为是否出现在源文本来解释。相反,强大的信号来自 *执行边界* 状态,即模型即将产生或继续目标行为的状态。这种前实现/后实现的区分解释了为什么基于答案的来源有时有效:它们的有用成分与执行边界方向对齐,而不仅仅是目标出现。基于这一观点,我们引入了尾部减法,它从边界状态中移除共享的提示和续写语义,从而产生更清晰、更稳定的导向信号。总体而言,我们的结果表明,导向依赖于模型 *即将做什么* 的表征,而不仅仅是已经出现的内容。
导向信号从何而来:激活导向中的激活源选择
叶嘉然1,3,\*冉令旭3,\*姚子俊3王晨鹏6江勇5侯磊3李娟子3潘良明1,2,4,†1计算语言学教育部重点实验室,北京大学2计算机学院,北京大学3计算机科学与技术系,清华大学4北京人工智能研究院,北京,中国5清华大学深圳国际研究生院6一信-AILab,一信,北京,中国\{yejr23,rlx22\}@mails\.tsinghua\.edu\.cnliangmingpan@pku\.edu\.cn
††footnotetext:\*同等贡献。†通讯作者。## 1 引言
大型语言模型通常通过改变其输入或更新其参数来控制。*激活导向* 提供了第三种选择:在推理时,我们向模型的隐藏状态添加一个小信号,使得同一模型更有可能以期望的方式行为 (Subramani et al., 2022 (https://arxiv.org/html/2607.25270#bib.bib25); Turner et al., 2023 (https://arxiv.org/html/2607.25270#bib.bib31); Zou et al., 2023 (https://arxiv.org/html/2607.25270#bib.bib37))。这种信号可以使答案更简洁、包含更多表情符号、更可能提及目标实体,或者更可能拒绝不安全的请求。
然而,导向信号必须首先在某个地方找到。在激活导向流程的许多环节中,这是通过在与期望行为相关的示例上运行模型,从这些示例中读取隐藏激活,然后将激活转换为向量来完成的。一个常见的策略是使用展示目标行为的源提示,然后平均这些提示的隐藏状态。例如,为了使答案包含更多表情符号,可以收集包含大量表情符号响应的提示和补全的激活,并使用其均值作为风格方向。
参见图注图1:我们的激活源视图概述。在固定下游导向流程的情况下,不同的源激活会产生截然不同的导向行为。前置化的执行边界状态比后置化的目标出现痕迹更有效。这些上游选择在实践中很常见,但通常被视为设置细节。大多数近期工作从收集源激活之后开始:它询问如何将这些激活转化为更好的向量或特征,以及如何更有效地将结果信号注入模型 (Rimsky et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib20); Konen et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib13); He et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib9); Postmus and Abreu, 2024 (https://arxiv.org/html/2607.25270#bib.bib19); You et al., 2026 (https://arxiv.org/html/2607.25270#bib.bib36))。我们反而问一个更早的问题:导向信号应该来自哪里?这很重要,因为导向向量是从源激活本身估计的;如果这些激活包含不同的信息,相同的构建和注入方法可能会产生不同的导向行为。我们将这种上游选择研究为 *激活源选择*:源上下文(用于引发激活的文本)和读取策略(选择或聚合隐藏状态的规则)的组合。图1 (https://arxiv.org/html/2607.25270#S1.F1) 说明了这一观点。
我们的主要发现是,有效的导向并不能简单地用目标行为是否在源文本中可见来解释。一种常见的目标来源策略假设,当激活从已经实现期望行为的上下文中读取时,它们是有用的。我们称此为 *目标出现* 直觉。然而,记录模型已经说过什么的状态,可能不是使其再次这样做的最佳把手。强大的导向反而常常来自 *执行边界* 状态,即模型即将产生或继续目标行为的状态。
我们在三个指令微调模型和四个导向任务家族中测试了这一观点。在保持下游干预固定的情况下,仅改变源激活就会在导向成功率上产生巨大差异。仅使用提示的最后一个词元来源平均最强,而仅使用答案的来源则是最弱的之一,尽管它们明显包含目标行为。关系补全进一步将答案产生前的状态与出现后的状态分开:前置化的边界状态可靠地引导,而后置化的答案状态则弱得多。当基于答案的来源确实有效时,其有用信号部分地与执行边界方向对齐。
这种解释也引出了一个实用的构建方法。执行边界状态包含有用的目标准备,但也包含聊天格式、用户问题和一般的续写语义。我们引入了 *尾部减法*,它从每个目标条件边界状态中减去一个匹配的仅尾部状态。这分离出一个更清晰的边界信号,并优于仅正向和普通的对比基线。
#### 贡献。
我们的贡献有四个方面。首先,我们将 *激活源选择* 公式化为激活导向中一个明确的上游设计选择,将源上下文与读取策略分开,并在操作上区分执行边界状态和后实现痕迹状态。其次,我们证明了在固定的下游干预下,这一选择具有巨大的实证效果。第三,我们提供了证据表明,有效的导向更好地由执行边界状态(模型即将产生目标行为的状态)解释,而不是仅仅由目标出现解释。最后,我们引入了尾部减法,这是一种简单的源构建方法,可以移除共享的局部续写语义,从而产生更清晰的边界信号。
## 2 背景与相关工作
### 2.1 激活导向
激活导向通过在推理时干预隐藏表示来修改模型行为。先前的工作表明,这种干预可以从激活加法、对比方向、表征工程方向、均值中心向量、风格或人格方向以及诸如拒绝等行为特定方向构建 (Subramani et al., 2022 (https://arxiv.org/html/2607.25270#bib.bib25); Li et al., 2023 (https://arxiv.org/html/2607.25270#bib.bib15); Turner et al., 2023 (https://arxiv.org/html/2607.25270#bib.bib31); Zou et al., 2023 (https://arxiv.org/html/2607.25270#bib.bib37); Jorgensen et al., 2023 (https://arxiv.org/html/2607.25270#bib.bib12); Rimsky et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib20); Konen et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib13); Arditi et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib3); Chen et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib6))。更近的工作研究了替代干预规则,包括激活缩放、基于概念器的导向、条件拒绝导向、动态导向和几何感知旋转 (Stoehr et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib22); Postmus and Abreu, 2024 (https://arxiv.org/html/2607.25270#bib.bib19); Lee et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib14); Stolfo et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib23); Wang et al., 2025a (https://arxiv.org/html/2607.25270#bib.bib32); Li et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib16); Scialanga et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib21); Su et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib24); You et al., 2026 (https://arxiv.org/html/2607.25270#bib.bib36))。稀疏自编码器方法提供了相关的特征级路径来解释和引导模型行为 (Templeton et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib29); Huben et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib11); Chalnev et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib5); He et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib9))。
本文使用加法向量导向作为其基本干预设置。令 fθf\_\{\theta\} 为自回归语言模型,具有隐藏状态 hl,th\_\{\ell,t\} 在层 ℓ\ell 和生成位置 tt。给定一个导向向量 vv,加法导向修改隐藏状态为
h~l,t=hl,t\+αv,\tilde\{h\}\_\{\ell,t\}=h\_\{\ell,t\}+\\alpha v, (1) 其中 α\\alpha 控制干预强度。我们的重点不是引入 Eq.1 (https://arxiv.org/html/2607.25270#S2.E1) 的新形式,也不是优化层或强度作为独立研究对象。相反,我们保持下游干预族固定,并询问哪些上游隐藏状态应提供构建 vv 的证据。
### 2.2 激活源选择
导向向量是从干预前收集的激活计算得出的。我们将这些激活称为 *源激活*。对于源示例 zz,让源上下文函数 cc 产生一个词元序列 x1:Tz\(z\)=c\(z\)x^\{(z)\}\_\{1:T\_\{z\}\}=c(z),例如包含目标概念的句子、使目标行为可能的提示或匹配的控制上下文。给定此上下文和源层 ls\ell\_\{s\},读取策略 ρ\\rho 从结果激活中选择或聚合位置:
slsρ,c\(z\)=ρ\(hls,1\(c\(z\)\),...,hls,Tz\(c\(z\)\)\)。s\_\{\ell\_\{s\}\}^\{\\rho,c\}(z)= \\rho\\!\\left(h\_\{\ell\_\{s\},1\}(c(z)),\\ldots,h\_\{\ell\_\{s\},T\_\{z\}\}(c(z))\\right)。 (2) 例如,ρ\\rho 可能读取最后一个词元状态或平均源词元。
我们定义 *激活源选择* 为 σ=\(c,ρ\)\\sigma=(c,\\rho):源上下文和读取策略的选择。对于一组正向和可选的负向源示例,此选择诱导出源激活集 Sσ,ls\+S\_\{\\sigma,\\ell\_\{s\}\}^+\} 和 Sσ,ls−S\_\{\\sigma,\\ell\_\{s\}\}^-\},向量构建规则 gg 将其映射为导向向量:
v=g\(Sσ,ls\+,Sσ,ls−\)。v=g(S\_\{\\sigma,\\ell\_\{s\}\}^+\},S\_\{\\sigma,\\ell\_\{s\}\}^-\})。 (3) 这种表示法分离了实践中经常耦合的两个设计选择:隐藏状态如何转换为方向,以及哪些隐藏状态可用于该转换。先前的工作通常将源文本和读取策略视为设置选择;最近的一项研究讨论了源文本效果,但仅针对一小部分人格特质,并得出了与我们不同的结论 (Chen et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib6))。在本文中,我们 *不引入新的向量构建规则*;相反,我们使用标准方法实例化 gg,例如均值方向、PCA 方向和基于 SAE 的特征,并研究在等式1 (https://arxiv.org/html/2607.25270#S2.E1) 的固定下游干预下,改变 σ\\sigma 如何影响导向。
## 3 实验设置
我们的实验分离了用于构建导向信号的上游源激活。我们固定干预族、向量构建、层-强度搜索和评估协议,仅改变 *激活源条件*:源上下文和读取位置,实例化第 2.2 节 (https://arxiv.org/html/2607.25270#S2.SS2)中的 σ=\(c,ρ\)\\sigma=(c,\\rho)。
### 3.1 模型
我们在三个开放权重的指令微调模型上进行评估:Gemma-2-9B-IT (Team, 2024a (https://arxiv.org/html/2607.25270#bib.bib26))、Qwen2.5-7B-Instruct (Yang et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib35)) 和 Llama-3.1-8B-Instruct (Team, 2024b (https://arxiv.org/html/2607.25270#bib.bib28))。这使我们能够测试激活源效果是否跨模型家族持续存在。
### 3.2 导向任务
我们在四个异质的任务家族上评估导向:**实体** 导向使生成内容提及普通概念,如 `cat`、`coffee` 或 `music` (11 个目标) (Templeton et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib29); He et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib9); Wu et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib34));**人格/风格** 诱导情感或风格性回应,如开心、愤怒、奉承、反问或大量表情符号的输出 (7 个目标) (Konen et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib13); Chen et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib6));**拒绝** 诱导类似拒绝的行为 (1 个目标) (Arditi et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib3); Wang et al., 2025b (https://arxiv.org/html/2607.25270#bib.bib33));以及 **胡言乱语** 诱导事实上错误或无意义但可读的答案 (1 个目标) (Chen et al., 2025 (https://arxiv.org/html/2607.25270#bib.bib6))。这些任务共同测试了内容插入、回应方式、行动策略和语义正确性。
#### 评估。
对于每个行为任务,导向模型回答与目标属性无关的保留通用问题。一个固定的 Qwen2.5-14B-Instruct 裁判 (Yang et al., 2024 (https://arxiv.org/html/2607.25270#bib.bib35)) 为目标表达和生成有效性分配二元标签,其中有效输出必须保持正常和可读,而不是崩溃为泛滥、重复或畸形文本。我们对行为输出的分层样本验证自动裁判,发现与独立的验证标签一致性很高。使用 Gemma-3-27B (Team, 2025 (https://arxiv.org/html/2607.25270#bib.bib27)) 进行的完全重新评分也保留了主要的源条件模式;详见附录A (https://arxiv.org/html/2607.25270#A1.SS0.SSS0.Px7)。我们仅当两个标准都满足时才将生成计为成功,报告由此产生的 **导向成功率**,并保留在搜索的层-强度网格上的最佳得分。附录第A节 (https相似文章
预测激活引导的副作用
本文研究了语言模型中激活引导的副作用是否能在干预前被预测,构建了一个涵盖67种行为的交叉效应矩阵,并发现副作用是系统性的且可从未引导的表示中进行预测。
你的LLM何时可引导?
本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。
想要更好的合成数据?引导它:用于低资源语言生成的激活引导
本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。
你的LLM何时可引导?
本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。
角度-范数分解下的激活转向几何解释
本文通过将干预分解为角度和径向分量,分析了语言模型中的线性激活转向。研究发现概念主要编码在角度结构中,但范数调整对稳定性至关重要,支持球形转向方法的同时表明加性系数混淆了几何特性。