面向大型语言模型的可部署逐实例多层激活引导
摘要
本文介绍了一种可部署的逐实例多层激活引导技术,用于大型语言模型,表明最优层选择随输入变化,并且可以在推理时仅从提示嵌入中预测,而不需要金标准标签。
arXiv:2608.08829v1 公告类型:新
摘要:激活引导通过向冻结语言模型的残差流中添加学习向量来编辑其行为,而当前实践是在每个任务上全局固定注入层。我们认为最佳层是一个实例级决策,并让逐实例多层选择既易于理解又可部署。在两个开放权重的8B模型和六个二元人格特质上,针对层子集的逐实例oracle表明,最佳层会随输入而变化:在大多数特质-模型对上,没有任何固定的全局层集合能恢复逐实例的收益。一种按单层边际效应对层进行排序的贪心规则几乎恢复了oracle的所有收益,但两者都必须根据金标准答案对候选层进行评分,因此都无法在部署时运行;该规则反而成为仅基于提示的预测器被训练去复现的目标。我们的可部署方案在推理时不需要任何标签:一个从提示嵌入中读取的逐实例层排序器,一个推断引导方向的分类器,以及一个自适应门控——它根据推断出的方向对短引导通过进行评分,并且只引导必要数量的层。该方案恢复了oracle的大部分提升(在较强模型上恢复了大部分,在较难模型上恢复了明显多数),平均而言不会使任何特质-模型对低于其未引导的对齐基线,并且在很大程度上避免了强全局选择在较高层数时带来的流畅度崩溃。一种机制性解释——“方向重于幅度”——解释了错误引导的全局集合下的行为反转、引导过多层导致的输出崩溃,以及不可引导输入的极限。
查看缓存全文
缓存时间: 2026/08/11 08:10
# 面向大语言模型的可部署逐实例多层激活引导
来源:https://arxiv.org/html/2608.08829
Muhammad Faishal Adly Nelwan
印度尼西亚大学计算机科学学院
muhammad\.faishal21@ui\.ac\.id
&
Alfan Farizki Wicaksono
印度尼西亚大学计算机科学学院
alfan@cs\.ui\.ac\.id
###### 摘要
激活引导(Activation steering)通过向冻结语言模型的残差流中加入一个学习得到的向量来改变其行为,而当前实践通常将注入层全局固定为每个任务一个设置。我们认为最佳层是一个实例级决策,并让逐实例、多层的层选择既易于理解又具备可部署性。在两个开放权重 8B 模型和六个二元人格特质上,一个基于层子集的逐实例 oracle 表明最佳层会随输入变化:在大多数特质-模型组合上,没有任何固定的全局层集能够复原逐实例的收益。一个按单层边际效应排序层的贪心规则几乎能复原 oracle 的全部收益,但这两者都必须依据黄金答案对候选层评分,因此都无法在部署时运行;该规则转而成为一个仅用提示的预测器被训练去复现的目标。我们的可部署方案在推理时不需要任何标签:一个从提示嵌入读取的逐实例层排序器,一个推断引导方向的分类器,以及一个根据该推断方向对短引导过程评分、并且只引导必要层数的自适应门控机制。该方案复原了 oracle 的大部分提升(在较强模型上占主体,在较难模型上占明显多数),在平均意义上从未使任何特质-模型组合低于其未引导的一致性基线,并且基本避免了强全局选择在更高层数时产生的流畅度崩溃。一个机制性解释——*方向胜过幅度*——解释了在错误定向的全局设置下出现的行为翻转、引导过多层导致的输出崩溃,以及不可引导输入的天花板效应。
# 面向大语言模型的可部署逐实例多层激活引导
Muhammad Faishal Adly Nelwan
印度尼西亚大学计算机科学学院
muhammad\.faishal21@ui\.ac\.id
Alfan Farizki Wicaksono
印度尼西亚大学计算机科学学院
alfan@cs\.ui\.ac\.id
## 1 引言
激活引导通过在推理时干预内部表示来改变冻结语言模型的输出,通常是在一个或多个层向残差流中加入一个学习得到的向量(Turner et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib21); Li et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib9); Zou et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib26); Rimsky et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib14))。一旦向量被提取出来,当前实践会将其余选择视为配置细节:*哪些*层接收该向量,全局固定为每个任务一个设置,以及*多少*层。111我们在整个过程中将α\\alpha保持为两种预设调度,因此行为变化可归因于层选择而不是剂量(Vu and Nguyen,2025 (https://arxiv.org/html/2608.08829#bib.bib22); Oozeer et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib11); Soo et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib18); Diallo et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib3))。两者困难的原因相同:正确答案取决于输入。层选择在子集大小KK上是组合性的,其最优值又依赖于实例;有用剂量随每个输入距离目标行为的远近而变化。我们询问是否可以在K\>1K\{\>\}1、推理时没有黄金标签、也不需要穷举子集搜索的情况下,逐实例地解决这两个问题。222代码:https://github.com/pesolosep/per-instance-layer-steering
先前工作覆盖了这一设计空间中邻近的部分,但不是我们的目标:一个逐实例排序的K\>1K\{\>\}1子集,以及一个在层数上具有回退门控的机制(§2 (https://arxiv.org/html/2608.08829#S2))。
#### 为什么逐实例的K\>1K\{\>\}1很重要。
激活引导的主要实际用途是对已部署模型进行事后行为控制,而不同输入的可引导性差异很大(Tan et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib20))。一个最大化总体均值Δp\\Delta p的全局层集,会在引导尚有作用空间的实例上浪费可引导子集的收益,并且在更高的KK下会将已饱和实例过度引导,导致流畅度崩溃(§4.2 (https://arxiv.org/html/2608.08829#S4.SS2))。在 Anthropic-Persona 上受限的 Y/N Δp\\Delta p——一个探测行为特质的 yes/no 问题语料——是此类行为校准的标准内在指标(Perez et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib13); Sun et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib19));可引导子集上的更高提升,意味着在从业者恰恰需要控制的地方,特质匹配概率更紧密。我们同时衡量 Y/N 对齐(Δp\\Delta p)和被引导模型自由文本理由的困惑度(Δ\\DeltaPPL),作为过度引导的防护(§4.2 (https://arxiv.org/html/2608.08829#S4.SS2))。
#### 可部署性张力。
逐实例选择有一个问题:任何能找到最佳层的方法,都是针对黄金答案对候选进行评分的。逐实例 oracle 及其贪心代理都通过朝向黄金 token 评分的引导前向传播来评估层子集,因此两者都无法在部署时运行。它们充当上界,并作为可部署排序器的训练目标;我们询问一个在测试时没有标签的系统能复原 oracle 的多少收益,以及推理成本是多少。
#### 贡献。
我们让逐实例、多层选择既得到充分理解,又具备可部署性,并且所有推理时组件都是无标签的:
- • *最佳层随输入变化。* 一个基于层子集的逐实例 oracle 表明最优层会随输入变化;在大多数特质-模型组合上,没有固定的全局集能复原逐实例收益,而强全局规则会把整个特质-模型单元推向其未引导基线之下(§4.1 (https://arxiv.org/html/2608.08829#S4.SS1)、§4.3 (https://arxiv.org/html/2608.08829#S4.SS3))。
- • *贪心选择在结构上充分,但它是一个目标而非一个系统。* 按单层边际效应得到的逐实例前KK子集(Top-KK-Marginal,TKM)在大多数配置上匹配K=3K\{=\}3的穷举最优,Shapley 分解解释了原因:最高的边际层是联合子集的最高信用承担者,因此贪心求解器和联合求解器落在同一个锚点上(§4.1 (https://arxiv.org/html/2608.08829#S4.SS1))。由于TKM仍然依据黄金答案对候选评分,它并不可部署;它成为可部署系统的训练目标。
- • *一个无标签的可部署方案。* W2S-Multi,一个从提示嵌入的 PCA 中读取的逐实例层排序器,加上一个在相同特征上推断引导方向g^\\hat\{g\}(x)(x)的分类器,再加上一个自适应-KK门控,它根据g^\\hat\{g\}对短引导过程评分,并且只引导必要的层数。该方案在可引导层级上复原了 oracle 的大部分提升,在平均意义上从未使任何特质-模型单元低于其未引导一致性基线,并且基本避免了强全局选择在更高KK时产生的流畅度崩溃(§4.3 (https://arxiv.org/html/2608.08829#S4.SS3)、§4.2 (https://arxiv.org/html/2608.08829#S4.SS2))。
- • *一个机制性解释:方向胜过幅度。* 推动是否指向一个输入的答案,而不是推动的强度,解释了错误定向的全局设置下的行为翻转、引导过多层导致的输出崩溃、不可引导输入的天花板效应,以及一个初步的跨模型分离(§5 (https://arxiv.org/html/2608.08829#S5))。
## 2 相关工作
对比激活加法(Contrastive activation addition)(Rimsky et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib14))定义了我们所使用的加法引导算子,其中层选择是一个通过逐个行为扫描设定的固定超参数。LayerNavigator(Sun et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib19))在全局范围内对层评分,并将前KK层统一应用于所有输入(比较 Wu et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib24));Where-to-Steer(Gadgil et al.,2026 (https://arxiv.org/html/2608.08829#bib.bib4))学习一个逐实例选择器,但只应用一个层;ASPS(Bhandari et al.,2026 (https://arxiv.org/html/2608.08829#bib.bib1))将特质全局先验与一个提示特定的动态层混合;Parekh et al. (2025 (https://arxiv.org/html/2608.08829#bib.bib12)) 则改为自适应引导向量。CAST(Lee et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib8))和 MERA(Hedström et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib6))决定是否引导,而不是决定多少个排序层;系数侧控制(Rimsky et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib14); Zou et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib26); Scalena et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib16); Wang et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib23); Rodriguez et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib15))调整剂量而非位置;Nguyen et al. (2025 (https://arxiv.org/html/2608.08829#bib.bib10)) 转而针对 token 位置。失败模式(Turner et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib21); Vu and Nguyen,2025 (https://arxiv.org/html/2608.08829#bib.bib22); Oozeer et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib11); Soo et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib18); Diallo et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib3); Tan et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib20))激发了对逐输入控制的需求,以替代全局层和门控选择。我们针对内部点——带有一个回退门控的逐实例排序K\>1K\{\>\}1子集——并提供使其可部署的无标签、仅提示的排序器、推断方向和门控。
## 3 实验设计
参见图注图1:逐实例、多层引导流水线。离线(每任务):CAA 给出逐层向量v(l)v^\{(\ell)\}和 LayerNavigator 评分,并且在预测器训练集上单独引导每一层,得到效应t(x)t(x),其前KK就是排序器 W2S-Multi 和方向分类器的TKM标签。推理时:一个嵌入产生排名SK(x)S\_\{K\}(x)和方向g^(x)\hat\{g\}(x);自适应-KK门控沿着排名向下添加v(l)v^\{(\ell)\},直到某个停止规则触发(loop==在每个生成步骤的最后一个 token 处重新注入)。
#### 模型、数据、划分。
Llama-3-8B-Instruct(Grattafiori et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib5))和Aya-Expanse-8B(Dang et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib2)),在六个 Anthropic-Persona 行为特质(Perez et al.,2023 (https://arxiv.org/html/2608.08829#bib.bib13))上进行评估,这些特质以二元 Y/N 多项选择题形式给出,复用了 Sun et al. (2025 (https://arxiv.org/html/2608.08829#bib.bib19)) 的选择和黄金标签(Tab.3 (https://arxiv.org/html/2608.08829#A1.T3))。提示模板和受限 Y/N softmax 见附录 A (https://arxiv.org/html/2608.08829#A1.SS0.SSS0.Px1)。每个配置(任务×\\times模型×\\timesα\\alpha):700700 个引导实例、200200 个验证实例、100100 个测试实例(总共 2,4002\{,\}400 个测试实例)。
#### 引导与TKM。
我们遵循 CAA(Rimsky et al.,2024 (https://arxiv.org/html/2608.08829#bib.bib14)),并采用 Sun et al. (2025 (https://arxiv.org/html/2608.08829#bib.bib19)) 的最后一个 token 注入:在选择子集SS(\|S\|=K\|S\|\{=\}K)中的每一层ll,我们在每个生成步骤向残差流加入αlvl\\alpha\_\{l\}\\mathbf\{v\}\_\{l\}(附录 A (https://arxiv.org/html/2608.08829#A1.SS0.SSS0.Px2))。我们扫描αl∈{1,1/K}\\alpha\_\{l\}\\in\\\{1,\\,1/\sqrt\{K\}\\\}(均匀规范和平方根规范两种调度)以及K∈{0,...,5}K\\in\\\{0,\\ldots,5\\\}。*Top-KK-Marginal*(TKM)子集为
STkm(x;K)=argmax\|S\|=K∑l∈Sml(x),S\_\{\\textsc\{Tkm\}\}(x;K)\;=\;\operatorname\*\{arg\,max\}\_\{\|S\|=K\}\;\sum\_\{l\in S\}m\_\{l\}(x),
其中ml(x)m\_\{l\}(x)是层ll在输入xx上的单层(K=1K\{=\}1)提升,KK是子集大小:TKM取个体效应最大的KK层,成本随深度线性增长。在K\>1K\{\>\}1时,这*不是*联合最优:它可能与在(32K)\\binom\{32\}\{K\}个子集上的 argmax(Exhaustive,在K=3K\{=\}3时可枚举,超出则不可)不同。
#### 黄金感知参考 vs. 可部署基线。
Exhaustive(K≤3K\{\leq\}3)实现了逐实例 oracle,并提供上界e ̄⋆\\bar\{e\}^\{\star\}。Beam(宽度44)是一个独立的池化目标启发式,仅在K∈{4,5}K\{\in\}\\\{4,5\\\}作为趋势检查报告。GT-global是*样本内全局 oracle*:每个单元,在单元自身的实例上,它引导单层平均效应最高的KK层,一个固定集原封不动地应用于每个输入。以上三种方法都和TKM一样依据黄金答案对候选评分,因此都不可部署;它们标定了选择所能达到的边界。可部署基线是LN-global(Sun et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib19)),其无标签层评分从向量提取中直接产生(其KK在与预测器训练相同的数据划分上选择,绝不在测试集上),以及All-layers(K=32K\{=\}32均匀),即无选择的对照。
#### 可部署方案。
三个无标签组件(图1 (https://arxiv.org/html/2608.08829#S3.F1))。(1)*排序*:W2S-Multi,一个单隐层 MLP,输入是未引导的 Qwen3-Embedding(Zhang et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib25))提示表示的2525维 PCA,以列表方式(softmax-KL)训练,以复现每个训练输入的逐层效应分布——也就是TKM排名的对象——并在推理时读出前KK层;一次嵌入前向,没有引导前向,没有标签(附录 B (https://arxiv.org/html/2608.08829#A2.SS0.SSS0.Px1))。最接近的先前选择器是 Where-to-Steer 的单层预测器(Gadgil et al.,2026 (https://arxiv.org/html/2608.08829#bib.bib4)),我们将它的嵌入-MLP 设计扩展为多层排序。另外两个可部署几何基线,一个使用未引导前向的激活几何特征,另一个使用几何++嵌入混合特征(附录 B (https://arxiv.org/html/2608.08829#A2.SS0.SSS0.Px2)),它们共享 W2S-Multi 的目标和预算,用来测试一个输入的层是更好地从提示的意义中读取,还是从激活的几何中读取。(2)*方向推断*:在相同的2525维 PCA 上进行逻辑回归,推断g^(x)\hat\{g\}(x),即引导应推动输入朝向的答案;它用于为*评分*定向,而不是推动本身,并且不增加额外的前向成本(附录 C (https://arxiv.org/html/2608.08829#A3.SS0.SSS0.Px1))。(3)*自适应-KK门控*:CAST 的 apply-or-skip 条件(Lee et al.,2025 (https://arxiv.org/html/2608.08829#bib.bib8))在行为层面的对应物,决定*引导多少层*。从K=1K\{=\}1沿排名前缀行走,并依据g^(x)\hat\{g\}(x)对每一步的短引导前向评分,它在提升平台、Y/N 质量下限或突然的质量下降处停止,并提交所见过的最佳深度;当Pbase(g^(x)∣x)≥0.5P\_\{\text\{base\}\}(\hat\{g\}(x)\mid x)\geq 0.5时上限为Kmax=5K\_\{\max\}\{=\}5,否则为较为保守的33。所有六个常数都是预先设定的,而不是在评估集上调优的;一次432432配置的扫描确认它们接近最优(附录 C (https://arxiv.org/html/2608.08829#A3.SS0.SSS0.Px2))。该门控与具体方法无关:我们把它包在TKM*和*全局基线外面。
#### 指标、层级、检验。
主要指标:Δp\\Delta p,即在受限 Y/N softmax 下黄金答案概率的偏移(Sun et al.,2025 (https://arxiv.org/相似文章
你的LLM何时可引导?
本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
多语言设计导向的调控:多语言稀疏自编码器与原则性层选择
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。
想要更好的合成数据?引导它:用于低资源语言生成的激活引导
本文研究了激活引导作为替代少样本提示的方法,用于生成低资源语言的合成数据。作者提出了LanguageSteering和QualitySteering策略,表明在早期层进行引导可以提高数据多样性并改善下游模型性能。
一层解释所有:理解大型语言模型中的大规模激活现象
本文识别出大型语言模型(LLM)中极端激活现象产生并传播的“大规模涌现层(Massive Emergence Layer)”,并提出一种缓解其僵化性、提升模型在数学推理和指令遵循等任务上性能的方法。