微调是否会撤销激活引导?行为恢复而无权重编辑逆转
摘要
本文研究微调是否会撤销语言模型中的激活引导,发现尽管在优化压力下,拒绝抑制等行为效应可能退化,但底层的权重修改在机制上保持稳定。
arXiv:2608.24988v1 公告类型:新
摘要:激活引导可以直接嵌入语言模型的权重中,在推理时无需干预即可塑造行为,并提供一种在发布前编码对齐的方式。然而,模型在部署后通常会被微调,目前尚不清楚嵌入的干预是否能在这种情况下幸存。我们研究了在非对抗性SFT和RLHF下,嵌入引导在拒绝抑制和简洁性诱导方面的稳定性,涉及五个指令微调模型(3B-14B)。在行为上,保持程度与训练数据相关:当优化压力与目标行为相矛盾时,引导会退化,否则会持续存在,其中拒绝消除在SFT下平均失去64%的效果。然而在机制上,即使行为恢复,权重编辑也几乎未受影响:平均向量恢复为 $\rho = 0.004$,且沿引导方向的微调更新与其编辑前的权重模式近乎正交(平均 $\cos\theta = 0.074$)。当引导行为退化时,微调并非通过拆解或逆转引导机制本身来实现。因此,嵌入引导在机制上持久但在功能上脆弱,需要在下游训练后进行行为重新验证。
查看缓存全文
缓存时间: 2026/08/27 09:13
# 微调会撤销激活引导吗?无需权重编辑逆转的行为恢复
来源:https://arxiv.org/html/2608.24988
## 微调会撤销激活引导吗?无需权重编辑逆转的行为恢复
致谢:本文被EMNLP 2026主会议录用。
Allan Tucker, Yongmin Li, Alina Miron
单位:布鲁内尔大学计算机科学系
单位:\{phil\.glass, allan\.tucker, yongmin\.li, alina\.miron\}@brunel\.ac\.uk
###### 摘要
激活引导可以直接嵌入到语言模型的权重中,在不进行推理时干预的情况下塑造模型行为,为在发布前编码对齐提供了一种方式。然而,模型在部署后通常会经过微调,目前尚不清楚嵌入的干预措施是否能在微调后存活。我们研究了嵌入式引导在五个指令微调模型(3B–14B)中,在非对抗性监督微调(SFT)和基于人类反馈的强化学习(RLHF)下,对于拒绝抑制和简洁性诱导的稳定性。从行为上看,保持程度与训练数据相关:当优化压力与目标行为相矛盾时,引导效果会退化,否则得以保留;在SFT下,拒绝消除平均丧失了64%的效果。然而,从机制上看,即使行为发生逆转,权重编辑也几乎保持原样:平均向量恢复率ρ=0\.004,且微调更新在引导方向上几乎正交于其编辑前的权重模式(平均cosθ=0\.074)。当被引导的行为退化时,微调并非通过拆解或逆转引导机制本身来实现。因此,嵌入式引导在机制上是持久的,但在功能上是脆弱的,需要在下游训练后进行行为再验证。
## 1 引言
图1:比较不同引导和微调条件下的行为逆转与权重编辑恢复情况。尽管被引导的行为经常退化(特别是在SFT下),但底层的权重修改在机制上保持稳定(平均向量恢复率ρ=0\.004)。当行为表现退化时,这是通过替代机制而非逆转原始权重编辑来实现的。
大型语言模型很少以其训练状态直接部署。后训练阶段侧重于指令遵循和风格塑造等能力(Ouyang等,2022 (https://arxiv.org/html/2608.24988#bib.bib12);Li等,2025 (https://arxiv.org/html/2608.24988#bib.bib13)),并且在此基础上,下游用户和模型提供者经常执行进一步的特定任务微调(Li等,2025 (https://arxiv.org/html/2608.24988#bib.bib13);Qi等,2024 (https://arxiv.org/html/2608.24988#bib.bib10))。*激活引导*是训练的一个有益补充。它通过识别与某个概念或行为相关的特征向量来实现,然后可以诱导或抑制该行为(Turner等,2024 (https://arxiv.org/html/2608.24988#bib.bib1);Rimsky等,2024 (https://arxiv.org/html/2608.24988#bib.bib14);Zou等,2023 (https://arxiv.org/html/2608.24988#bib.bib15))。引导可以在推理时应用,也可以通过将编辑嵌入模型权重中来实现。这允许对行为进行精确改变,同时对通用能力的影响最小(Turner等,2024 (https://arxiv.org/html/2608.24988#bib.bib1);Rimsky等,2024 (https://arxiv.org/html/2608.24988#bib.bib14))。然而,这些编辑的稳定性尚不清楚。*如果用户微调一个经过引导的LLM,被引导的行为是持续存在还是恢复到基线水平?*由于微调可以覆盖行为约束(Qi等,2024 (https://arxiv.org/html/2608.24988#bib.bib10)),引导无需是绝对可靠的。但它必须在常规微调下足够稳定,才能具有实际用途。常规的、非对抗性的微调会使引导效果退化吗?111 通过无限制访问,针对性的对抗性微调可以轻易移除所有安全过滤器(Qi等,2024 (https://arxiv.org/html/2608.24988#bib.bib10);Murphy等,2025 (https://arxiv.org/html/2608.24988#bib.bib11)),这是开放权重模型的已知特性。引导只需足够稳定以具备实际用途即可。
如果行为确实退化了,训练是擦除了权重编辑,还是模型找到了其他方式绕过它?最近的研究表明,训练可以构建替代路径:模拟拒绝消除的对抗性训练(Yu等,2025 (https://arxiv.org/html/2608.24988#bib.bib3))和分散拒绝信号的微调(Shairah等,2025a (https://arxiv.org/html/2608.24988#bib.bib4))都能阻止基于引导的攻击,而无需移除引导方向。常规微调是否会偶然产生这种效果尚不得而知。此外,模型本身固有的被引导行为(例如拒绝)在微调期间可能容易恢复。由于模型已经知道如何拒绝(Zhou等,2023 (https://arxiv.org/html/2608.24988#bib.bib33)),它可能通过现成的回路路由信号来恢复,而不是从头构建新回路(Wang等,2023 (https://arxiv.org/html/2608.24988#bib.bib34))。这对于决定引导在预部署流程中的可行性至关重要,特别是当引导用于改善模型的安全配置文件、实施保障措施或抑制不良行为时。这对开放权重模型提供者最为相关,因为微调是预期的用例(Touvron等,2023 (https://arxiv.org/html/2608.24988#bib.bib22)),但也适用于向用户提供微调的闭源模型提供者。
我们研究在非对抗性训练设置中应用的常规优化压力是否会撤销嵌入式引导,以及在多大程度上会撤销。我们关注普通的下游微调,其中训练数据并非特意选择来对抗干预,但仍可能对其产生偶然的优化压力。我们考察行为和机制层面会发生什么,询问行为退化是反映了底层权重编辑的擦除,还是一个不同的现象(图1 (https://arxiv.org/html/2608.24988#S1.F1))。我们通过诱导回复简洁性(正向引导)和抑制拒绝(负向引导)来测试这一点,使用常见的SFT和RLHF训练范式。我们研究了全参数微调下五个模型的影响。222 选择全参数训练(相对于低秩适应,LoRA)是因为它在机制上代表了引导退化的最坏情况。
我们的工作做出了以下贡献:
1. 我们提出并研究了一个据我们所知尚未被研究过的问题:在五个模型、两种训练范式(SFT和RLHF)以及两种引导目标(拒绝抑制和简洁性诱导)下,嵌入式引导是否能在常规的下游微调后存活。
2. 我们发现权重编辑在机制上是稳定的,即使行为发生逆转,微调最多也只逆转了0\.79%的嵌入编辑(平均ρ=0\.004,平均cosθ=0\.074)。这种分离表明微调是绕过编辑而非擦除它,并且行为退化是由训练数据内容驱动的,而非嵌入式引导的内在脆弱性。
这些发现表明嵌入式引导是持久的:权重编辑没有被逆转,行为退化(如果发生的话)与训练内容相关,而非内在的脆弱性。我们的结果表明,对于嵌入式引导在预部署流程中的使用,特别是当它比仅基于训练的基线提高了模型安全性时,可以谨慎乐观。然而,当前的引导方法足够脆弱,可能需要在可能的情况下进行再验证。
## 2 基础知识与嵌入式引导
本节介绍激活引导背后的表征空间视角,并形式化我们使用的引导算子。我们解释如何发现特征方向,以及如何将线性引导编辑直接嵌入模型权重中。
### 2.1 表征与方向估计
##### 模型表征。 Park等(2024)(https://arxiv.org/html/2608.24988#bib.bib17)提出了线性表征假说,认为大型语言模型在激活空间中以近似线性方向来表示概念。这与在词嵌入中发现的线性结构一致(Mikolov等,2013 (https://arxiv.org/html/2608.24988#bib.bib18))。我们可以使用对比提示(Marks和Tegmark,2024 (https://arxiv.org/html/2608.24988#bib.bib16))、线性分类器(Belinkov,2022 (https://arxiv.org/html/2608.24988#bib.bib20))或稀疏自编码器(Huben等,2024 (https://arxiv.org/html/2608.24988#bib.bib21))来找到这些方向。尽管有些特征不是线性的(例如,表示一周中几天的循环表示,Engels等,2025 (https://arxiv.org/html/2608.24988#bib.bib19)),但许多特征是线性的,这激发了沿着这些方向移动激活的干预措施。
##### 特征方向与引导。 激活空间中的一个方向d对应一个概念或行为。将d添加到激活向量可以诱导该行为,而减去它则可以抑制该行为。先前的工作已经针对诚实性(Marks和Tegmark,2024 (https://arxiv.org/html/2608.24988#bib.bib16))、拒绝(Arditi等,2024 (https://arxiv.org/html/2608.24988#bib.bib2))和回复风格(Turner等,2024 (https://arxiv.org/html/2608.24988#bib.bib1))等进行了目标引导。*激活引导*在推理时将此方向应用于激活,或将其嵌入权重中。算子在第2.2节 (https://arxiv.org/html/2608.24988#S2.SS2)中正式定义。
##### 发现方向。 我们使用对比提示来发现方向(Marks和Tegmark,2024 (https://arxiv.org/html/2608.24988#bib.bib16);Turner等,2024 (https://arxiv.org/html/2608.24988#bib.bib1))。给定提示集D⁺(引出特征)和D⁻(不引出特征),我们记录用户回合最后一个token的激活h⁽ˡ⁾(x),并计算均值之差:v⁽ˡ⁾= 1/|D⁺| ∑_{x∈D⁺} h⁽ˡ⁾(x) - 1/|D⁻| ∑_{x∈D⁻} h⁽ˡ⁾(x),得到每个层一个向量,我们将其归一化为单位方向d⁽ˡ⁾=v⁽ˡ⁾/‖v⁽ˡ⁾‖。我们使用启发式方法选择最佳方向(s)(附录E (https://arxiv.org/html/2608.24988#A5))。
### 2.2 引导算子与权重嵌入
#### 2.2.1 推理时引导
##### 偏移引导。 引导沿着或逆着一个方向d移动激活。激活加法(ActAdd)添加一个常数偏移:h'⁽ˡ⁾ = h⁽ˡ⁾ ± d,在特定层以最大化引导效果(Turner等,2024 (https://arxiv.org/html/2608.24988#bib.bib1))。这个仿射变换在推理时应用。
##### 投影引导。 投影引导则使用线性变换从激活流中移除d:h'⁽ˡ⁾ = h⁽ˡ⁾ - d(dᵀ h⁽ˡ⁾),在所有层l中应用。这在之前的工作中用于抑制拒绝(Zou等,2023 (https://arxiv.org/html/2608.24988#bib.bib15);Arditi等,2024 (https://arxiv.org/html/2608.24988#bib.bib2);Yu等,2025 (https://arxiv.org/html/2608.24988#bib.bib3)),并在推理时应用。
#### 2.2.2 将线性引导嵌入权重
##### 嵌入投影引导。 我们可以将此投影嵌入权重中,以固化编辑(Arditi等,2024 (https://arxiv.org/html/2608.24988#bib.bib2)):W'ₐₜₜ = Wₐₜₜ - d dᵀ Wₐₜₜ,其中Wₐₜₜ是写入残差流的矩阵。333 通常是token嵌入(embed\_tokens)、注意力输出(attn\.o\_proj)和MLP下投影(mlp\.down\_proj)矩阵。我们可以使用因子a∈(0,1]来缩放抑制程度,以减少而非完全移除行为:W'ₐₜₜ = Wₐₜₜ - a (d dᵀ Wₐₜₜ)。
##### 为什么可以嵌入。 因为投影(公式2 (https://arxiv.org/html/2608.24988#S2.E2))是线性的,且残差流贡献是线性的(h=Wₐₜₜ z,其中z是馈入Wₐₜₜ的上游激活向量),我们可以将它们组合起来:h'=Wₐₜₜ z - d(dᵀ Wₐₜₜ z) = (Wₐₜₜ - d dᵀ Wₐₜₜ) z。因此,我们可以预先计算修改后的权重W'ₐₜₜ = Wₐₜₜ - d dᵀ Wₐₜₜ,以在零运行时成本下实现相同效果。相比之下,ActAdd添加了一个独立于激活的常数偏移,无法被吸收到权重中。
##### 激活放大。 我们也可以放大一个方向以增强特征(Shairah等,2025b (https://arxiv.org/html/2608.24988#bib.bib31)):W'ₐₜₜ = Wₐₜₜ + a (d dᵀ Wₐₜₜ),这与推理时的h'⁽ˡ⁾ = h⁽ˡ⁾ + a d(dᵀ h⁽ˡ⁾)相匹配。与偏移引导不同,放大是缩放现有的激活分量,这意味着在特征事先不存在的情况下,它无法诱导该特征。因此,公式4 (https://arxiv.org/html/2608.24988#S2.E4)–5 (https://arxiv.org/html/2608.24988#S2.E5)构成了一个从完全移除、部分抑制到在单一框架内放大的*调制谱*(Wang等,2025 (https://arxiv.org/html/2608.24988#bib.bib32);Shairah等,2025b (https://arxiv.org/html/2608.24988#bib.bib31))。
## 3 实验框架
我们研究在全参数微调下的稳定性,这直接扰动所有权重,并代表了训练导致编辑退化的最坏情况。其他扰动(特别是量化)可能具有同等或更大的破坏性,但不在我们的实验范围内。我们的主要问题是:被引导的行为能否在下游微调后存活,还是会恢复到基线水平?我们对五个指令微调模型应用了两种引导干预——拒绝消除和回复简洁性增强,然后使用SFT和RLHF对其进行微调。我们测量(i)*行为保持*(行为是否持续存在?)和(ii)*机制持久性*(权重编辑是否保持完整?)。
我们的训练数据特意包含轻微反对被引导行为的信号。核心测试是,当训练施加反向压力时,引导是否能存活。如果训练与被引导行为完全正交,它将不会对其施加压力,也就无法有效测试其弹性。具体而言,SFT和RLHF数据集都包含一小部分(约0\.1%)反对拒绝消除的示例。SFT包括对有害提示的拒绝补全(强烈反对非拒绝的信号),而RLHF包括在奖励模型下得分为低的有害提示(更稀少,但仍然是反对信号)。相比之下,虽然两个数据集都没有特意排除鼓励冗长的提示,但直接与简洁性增强相矛盾的示例相对较少。这有助于相似文章
微调回归的引力解释
本文提出了微调回归的引力解释:早期训练形成了占主导地位的行为流形,后续的对齐只轻微地偏移它,从而产生了一个持久的回归方向。实验表明,阻止该方向能以极小的任务成本降低有害性。
预测激活引导的副作用
本文研究了语言模型中激活引导的副作用是否能在干预前被预测,构建了一个涵盖67种行为的交叉效应矩阵,并发现副作用是系统性的且可从未引导的表示中进行预测。
通过行为微调对语言模型中的病理样行为模式进行建模
本文介绍了一个行为诱导框架,通过在结构化决策任务上微调语言模型,以引发生成分布中稳定的、上下文无关的偏移,从而模拟抑郁和偏执等病理样行为模式。
@no_stp_on_snek: 微调现场笔记 小行为调整就像水床:按下一处,另一处就鼓起来。我训练了一个模型…
一位微调从业者观察到,调整模型的某一行为常常会导致其他地方出现意外变化,就像水床效应一样。修复对抗性拒绝问题在不知不觉中破坏了严格的格式遵守,随后的修复又导致了过度同意或过度拒绝。
通过标题特定激活引导控制工具使用
本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。