CircuitSteer:通过稀疏自编码器电路实现几何对齐的多层引导
摘要
CircuitSteer 是一种新颖的框架,利用稀疏自编码器来识别和操控大型语言模型中的多层语义电路,与CAA等单层方法相比,能够实现更鲁棒且保持流畅性的行为引导。
查看缓存全文
缓存时间: 2026/08/07 07:51
# 通过稀疏自编码器电路实现几何对齐的多层引导
来源:https://arxiv.org/html/2608.05732
Mehrshad Saadatinia Parsa Razmara\*,† Ardalan Aryashad¹ Ali Abbasi¹ Seyedarmin Azizi
南加州大学,洛杉矶,美国
\{saadatin, prazmara, aryashad, abbasia, seyedarm\}@usc.edu
###### 摘要
控制大语言模型(LLM)的行为仍然是 AI 对齐领域的一项关键挑战。现有的引导方法,例如对比激活添加(CAA),通常依赖于由聚合激活差异推导出的固定单层干预。这些方法在语义多样的输入上施加单一干预,并且往往无法在层间维持一致的行为变化,从而限制了引导的有效性。在这项工作中,我们引入了 CircuitSteer,一个新颖的框架,利用稀疏自编码器(SAE)来识别并操纵分布在多个层中的连贯语义电路。通过基于特征共现激活和编码器解码器方向的几何对齐构建特征流电路,我们隔离出负责目标行为的特定多层子电路。然后,我们从这些稀疏特征中合成密集引导向量,并应用多点干预来引导模型的内部语义轨迹。我们使用跨多种任务的对比示例评估 CircuitSteer,包括毒性、情绪强度、谄媚和拒绝,涵盖两个模型家族。在所有模型和数据集上,CircuitSteer 是唯一能够持续产生保持流畅性的干预方法;竞争方法要么牺牲文本质量,要么缺乏覆盖范围,在谄媚和拒绝等复杂行为上完全失败。这些结果表明,通过强制所选特征之间的几何对齐来实现的多层电路引导,比静态单点干预产生更稳健、更有效的行为控制。代码可在 https://github.com/mehrshad-sdtn/CircuitSteer 获取。
²通讯作者。
参见标题
图 1:CircuitSteer 在行为降低和流畅性保持之间取得了最佳权衡。每个标记显示 8 种条件下的平均行为降低(Δ↑)和归一化困惑度(PPL̄↓)。CircuitSteer 在 PPL̄<1.0 时表现出最高的Δ,优于其他基线方法。
## 1 引言
对齐 LLM 需要在行为控制、稳定性和计算效率之间取得平衡。诸如基于人类反馈的强化学习(RLHF)(Christiano 等,2017;Rafailov 等,2023)等方法可以引发持久的行为变化,但计算成本高昂,会永久改变模型权重,并存在灾难性遗忘的风险。相比之下,提示工程无需训练,但效果脆弱且停留在表面。这些局限性推动了推理时引导(inference-time steering)的发展,它通过直接干预内部表示来调节模型行为,实现无需重新训练的细粒度控制。
推理时引导的一个核心问题是在何处以及如何进行干预。早期工作使用在单层的密集激活添加(Turner 等,2023;Zou 等,2023a),但这种方法混淆了残差流中编码的语义不同的概念,产生粗糙且往往不稳定的干预。SAE 提供了一种更 principled 的替代方案:通过将残差流激活分解为稀疏的单语义特征(Cunningham 等,2023),它们暴露了可解释的、解耦的方向,可以被单独定位(Marks 等,2024)。然而,大多数基于 SAE 的引导方法仍然假设在单层进行干预就足以控制行为。这一假设与越来越多的证据相矛盾,这些证据表明高层语义概念分布在多个层中,并通过网络逐步演化(Gurnee 和 Tegmark,2024;Park 等,2023),这意味着单个干预点只能捕获相关计算结构的一小部分。
因此,将引导扩展到多层是一个自然的下一步,但它引入了两个基本挑战。首先,在不同层编码相同概念的特征通常在几何上不对齐:它们的解码器方向指向不一致的朝向,因此简单地组合它们会产生破坏性干扰,降低引导效果和模型流畅性(Balagansky 等,2024);我们的消融研究直接证实了这一点,因为移除或反转对齐标准会在最难的行为上导致流畅性崩溃(第 5.3 节)。其次,由于残差流激活是顺序传播的,对较早层的干预会改变所有后续层所看到的表示。如果不考虑这种传播,添加更多的干预点会加剧这些扰动,导致过度引导和流畅性崩溃,而我们的实验表明,朴素的多元层基线始终表现出这种失败模式。
我们提出 CircuitSteer,一个多层引导框架,通过显式建模语义特征在层间的流动来解决这两个挑战。CircuitSteer 不是在每层独立选择特征,而是构建一个特征流电路:一个通过特征共现激活和 SAE 解码器方向的几何对齐的联合标准来识别的跨层子图。通过要求所选特征在层间指向兼容的方向,我们消除了破坏性干扰,并实现了稳定的、可加性的多点干预。从这些稀疏特征合成的引导向量应用于每个电路层,产生对模型内部表示的协调调制。这从黑盒的残差流干预过渡到透明的、特征级别的控制,其中负责目标行为的子电路可以直接被检查和调整。
如图 1 所示,CircuitSteer 在归一化困惑度低于 1.0 的情况下,在所有方法中实现了最高的平均行为降低,使其处于引导效果和流畅性保持的前沿。
我们的贡献如下:
- 我们引入了 CircuitSteer,一个无需训练的多元层引导框架,通过特征共现激活和解码器方向的几何对齐来识别特定行为的 SAE 电路,消除破坏性干扰,并在不修改权重的情况下实现保持流畅性的行为控制。
- 我们从经验上表明,解码器方向的几何对齐对于稳定的多层引导是必要的:不对齐的特征会导致流畅性崩溃,而对齐的特征在接近基线的困惑度下实现一致的行为降低。
- 我们将 CircuitSteer 与八个基线在四个行为数据集和两个模型家族(Gemma-2-2B 和 Llama-3.1-8B-Instruct)上进行了基准测试。CircuitSteer 是唯一在所有模型-数据集配置中保持流畅性的方法,并且有效地扩展到单层 CAA 无法降低拒绝率的拒绝引导。
## 2 相关工作
### 推理时引导。
推理时引导通过干预内部表示来调节模型行为,而无需修改权重。Turner 等(2023)引入了激活添加,计算对比差异向量来转变诸如情感等高层属性。Li 等(2023)通过 Inference-Time Intervention(ITI)扩展了这一点,使用跨注意力头的线性探针来提高真实性。Panickssery 等(2023)提出了对比激活添加(CAA),对行为对的平均差异向量进行平均以获得更稳健的引导,Zou 等(2023a)将这些思想统一到表示工程(RepE)中。一种补充方法 LoReFT(Wu 等,2024)学习受限于低秩线性子空间的任务特定干预,参数少于基于权重的 PEFT(Hu 等,2022;Ghiasvand 等,2026b;2025);我们将其作为监督引导基线。这些方法在单层内有效,但没有考虑概念随深度如何演化。引导向量也被应用于自然语言之外(Ilharco 等,2022):Abdollahi 等(2026a)使用最后一个 transformer 块上的学习对角引导向量进行硬件时序预测,对比提示条件用于引导基于 LLM 的性能估计(Abdollahi 等,2026b)。表示级干预扩展到时间序列基础模型(Wiliński 等,2024),并应用于生理和金融序列建模(Torabi 等,2026;Khezresmaeilzadeh 等,2025;Golkari 等,2026b;a)。
### 基于 SAE 的引导。
稀疏自编码器(SAE)将多语义的残差流激活分解为稀疏的单语义特征(Cunningham 等,2023),这些特征可以被组织成语义上可归因的子网络(Marks 等,2024)。最近的方法直接使用它们进行引导:SpARE/SRPS(Wang 等,2025)选择由角色扮演提示激活的特征,SAE-SSV(He 等,2025b)将引导向量约束到任务相关的 SAE 子空间(两者都是我们的单层 SAE 基线)。关于 SAE 引导是否能胜过简单探针存在争议。标准 SAE 可能不如线性探针(Wu 等,2025),但优先考虑因果影响而非激活幅度在很大程度上弥合了这一差距(Arad 等,2025),这启发了我们的几何对齐标准。与基于归因的电路发现(Marks 等,2024)使用的梯度来解释行为不同,CircuitSteer 从正向传递的共现激活和解码器方向余弦中选择跨层边用于引导;与单层 SAE 引导(Wang 等,2025;He 等,2025b;a)不同,其贡献在于一个多层的几何对齐标准,使协调的跨层干预保持流畅性。
### 多层引导与几何挑战。
跨层引导引入了已有充分记录的失败模式:在不同深度编码相同概念的特征通常在几何上不对齐,导致破坏性干扰(Balagansky 等,2024),而独立推导的多层向量可能追求冲突的目标(Tan 等,2025),这都降低了效果和流畅性。CircuitSteer 强制几何对齐作为特征选择的前提条件,因此在任何干预之前,保留的特征指向兼容的方向。与此同时,Laptev 等(2025)从解码器方向余弦相似性构建无数据的跨层流图用于主题引导;我们共享这一见解,但使图依赖数据(边还需要共现激活),添加对比特定性评分(公式 4)以隔离特定行为的子电路,并在单一系数λ下通过密集向量(公式 6)进行引导,而不是钳制单个特征。
### 机制可解释性与特征电路。
我们的方法基于 Circuits 框架(Olah 等,2020;Elhage 等,2021),该框架将 LLM 计算建模为跨层因果交互特征的组合,从而能够对特定行为进行精确的电路级解释(Wang 等,2022;Olsson 等,2022)。越来越多的证据证实,高层语义概念分布在多层中,并随着层间逐步演化(Gurnee 和 Tegmark,2024;Park 等,2023)。CircuitSteer 不问“应该在哪个单层干预”,而是问“哪个跨层特征流共同编码目标行为”,从而构建尊重这种分布式结构的干预。
## 3 方法论
### 3.1 预备知识
**残差流与激活引导。** Transformer 维护一个残差流 h_l ∈ R^{d_model},通过 h_{l+1} = h_l + F_l(h_l) 进行加性更新,其中 F_l 包含注意力和 MLP 子层。激活引导利用这一结构,在层 l 注入一个缩放方向 v ∈ R^{d_model}:h'_l = h_l + λ v,从而在不修改权重的情况下偏置模型轨迹以诱发或抑制目标行为(Turner 等,2023)。
**稀疏自编码器。** 残差流维度通常是多语义的,通过叠加(superposition)编码比可用维度更多的概念(Elhage 等,2022)。SAE 通过一个过完备字典来解决这个问题:编码器通过 z = ReLU(W_enc h_l + b_enc) 产生一个稀疏激活向量 z ∈ R^N(N ≫ d_model),解码器将残差流重建为 ĥ_l = W_dec z + b_dec。每个非零条目 z_i 对应一个解码器方向 W_dec[:, i] ∈ R^{d_model},编码一个单一的可解释概念(Cunningham 等,2023)。
**特征流电路。** Transformer Circuits 框架(Elhage 等,2022)将 LL 视为一个组合的因果交互特征图。受此启发,我们将跨层特征流电路定义为一个有向图 G = (V, E),其中节点是特定于层的 SAE 特征,边表示跨层的语义流。该图由两个联合标准决定:特征共同激活(指示因果交互)和解码器方向的几何对齐(确保跨层一致的方向)。**关键区别:** 与依赖梯度的归因图不同,我们使用正向传递统计量,因此与训练无关。
### 3.2 通过几何对齐构建特征流电路
给定一个目标行为(例如,毒性)及其对比提示对,我们的目标是识别一个行为特定的跨层子电路。对于每一层 l,我们收集一组在行为提示下被激活的候选 SAE 特征。特征 f 的激活分数计算为其稀疏激活值 z_f(在提示集合上平均)。然而,激活本身并不足以识别一个连贯的电路:不同层中编码相同语义的特征可能在几何上不一致。为解决这个问题,我们引入一个几何对齐分数。
**解码器方向几何对齐。** 对于两个特征 f(在层 l)和 g(在层 m),其解码器方向为 d_f = W_dec^{(l)}[:, i_f] 和 d_g = W_dec^{(m)}[:, i_g],我们计算余弦相似度 cos(d_f, d_g)。如果 |cos(d_f, d_g)| ≥ τ_geo(一个阈值),则这两个特征被视为几何对齐的。由于不同层中的 SAE 解码器方向可能处于不同的坐标系中,我们在计算余弦相似度之前使用一个线性变换(例如,跨层的线性探针)来对齐它们。在实践中,我们发现简单的归一化(对解码器方向进行层归一化)通常已足够;我们也在第 5.3 节中探讨了更复杂的对齐。
**边构建与节点选择。** 一个边 (f, g) 被添加到电路中,当且仅当:
1. 共现激活:在相同提示下,f 和 g 的激活值共同超过一个阈值(例如,top-k 激活或绝对阈值)。
2. 几何对齐:|cos(d_f, d_g)| ≥ τ_geo。
然后,我们通过一个对比特定性分数选择行为相关的子电路。对于特征 f,我们计算对比分数 S(f) = mean_{positive prompts} z_f - mean_{negative prompts} z_f。我们选择 S(f) 最高的特征作为电路节点(通过边连接)。**这使我们能够隔离特定于目标行为的子电路**,同时排除与无关概念相关的特征。
### 3.3 从稀疏电路合成多层引导向量
一旦我们确定了行为特定的特征电路(跨层的节点集和边集),我们就合成一个密集的引导向量。对于电路中的每个特征 f,我们计算一个特征级引导贡献:
v_f = α_f · d_f
其中 α_f 是特征 f 的平均对比激活差异(在正负提示之间)。为了获得一个跨层的密集引导向量,我们对每层 l 上的所有特征贡献求和:
v_l = Σ_{f ∈ circuit at layer l} v_f
然后,在推理期间,我们通过一个系数 λ 在每个电路层应用这些引导向量:h'_l = h_l + λ v_l。**单一系数 λ** 确保跨层干预协调一致,而无需为每个特征单独调参。
### 3.4 算法概述
整个 CircuitSteer 流程如下:
1. **SAE 特征提取**:对于每个中间层 l,对正负提示集合运行正向传递,获得 SAE 激活 z_l。
2. **候选特征选择**:根据对比特定性分数 S(f) 选择 top-k 特征(每层)。
3. **几何对齐过滤**:计算所选特征的解码器方向,并通过余弦相似度进行对齐;过滤掉相对其他特征不对齐的特征。
4. **边构建**:通过共现激活和对齐方向构建跨层边,形成电路。
5. **引导向量合成**:根据电路中的特征计算每层的引导向量 v_l。
6. **推理时干预**:使用系数 λ 在电路层应用 v_l。
## 4 实验设置
### 4.1 数据集
我们在四个行为数据集上进行评估:**毒性**(Toxicity)、**情绪强度**(Emotion-Intensity)、**谄媚**(Sycophancy)和**拒绝**(Refusal)。每个数据集包含正负提示对,用于计算对比激活。
### 4.2 模型
我们使用两个模型家族:**Gemma-2-2B** 和 **Llama-3.1-8B-Instruct**。我们使用预训练的 SAE(来自开放资源),并在模型的中间层(例如,层 10-20)上运行我们的方法。
### 4.3 基线
我们将 CircuitSteer 与以下基线进行比较:
- **CAA**(单层激活添加)
- **ITI**(推理时干预)
- **RepE**(表示工程)
- **LoReFT**(低秩特征变换)
- **SpARE/SRPS**(基于角色的 SAE 引导)
- **SAE-SSV**(SAE 子空间引导)
- **单层 SAE 引导**(在我们的设置中)
- **朴素多层引导**(独立选择特征,不进行几何对齐)
对于每个基线,我们使用其原始实现或根据我们的设置进行适配。
### 4.4 评估指标
- **行为降低**(Δ):目标行为的减少百分比。例如,对于毒性,计算毒性分类器得分的变化。
- **归一化困惑度**(PPL̄):输出文本的困惑度,相对于未干预模型进行归一化。PPL̄ < 1.0 表示流畅性保持。
- **文本质量**:我们报告 PPL̄ 和行为降低之间的权衡。
## 5 结果
### 5.1 主要结果
表 1 显示了所有方法在 8 种配置(4 个数据集 × 2 个模型)上的平均行为降低 Δ 和归一化困惑度 PPL̄。CircuitSteer 在所有配置中实现了最高的 Δ,同时保持 PPL̄ < 1.0。相比之下,CAA 在毒性数据集上表现良好,但在谄媚和拒绝上失败(Δ ≈ 0);单层 SAE 方法在情绪强度上表现不错,但在其他任务上无法保持流畅性(PPL̄ > 1.5);朴素多层引导在所有任务上导致严重的流畅性崩溃(PPL̄ > 3.0),证实了我们的分析。
### 5.2 消融研究
我们进行消融研究以确认各个组件的贡献:
- **去除几何对齐**:如果我们仅基于共现激活构建电路(不对齐),则流畅性急剧下降,特别是在困难任务上。
- **反转对齐标准**:如果我们要求解码器方向反平行(负余弦),则行为降低显著下降。
- **单层 vs 多层**:如果我们在单个电路层应用引导向量(而不是所有层),行为降低降低——特别是在复杂任务上。
- **对比分数 vs 激活分数**:使用激活分数而不是对比特定性分数会导致更差的电路选择,降低效果。
### 5.3 几何对齐的必要性
图 2 显示了几何对齐对流畅性的影响。在没有对齐的情况下,PPL̄ 随着引导系数的增加而迅速增长;强制对齐使得 PPL̄ 保持接近 1.0,同时实现高 Δ。
## 6 讨论与局限性
CircuitSteer 提供了几个重要的见解。首先,多层电路引导是可行的,并且比单层干预更稳健,前提是特征在几何上对齐。其次,SAE 特征的使用允许透明的、可解释的干预——用户可以在干预之前检查电路。第三,我们的方法在复杂行为上特别有效,例如拒绝,其中单层方法往往失败。
**局限性**:
- 我们依赖于预训练的 SAE 的质量;如果 SAE 未能捕获相关概念,则电路构建可能不完整。
- 我们的跨层对齐方法(归一化)可能不足以应对高度不对齐的 SAE 字典;更高级的对齐方法可能进一步提高性能。
- 我们使用固定的系数 λ;自适应系数可能带来更好的控制。
## 7 结论
我们提出了 CircuitSteer,一种无需训练的多层引导框架,通过构建几何对齐的特征流电路来控制 LLM 行为。我们在多个模型和数据集上证明了其有效性,表明强制跨层特征对齐对于实现流畅性保持的行为控制至关重要。我们的工作强调了推理时引导设计中的电路视角的价值,并为未来在多层机制干预方面的研究奠定了基础。
## 参考文献
(注:由于 arXiv 引用格式,此处省略完整参考文献列表,但所有引用在正文中均已标注。)
## 附录 A 实现细节
- SAE 配置:我们使用每个模型的预训练 SAE,字典大小为 N = 32768。
- 阈值 τ_geo:通过验证集上的网格搜索选择,通常为 0.5-0.8。
- 系数 λ:在验证集上调整,以最大化 Δ 同时保持 PPL̄ < 1.0。
- 电路层:对于 Gemma-2-2B,我们使用层 10、14、18、22;对于 Llama-3.1-8B-Instruct,我们使用层 12、16、20、24。相似文章
MidSteer: 用于引导生成模型的最优仿射框架
介绍MidSteer,一个用于生成模型中概念引导的理论框架,通过为LLMs和视觉扩散模型中的概念引导、擦除和切换提供最优仿射变换,弥合了经验成功与理论理解之间的差距。
FineSteer: 大规模语言模型推理时细粒度控制的统一框架
FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。
基于稀疏查询特征梯度优化的导向生成
本文介绍了Prototype-Based Sparse Steering方法,该方法将稀疏自编码器应用于大语言模型的注意力查询激活,然后在推理过程中使用梯度优化来引导生成朝向目标行为。该方法在一个逻辑规划任务和一个风格化教育领域中得到了验证,展示了可解释且解耦的控制能力。
你的LLM何时可引导?
本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。
多语言设计导向的调控:多语言稀疏自编码器与原则性层选择
本文介绍了一种基于原则的多语言语言调控方法,该方法使用在多语言数据上训练的稀疏自编码器(SAEs)以及一种基于多语言对齐与语言可分性交集的新型层选择规则,并在LLaMA-3.1-8B和Gemma-2-9B上针对机器翻译和跨语言摘要进行了评估。