IDEEA:通过激活聚类匹配实现免训练的输入依赖式引导

arXiv cs.CL 论文

摘要

IDEEA提出了一种免训练的、依赖于输入的引导方法,适用于大型语言模型,通过对激活进行聚类并使用最优匹配,在TruthfulQA上比基线提升真实性高达23.5%。

arXiv:2609.02089v1 公告类型:新 摘要:引导通过对推理时选定的激活注入偏差来对齐大型语言模型(LLMs),提供了一种远比权重更新方法(如监督微调或强化学习)更便宜的替代方案。然而,大多数现有的免训练引导方法是输入无关的:单一方向被一次性拟合并在所有输入之间共享。这从根本上是有限的,因为不同的输入占据激活空间的不同区域,并且对于相同的目标概念允许不同的最优引导方向,就像相对于固定损失的梯度随输入而变化一样。我们用IDEEA(通过激活聚类匹配实现输入依赖式引导)弥补了这一差距,这是一个用于输入依赖式引导的免训练框架。IDEEA对每个注意力头的正负激活支持进行聚类,并解决一个最优匹配问题,以构建一组以目标概念为中心的聚类条件方向。在推理时,它从这个方向池中选择一个与输入自身激活最匹配的方向进行引导。IDEEA在保持输入原始表示的同时将模型对齐到目标概念,这证明编码概念的激活占据表示空间的几个不同子区域,而不是单个区域。IDEEA将TruthfulQA中的真值×信息率平均提升了9.9%(高达23.5%),相比最佳的输入无关基线。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:50

# 无需训练的输入依赖引导:通过激活聚类匹配实现
来源:https://arxiv.org/html/2609.02089
本研究部分工作在滑铁卢大学本科期间完成。通讯作者:[email protected]
**牧尘·李**
机构:不列颠哥伦比亚大学
机构:Vector人工智能研究所
**任杰·廖**
机构:不列颠哥伦比亚大学
机构:Vector人工智能研究所
机构:加拿大CIFAR人工智能讲席教授
**严·耿**
机构:德克萨斯大学奥斯汀分校

###### 摘要
*引导*通过对推理时选定激活值注入偏差来调整大语言模型,为监督微调或强化学习等权重更新方法提供了一种成本更低的替代方案。然而,大多数现有的无训练引导方法是*输入无关的*:单一方向仅拟合一次,并在所有输入间共享。这存在根本性限制,因为不同输入占据激活空间的不同区域,并且对于相同的目标概念可能需要不同的最优引导方向,这类似于针对固定损失的梯度会随输入而变化。我们通过IDEEA弥合了这一差距。这是一个用于*输入依赖引导*的无训练框架。IDEEA对每个注意力头的正向和负向激活支持进行聚类,并通过解决最优匹配问题来构建一组关于目标概念的*集合*条件聚类方向。在推理时,它从这个方向池中选择最匹配输入自身激活的方向进行引导。IDEEA在引导模型趋向目标概念的同时保持了输入原始表示,这证明了编码一个概念的激活占据表示空间的几个不同子区域,而非单一区域。IDEEA在TruthfulQA数据集上将*真实×信息率*平均提升了9.9%(最高达23.5%),超越了最佳的输入无关基线。代码:https://github.com/DSL-Lab/IDEEA。

## 1 引言
预训练赋予大语言模型广博的知识,但并未指导其*如何*行为——是否应保持真实、有用或安全。调整其行为通常需要更新权重——监督微调、RLHF (Ouyang et al., 2022)、DPO (Rafailov et al., 2023)、GRPO (Shao et al., 2024),或如LoRA (Wang et al., 2024)等参数高效变体——所有这些都需要不菲的计算资源、精心策划的数据,在强化学习的情况下还需要单独的奖励模型。

*引导*提供了一种显著更廉价的替代方案:它不修改任何权重,而是在推理时向选定激活值添加线性偏差,将响应推向选定的方向 (Li et al., 2023; Rimsky et al., 2024)。这种干预仅限于模型的一小部分:单个层 (Rimsky et al., 2024; He et al., 2025; Rodriguez et al., 2026) 或注意力头的子集 (Li et al., 2023; Kim et al., 2025; Zou et al., 2025)。这种受约束的扰动使得引导在有效的同时保持了最小侵入性。

引导方法还可以根据引导方向的获取方式进行分类——通过优化或无训练实例化,例如推理时干预 (ITI) (Li et al., 2023)、对比激活添加 (CAA) (Rimsky et al., 2024) 和激活谱编辑 (SEA) (Qiu et al., 2024),这些方法完全跳过了优化阶段。引导方向直接从小的对比激活数据集计算得出,并且带来了透明的几何解释,这是基于优化的引导方法所无法获得的。无训练引导还显著节省了计算资源,因为GPU仅在初始激活收集阶段使用,每个训练样本只需一次前向传递,无论配置数量如何(附录A)。

然而,现有的无训练引导方法仍然有限。它们固定为一个*单一静态算子*,并在所有输入间共享。实践中,与目标概念相关的激活分布在几个不同的子区域(第5.3节),使得这种构造不足以应对高维激活空间,并导致意外的失败(第5.3节)。

#### 贡献。
- • 我们引入了IDEEA(通过激活聚类匹配实现的输入依赖引导),这是一个无训练的*输入依赖引导*框架,它在推理时根据输入条件选择引导方向(图1)。
- • IDEEA对正向和负向激活支持进行聚类,并为每个输入选择最匹配其自身表示的聚类条件方向。
- • IDEEA提供了卓越的引导效果,同时保持了原始输入表示的真实性,避免了推理期间的拒绝崩溃失败。
- • 我们在四个引导任务上验证了IDEEA——真实性 (Lin et al., 2022)、社会行为特征 (Leng and Yuan, 2024)、政治倾向性 (Fulay et al., 2024) 和毒性缓解 (Ji et al., 2025; Luong et al., 2024)——证明了IDEEA可以泛化到不同目标概念,并且在无训练基线上带来了一致的提升。

图1:IDEEA用于输入依赖引导的框架。(1) 从对比性提示中收集每个头的激活值。(2) 聚类正向(绿色)和负向(红色)支持(第4.1节)并获得聚类最优方向向量(第4.2节)。(3) 找到与输入(粉色)最对齐的方向,并用于引导(第4.3节)。

## 2 相关工作
#### 基于优化的引导。
另一类互补的引导方法通过梯度优化寻找引导方向,通常与强化学习式目标相结合 (Zou et al., 2025; Rodriguez et al., 2026; Cao et al., 2024)。这些方法可能有效,但继承了经典对齐的计算开销,并且缺乏对学习方向的透明几何解释。我们则研究其对立的*无训练*引导,直接从对比激活空间中提取方向。

#### 质量均值引导。
*质量均值*方向是对比数据集上平均正向激活与平均负向激活之间的差值,是无训练引导中的主流构造。该方向可以应用于选定的注意力头,如ITI (Li et al., 2023; Kim et al., 2025),或整个层,如CAA (Rimsky et al., 2024)。无论扰动位置如何,这两种方法都应用一个不变的方向来引导所有输入。

#### SAE引导。
另一系列工作在残差流激活上预训练过完备的稀疏自编码器以提取单义特征 (Bricken et al., 2023; Templeton et al., 2024),然后可以将恢复的解码器方向添加回残差流以引导该特征。公共特征套件如Gemma Scope (Lieberum et al., 2024)、Llama Scope (He et al., 2024)、AxBench (Wu et al., 2025) 和 (Arditi and Chen, 2025) 使得这种方法无需为每个任务重新训练SAE即可实用。这种方法介于无训练和基于优化的方法之间:SAE本身需要一个单独的训练阶段,尽管它可以在不同任务间重复使用。然而,可引导概念的集合受限于其潜在空间中的解码器方向数量。

#### 输入依赖的方向选择。
尽管存在差异,所有这些无训练方法都为每个输入固定一个单一的引导方向。SEA (Qiu et al., 2024) 试图通过一对子空间投影来弥合这一差距,该投影最大化与对比集正向激活的互协方差,同时最小化与负向激活的互协方差,但无论激活在表示流形中的位置如何,都应用相同的投影。如第5.3节所示,与目标概念相关的激活通常跨越表示空间的多模态区域。单一静态算子无法将不同的负模式路由到不同的正模式,并且会使许多正区域无法达到。我们的工作通过创建一组关于相同概念的方向,并选择与推理时观察到的激活最对齐的方向来放松这一约束(第4节)。

## 3 预备知识
无训练引导方法在不更新任何模型参数的情况下,在推理时修改模型行为。此类方法通常遵循三个阶段:(i) 从标记数据集中收集激活,(ii) 从这些激活中推导引导方向,以及 (iii) 在生成过程中将方向注入回前向传递。我们采用这个整体流程,并通过一个输入依赖的方向选择步骤(第4节)对其进行扩展。

### 3.1 数据集设置
令 D^c = \{(c_i, y_i)\}_{i=1}^N 是一组标记的对话,其中 c_i 是与感兴趣概念(例如真实性、毒性、安全性)相关的对话历史,y_i \in \{+1, -1\} 表示概念在 c_i 中是被保留还是被违反。我们通过记录模型在前向传递期间的潜在激活来探测模型对该概念的内部表示。这些钩子可以附加到基于Transformer的语言模型的任何模块 (Vaswani et al., 2017),常见的选择是多头注意力输出 (Li et al., 2023) 和残差流 (Rimsky et al., 2024)。

### 3.2 激活收集
在 (Li et al., 2023) 的基础上,我们从多头注意力输出收集激活。在自回归语言模型中 (Vaswani et al., 2017),多头注意力模块在 L 层中共享,每层有 H 个注意力头,我们按位置 (l, h) 索引每个头。在推理时,模型维护一个嵌入流 x_0, ..., x_n \in \mathbb{R}^{DH},每个输入对应一个,并自回归地生成 x_{n+1}。在第 l 层,嵌入 (x_0, ..., x_n)_l 经过多头注意力,然后通过带有残差连接的多层感知器,生成 (x_0, ..., x_n)_{l+1}。在多头注意力内部,嵌入首先投影到 D 维注意力空间,然后在自注意力后投影回 \mathbb{R}^{DH}:
a_{l,h} = \mathrm{Att}_{l,h}(P_{l,h} \, x_{l}) \quad (1)
x_{l+1} = x_{l} + \sum_{h=1}^{H} Q_{l,h} \, a_{l,h} \quad (2)
其中 a_{l,h} \in \mathbb{R}^{D} 是每个头的激活,P_{l,h} \in \mathbb{R}^{D \times DH}, Q_{l,h} \in \mathbb{R}^{DH \times D} 是输入和输出线性投影。给定 D^c,我们在对应于最后一个输入 token c_i[-1] 的残差流位置记录每个头的激活(即产生 \Pr(c_i[-1] \mid c_i[:-1]) 的隐藏状态位置),并组装每个头的激活数据集 D^a_{l,h} = \{(a_{l,h}, y)_i\},这构成了形成引导方向的基础。

### 3.3 输入无关引导
先前工作表明,平均正向激活与平均负向激活之间的差异产生有效的引导方向 (Li et al., 2023; Rimsky et al., 2024; Kim et al., 2025):
v_{l,h} = \mathrm{mean}(D^a_{l,h,+}) - \mathrm{mean}(D^a_{l,h,-}) \quad (3)
然后我们归一化 v_{l,h},并将其与全局强度 \alpha 以及每个头的标准差 \sigma_{l,h} = \mathrm{std}(D_{l,h}) 相乘以进行更精细的控制。由此产生的项被添加回残差流:
x_{l+1} = x_{l} + \sum_{h=1}^{H} Q_{l,h} \bigl( a_{l,h} + \alpha \, \sigma_{l,h} \, v_{l,h} \bigr) \quad (4)
虽然这种构造在每个头都产生了引导方向,但这些头本身在提供概念信息方面远非同等重要。对于每个头 (l, h),我们在 D^a_{l,h} 上拟合一个线性分类器,并使用其在保留集上的准确率作为该头相对于 y 的线性可分性的代理。我们通过经验观察到,这种探测准确率在不同头之间差异显著:许多接近随机水平(~0.5),表明该头对概念没有有意义的表示,而少数子集则获得高得多的准确率并清晰编码了该概念。在随机水平的头进行引导会注入一个与任何概念信号都不对齐的噪声方向,因此会降低模型效用而不会产生预期的行为改变。因此,我们将干预限制在按探测准确率排名的前 K 个头。仅在最能区分 y=\pm 1 的位置进行扰动,可以最大化干预效果,同时在其他地方保留模型的通用能力。

然而,这种方法的一个核心局限是引导方向与输入无关:无论输入如何,都使用相同的 v_{l,h}。我们将这种静态方法族称为*输入无关引导*。

## 4 IDEEA
尽管理语义概念倾向于占据

相似文章

FineSteer: 大规模语言模型推理时细粒度控制的统一框架

arXiv cs.CL

FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。

提示-激活对偶性:通过注意力层干预改进激活引导

Hugging Face Daily Papers

本文识别出KV缓存污染是对话中激活引导的一种失败模式,并提出了GCAD方法,该方法从提示贡献中提取引导信号,并应用词元级门控来改进长程连贯性,在多轮基准上取得了显著提升。

面向语言模型激活引导的高维随机投影

arXiv cs.LG

HiDRA 是一种无需训练的方法,利用高维随机投影在大型语言模型中进行激活引导,能够捕捉超越线性方法的判别信号,并在多种模型系列和基准测试中持续优于现有基线。

通过定向干预实现语言模型的多属性引导

arXiv cs.CL

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。