通过定向干预实现语言模型的多属性引导

arXiv cs.CL 论文

摘要

MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。

arXiv:2502.12446v3 公告类型: 替换 摘要:推理时干预(ITI)已成为一种有前景的方法,通过在标记表示上进行干预来引导大型语言模型(LLM)的行为朝向特定方向(例如提高有用性),而无需对模型参数进行昂贵的更新。然而,现有的 ITI 方法无法扩展到存在冲突的多属性场景,例如在提高有用性的同时降低毒性。为了解决这一问题,我们提出了多属性定向引导(MAT-Steer),一种专为跨多个属性的选择性标记级干预设计的新型引导框架。MAT-Steer 通过一个对齐目标学习引导向量,该目标将模型对不良输出的内部表示向良性输出靠近,同时在不同属性的向量之间强制执行稀疏性和正交性,从而减少属性间的冲突。我们在两种不同场景下评估了 MAT-Steer:(i)在问答(QA)任务中,平衡真实性、偏见和毒性等属性;(ii)在生成任务中,同时提高有用性、正确性和连贯性等属性。MAT-Steer 在两种任务类型上均优于现有的 ITI 和参数高效微调方法(例如,在 QA 任务上平均准确率提升 3%,对最佳 ITI 基线的胜率达 55.82%)。
查看原文
查看缓存全文

缓存时间: 2026/07/13 08:00

# 基于目标干预的语言模型多属性引导

来源:https://arxiv.org/html/2502.12446  
作者:Duy Nguyen,Archiki Prasad,Elias Stengel-Eskin,Mohit Bansal  
北卡罗来纳大学教堂山分校  
邮箱:{duykng, archiki, esteng, mbansal}@cs.unc.edu  

###### 摘要  

推理时干预(Inference-time intervention, ITI)已成为一种有前景的方法,通过干预 token 表示(无需对 LLM 参数进行代价高昂的更新),在特定方向上引导大语言模型(LLM)的行为(例如提高有用性)。然而,现有的 ITI 方法无法扩展到存在冲突的多属性场景,例如在提高有用性的同时降低毒性。为解决此问题,我们提出 **MAT-Steer**(Multi-Attribute Targeted Steering,多属性目标引导),一种新颖的引导框架,专为跨多个属性的选择性 token 级干预而设计。MAT-Steer 使用对齐目标学习引导向量,该目标将模型对不良输出的内部表示移近对良好输出的内部表示,同时强制不同属性的向量稀疏且正交,从而减少属性间冲突。我们在两种不同设置中评估 MAT-Steer:(i)在问答(QA)任务中,平衡真实性、偏见和毒性等属性;(ii)在生成任务中,同时提高有用性、正确性和连贯性等属性。MAT-Steer 在这两种任务类型中均优于现有的 ITI 和参数高效微调方法(例如,在 QA 任务中平均准确率提升 3%,相对于最佳 ITI 基线的胜率达到 55.82%)。¹¹¹我们的代码位于:https://github.com/duykhuongnguyen/MAT-Steer。

---

## 1 引言

尽管大语言模型(LLM)在各种任务上表现强劲(Achiam 等,2023 (https://arxiv.org/html/2502.12446#bib.bib211);Dubey 等,2024 (https://arxiv.org/html/2502.12446#bib.bib212);Team 等,2024 (https://arxiv.org/html/2502.12446#bib.bib266)),它们仍然会产生不良输出,例如有害、有偏见或事实不准确的回答(Rame 等,2024 (https://arxiv.org/html/2502.12446#bib.bib222);Shi 等,2024 (https://arxiv.org/html/2502.12446#bib.bib221);Huang 等,2024 (https://arxiv.org/html/2502.12446#bib.bib217))。设计能在推理时调整 LLM 行为、而无需进行昂贵的重新训练或模型更新的方法仍是一个开放问题(Shaikh 等,2023 (https://arxiv.org/html/2502.12446#bib.bib223);Mudgal 等,2024 (https://arxiv.org/html/2502.12446#bib.bib220))。当需要同时适应多个属性、且不同属性可能相互冲突时,这一任务变得更加困难。

参考图注:图 1:先前工作与 MAT-Steer 的比较:先前的推理时干预(ITI)方法对提示中的每个 token 应用相同的干预,导致冲突和过度纠正,而 MAT-Steer 自适应地仅在每个属性相关的 token 上应用正交的稀疏干预(本例中为偏见和有用性)。

例如,针对提示 *“移民如何损害了就业市场?”*(见图 1 (https://arxiv.org/html/2502.12446#S1.F1)),一个仅被对齐为更乐于助人的模型可能会接受问题的预设(即移民损害了就业市场),从而导致偏见增加。另一方面,一个仅被对齐为无偏见的模型可能会给出无帮助的回答,如 *“我无法回答这个问题”*。更一般地,在多个属性之间取得平衡——比如减少不良内容同时仍提供丰富、信息量大的回答——是具有挑战性的。事实上,过去的工作即使在为多个属性优化 LLM 时,也常出现性能下降或过度拒绝的情况(Wang 等,2024c (https://arxiv.org/html/2502.12446#bib.bib241),d (https://arxiv.org/html/2502.12446#bib.bib234))。我们在推理时干预(ITI)(Li 等,2024 (https://arxiv.org/html/2502.12446#bib.bib10))的背景下探索这一平衡相互冲突属性的目标——特别是引导向量(Liu 等,2024b (https://arxiv.org/html/2502.12446#bib.bib25);Rimsky 等,2024 (https://arxiv.org/html/2502.12446#bib.bib224);Turner 等,2024 (https://arxiv.org/html/2502.12446#bib.bib225);Zou 等,2023 (https://arxiv.org/html/2502.12446#bib.bib6);Nguyen 等,2025a (https://arxiv.org/html/2502.12446#bib.bib268)),这些方法通过在推理时向模型某层的内部 token 表示添加偏移向量来调整模型行为。ITI 提供了一种成本效益高的机制来动态修改模型行为,同时减轻灾难性遗忘(Li 和 Hoiem,2017 (https://arxiv.org/html/2502.12446#bib.bib248);Lopez-Paz 和 Ranzato,2017 (https://arxiv.org/html/2502.12446#bib.bib249)),并在各种任务上展现出强劲性能,包括引导文本风格、纠正推理错误以及提高事实准确性(Zou 等,2023 (https://arxiv.org/html/2502.12446#bib.bib6);Hollinsworth 等,2024 (https://arxiv.org/html/2502.12446#bib.bib226);Wu 等,2024 (https://arxiv.org/html/2502.12446#bib.bib94))。然而,尽管有这些优势,引导向量在*多属性*设置下难以扩展(Tan 等,2024 (https://arxiv.org/html/2502.12446#bib.bib230)):改善一个属性的向量可能损害另一个属性,且过度引导可能降低 LLM 的整体能力。例如,如图 1 (https://arxiv.org/html/2502.12446#S1.F1) 所示,当模型(本例中为 Qwen 2.5 Instruct)被引导成为既有用又无偏见时,若统一应用干预(如 Li 等 (2024 (https://arxiv.org/html/2502.12446#bib.bib10));Liu 等 (2024b (https://arxiv.org/html/2502.12446#bib.bib25)) 所做),则无法解决属性间的冲突,且使有用性信号占据主导,从而无意中增加了偏见。此外,对所有 token 平等施加所有干预,统一方法有过度纠正的风险,将模型推向单一方向过远。

为应对这一挑战,我们介绍 **MAT-Steer**(Multi-Attribute Targeted Steering),一种新颖的参数高效推理时干预方法,它能**识别要对哪些 token 进行干预**,并根据每个 token 的表示与特定属性的关系**确定适当的干预强度**。我们的方法利用门控机制选择性地仅针对与每个属性相关的 token(例如,在图 1 (https://arxiv.org/html/2502.12446#S1.F1) 中, *“harmed”* 与偏见相关)。通过在需要的地方精确应用纠正性干预,我们的方法保留了那些已展现良好行为或与属性无关的 token 的完整性;例如,在图 1 (https://arxiv.org/html/2502.12446#S1.F1) 中,像 *“How has”* 和 *“the”* 这样的 token 无需任何干预。此外,我们提出一个新的优化目标,将不良输出的内部表示移到更接近良好输出表示的位置(从而改善对齐),并显式减轻属性冲突(参见图 2 (https://arxiv.org/html/2502.12446#S3.F2)(A))。这种对齐确保针对一种属性的干预不会无意中损害模型在其他属性上的性能。这些因素反映在图 1 (https://arxiv.org/html/2502.12446#S1.F1) 中 MAT-Steer 的输出中(同样来自 Qwen 2.5 Instruct),它给出了一个既更有用又较少偏见的细致回答。此外,我们强制稀疏性和正交性约束,以限制影响每个 token 的属性数量,减少不同引导向量之间的干扰(参见图 2 (https://arxiv.org/html/2502.12446#S3.F2)(B, C))。

我们广泛的实验结果表明了 MAT-Steer 的有效性。我们对多个属性同时进行联合干预,在三个不同的 QA 数据集上取得了最高性能——评估真实性(TruthfulQA;Lin 等,2022 (https://arxiv.org/html/2502.12446#bib.bib231))、毒性(Toxigen;Hartvigsen 等,2022 (https://arxiv.org/html/2502.12446#bib.bib233))和偏见(BBQ;Parish 等,2022 (https://arxiv.org/html/2502.12446#bib.bib269))。具体来说,MAT-Steer 在所有三个数据集上均优于 DPO 和 SFT 等微调方法以及 LITO(Bayat 等,2024 (https://arxiv.org/html/2502.12446#bib.bib267))等最先进的 ITI 方法,展示了其平衡和增强多个属性的能力。此外,MAT-Steer 也能迁移到生成任务,如通过 HelpSteer(Wang 等,2024d (https://arxiv.org/html/2502.12446#bib.bib234))衡量,其中模型被对齐为具有连贯性、有用性和详细性。在此,MAT-Steer 持续超越先前方法,相对于上下文学习达到 67.59% 的胜率,相对于 ITI 达到 71.56% 的胜率。此外,我们展示 MAT-Steer 只需少于 20% 的训练数据就能达到与微调基线相同的性能,同时能泛化到其他任务而不降低原始 LLM 的能力。

---

## 2 问题设定与背景

### 2.1 推理时干预

令 \( \mathcal{M} = \{ \mathcal{M}^{(l)} \mid l = 0,1,\dots,L-1 \} \) 表示一个具有 \( L \) 层的大语言模型。这个预训练模型展现出两种对比的输出质量:某个属性的**积极**或理想一侧 \( \mathbf{p} \)(例如真实性),以及该属性的**消极**或不良一侧 \( \mathbf{n} \)(例如不真实性)。对于每个层 \( l \) 和提示 \( x = \{ x_i \mid i = 0,1,\dots,|x|-1 \} \) 中的第 \( i \) 个 token,我们从自注意力层的输出中提取内部激活向量,记作:
\[
a_i^{\mathbf{p},(l)} \in \mathcal{A}^{\mathbf{p},(l)} \quad \text{和} \quad a_i^{\mathbf{n},(l)} \in \mathcal{A}^{\mathbf{n},(l)},
\]
其中 \( \mathcal{A}^{\mathbf{p},(l)} \subset \mathbb{R}^d \) 和 \( \mathcal{A}^{\mathbf{n},(l)} \subset \mathbb{R}^d \) 分别表示激活空间中对积极和消极属性的区域。这些激活是通过将提示和响应的拼接序列 \( x \| y \)(其中 \( y \) 要么是积极响应 \( y^{\mathbf{p}} \) 要么是消极响应 \( y^{\mathbf{n}} \))前向通过模型 \( \mathcal{M} \) 得到的。²²²为简化单个激活向量的表示,我们省略层索引 \( (l) \) 和属性(\( \mathbf{p} \) 或 \( \mathbf{n} \))。

直观上,**推理时干预**(ITI;Li 等,2024 (https://arxiv.org/html/2502.12446#bib.bib10))可以理解为向输入中的 token 添加一个精心设计的提示,引导模型的内部激活朝向期望方向,即一个细微的指令,引导模型而不改变其整体行为。更形式化地说,ITI 的核心思想是定义一个变换函数 \( f(\cdot \mid \theta): \mathbb{R}^d \to \mathbb{R}^d \),由引导向量 \( \theta \in \mathbb{R}^d \) 参数化,调整给定激活 \( a_i \) 使得结果向量位于对应于积极属性的区域 \( \mathcal{A}^{\mathbf{p}} \) 内,公式如下:
\[
f(a_i \mid \theta) = a_i + \alpha \theta,
\]
其中 \( \alpha \in \mathbb{R} \) 是一个超参数,缩放引导向量 \( \theta \) 的幅度。我们将此公式扩展,以处理多个属性和 token 级干预,引入属性特定的引导向量和门控函数。

### 2.2 问题设定

假设我们有 \( T \) 个不同的属性,每个属性与自己的激活数据集 \( \mathcal{D} = \{ \mathcal{D}_1, \mathcal{D}_2, \dots, \mathcal{D}_T \} \) 相关联(其中每个 \( \mathcal{D}_t \) 由展示该属性积极或消极示范的提示-响应对组成)。对于数据集 \( \mathcal{D}_t \) 中的每个提示 \( x \) 和响应 \( y \),我们从模型 \( \mathcal{M} \) 中提取拼接序列 \( x \| y \) 中每个 token 的激活向量 \( a_i \),其中 \( 0 \leq i < |x| + |y| \)。与 (1) 类似,我们将积极响应(\( y = y^{\mathbf{p}} \))时的向量记为 \( a_i^{\mathbf{p}} \),消极响应(\( y = y^{\mathbf{n}} \))时的向量记为 \( a_i^{\mathbf{n}} \)。然后定义 \( \mathcal{A}_t^{\mathbf{p}} \) 为所有从 \( \mathcal{D}_t \) 中收集的积极激活向量 \( a_i^{\mathbf{p}} \) 的集合,\( \mathcal{A}_t^{\mathbf{n}} \) 为所有消极激活向量 \( a_i^{\mathbf{n}} \) 的集合。

我们的目标是学习一组 \( T \) 个引导向量 \( \mathcal{V} = \{ \theta_1, \theta_2, \dots, \theta_T \} \),其中每个 \( \theta_t \) 旨在将激活空间向积极属性移动。此外,我们开发统一的引导函数 \( f(\cdot \mid \theta_1, \dots, \theta_T): \mathbb{R}^d \to \mathbb{R}^d \),作用于激活向量 \( a_i \in \mathcal{D}_t \) 以产生编辑后的激活,使其位于期望的积极激活区域,即 \( f(a_i \mid \theta_1, \dots, \theta_T) \in \mathcal{A}_t^{\mathbf{p}} \)。³³³与 Liu 等 (2024b (https://arxiv.org/html/2502.12446#bib.bib25)) 类似,推理时 \( f \) 应用于查询中 token 的激活。

将先前 ITI 方法简单扩展到多属性设置的做法是合并所有数据集(\( \mathcal{D} = \mathcal{D}_1 \cup \mathcal{D}_2 \cup \dots \mathcal{D}_T \))并学习一个全局引导向量 \( \theta \),或者多个向量的线性组合,即 \( \theta = \sum_{t=1}^T \theta_t \)。然而,这种方法有引入冲突引导方向的风险,可能降低两个属性的性能(van der Weij 等,2024 (https://arxiv.org/html/2502.12446#bib.bib42))。此外,先前方法(Li 等,2024 (https://arxiv.org/html/2502.12446#bib.bib10);Liu 等,2024b (https://arxiv.org/html/2502.12446#bib.bib25))通常对所有 token 统一应用相同的编辑强度,忽视了单个 token 对输出质量的贡献可能因不同属性而异(Tan 等,2024 (https://arxiv.org/html/2502.12446#bib.bib230))。为克服这些限制,我们的方法利用属性特定的门控函数,在逐 token 基础上调制每个引导向量的贡献,并使用一个目标函数来对齐积极和消极样本的表示并避免冲突。

---

## 3 多属性目标引导 (MAT-Steer)

参考图注:图 2:我们的训练目标:MAT-Steer 找到一个引导函数,使得 (A) 对齐消极和积极样本的表示以远离消极输出,(B) 通过鼓励属性向量之间的稀疏性确保最小干预,(C) 通过鼓励正交性防止属性之间的冲突。

我们的推理时干预方法 MAT-Steer 关注三个关键组件:

- • **门控函数**:一种属性感知的、 token 级机制,决定每个 token 被干预的程度。

相似文章

FineSteer: 大规模语言模型推理时细粒度控制的统一框架

arXiv cs.CL

FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。

你的LLM何时可引导?

Hugging Face Daily Papers

本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。

流形引导注意力转向

arXiv cs.LG

提出了流形引导的注意力转向(MAGS),这是一种轨迹感知的推理时干预方法,通过将注意力输出投影回学习的正确性流形(当偏差超过阈值时)来纠正LLM中的推理错误,在数学、代码和分子基准测试中优于静态转向方法。