GrAInS:基于梯度的归因方法用于大语言模型和视觉语言模型的推理时引导
摘要
GrAInS 是一种基于对比梯度的归因方法,利用积分梯度识别影响最大的词元,并构建引导向量,在推理时对大语言模型(LLM)和视觉语言模型(VLM)进行引导,从而提升真实性并减少幻觉,同时不损害流畅性。
arXiv:2507.18043v2 公告类型:替换
摘要:推理时引导方法通过修改测试时的内部激活,无需更新模型权重,为微调大语言模型(LLM)和视觉语言模型(VLM)提供了一种轻量级替代方案。然而,现有的大多数方法依赖于固定的全局干预向量,忽略了个体输入词元的因果影响,并且未能利用来自模型 logits 的信息性梯度,特别是在视觉和文本输入贡献不均的多模态场景中。为解决这些局限性,我们引入了 GrAInS,这是一种推理时引导方法,可同时应用于纯语言模型和视觉语言模型及任务。GrAInS 使用基于对比梯度的积分梯度归因技术,根据词元对偏好输出与非偏好输出的贡献程度,识别最具正面和负面影响力的前 k 个词元。然后利用这些词元构建方向性引导向量,捕捉从不良行为向理想行为的语义转变。在推理过程中,GrAInS 根据词元级归因信号调整 Transformer 层的隐藏激活,并对激活进行归一化以保持表征尺度。这使得无需重新训练或辅助监督,即可实现对模型行为的细粒度、可解释且模块化的控制。实验结果表明,GrAInS 始终优于微调和现有的引导基线:使用 Llama-3.1-8B 在 TruthfulQA 上准确率提升 13.22%,使用 LLaVA-1.6-7B 将 MMHal-Bench 上的幻觉率从 0.624 降至 0.514,并在 SPA-VL 上将对齐胜率提高 8.11%,同时保持了模型的流畅性和通用能力。
查看缓存全文
缓存时间: 2026/07/13 08:00
# 基于梯度的归因方法用于LLM和VLM的推理时引导
来源:https://arxiv.org/html/2507.18043
Duy Nguyen¹,Archiki Prasad¹,Elias Stengel-Eskin²,Mohit Bansal¹
¹北卡罗来纳大学教堂山分校
²德克萨斯大学奥斯汀分校
###### 摘要
推理时引导为微调大型语言模型(LLM)和视觉语言模型(VLM)提供了一种轻量级替代方案,通过修改模型激活而不更新权重来实现。然而,现有方法通常依赖全局干预向量,忽视令牌级影响,并且未充分利用模型logits,尤其是在视觉和文本输入贡献不均的多模态场景中。我们提出 **GrAInS**,一种基于对比梯度的归因方法,利用积分梯度(Integrated Gradients)识别最关键的top-k个影响令牌,并根据它们对偏好输出与非偏好输出的贡献构建方向性引导向量。这些向量在每一层指导激活干预,同时保持表示规模。GrAInS在LLM和VLM任务上均优于微调和先前的引导方法:在TruthfulQA上将准确率提升13.22%(Llama-3.1-8B),将MMHal-Bench上的幻觉率从0.624降至0.514(LLaVA-1.6-7B),并将SPA-VL对齐度提升8.11%,且不损害流畅性或通用能力。¹¹¹代码:https://github.com/duykhuongnguyen/GrAInS。
## 1 引言
参考图标注
图1:先前引导方法与我们的归因引导方法GrAInS在VLM上的对比。上:现有方法存在一些关键局限,例如仅使用视觉令牌、依赖外部目标检测器,或沿单一固定方向进行引导。下:GrAInS利用对比积分梯度同时处理视觉和文本令牌,无需外部模块,并根据正负归因构建针对性的方向性干预,从而提升事实准确性。
尽管LLM和VLM在各种任务上表现强劲,但它们常生成缺乏输入查询或上下文依据的不良输出(Rame等人,2024;Shi等人,2024;Huang等人,2024)。微调通过使用任务特定数据集适配模型来解决这些问题,但需要大量计算资源和数据,并存在灾难性遗忘的风险(Li和Hoiem,2017;Lopez-Paz和Ranzato,2017)。推理时引导是微调的一种有前景的替代方案(Zou等人,2023;Liu等人,2024b;Li等人,2024b;Rimsky等人,2024;Turner等人,2024;Nguyen等人,2025a),它在推理过程中调整隐藏表示,而不改变模型参数。然而,现有的引导方法通常依赖对隐藏状态的线性干预,往往对所有令牌的隐藏状态施加相同的干预(Marks和Tegmark,2023;Li等人,2024b),忽视了特定令牌对模型行为的影响。如图1(上)所示,这可能导致过度纠正和所需能力(如流畅性或事实准确性)的损失(Nguyen等人,2025b)。此外,大多数现有方法仅从配对数据的潜在空间表示中构建引导向量,通过对期望输出和非期望输出对应的隐藏激活取差值来获得(Li等人,2024b;Rimsky等人,2024;Turner等人,2024;Nguyen等人,2025b),忽略了模型logits中丰富的信号——这些信号揭示了哪些特定输入(令牌)通过其对模型预测的**归因贡献**最强烈地驱动了不良输出。在VLM中,这一局限尤为突出——文本和视觉输入贡献不均,某些令牌在塑造模型输出中起关键作用,而其他令牌则影响甚微(Cao等人,2024;Sun等人,2025;Lin等人,2025)。因此,仅在潜在空间中构建引导向量而不识别哪些令牌对不良行为负责,可能效果不佳,并可能导致模型行为发生意外变化(Salin等人,2022;Chen等人,2024b)。
为解决这些问题,我们提出了**基于梯度的归因推理时引导**(GrAInS),一种更具选择性和可解释性的推理时引导方法,兼容LLM和VLM,如图1(下)所示,并在图2中给出了更详细的说明。GrAInS识别出对模型输出具有最大**归因贡献**的特定令牌(无论是视觉块还是语言令牌),并根据其贡献进行引导。为了衡量这种影响,我们使用积分梯度(IG)(Sundararajan等人,2017;Kapishnikov等人,2021)在偏好与非偏好输出之间的对比损失上计算令牌级归因(见图2(A))。高正归因的令牌最有助于产生期望输出,而强负归因的令牌则导致不良行为(如幻觉或毒性)。我们通过分别掩蔽每组令牌并测量隐藏激活的变化来构建对比输入变体。这些变体捕捉每个组如何影响内部表示,并应用主成分分析(PCA)来导出表示潜在空间中行为变化的引导向量(见图2(B))。在推理时,引导向量经过归一化后施加,以保留通用模型能力(如流畅性和推理能力)(见图2(C))。与先前工作中单一引导方向(Rimsky等人,2024)、仅依赖视觉令牌(Chen等人,2024a)、或需要令牌采样(可能引入不稳定性或需要大样本量使其计算昂贵)及外部模块(Liu等人,2024c;Chen等人,2024a)的方法不同,GrAInS整合了视觉和文本输入,兼顾正负归因方向,且无需额外组件或监督(见图1)。此外,虽然先前工作大多将IG等归因方法局限于事后解释(Lin等人,2025),我们填补了可解释性与主动模型引导之间的空白。这使得干预更精确、更令牌敏感,从而在单模态和多模态LLM引导中实现更好的对齐和可解释性。
我们在VLM和LLM的安全关键任务上评估GrAInS,针对幻觉、偏见、毒性和真实性,在视觉和语言两种模态下均表现出色,无需重新训练。在VLM中,我们在LLaVA-1.6-7B上实现了幻觉率从0.624降至0.514,并且在SPA-VL上将对齐偏好胜率提升了8.11%,优于LoRA和VTI等多模态引导方法(Liu等人,2024c)。在LLM中,我们也看到了类似的强劲提升:在TruthfulQA上,GrAInS将Llama-3.1-8B-Instruct模型的事实准确率提升了13.22%,比ICV(Liu等人,2024b)高出7.7%。在Toxigen上,它比基础模型准确率提升了9.89%,比NL-ITI(Hoscilowicz等人,2024)提升了4.10%。此外,由于GrAInS的局部化特性,它不会对其他任务的通用模型能力产生重大影响。在评估广泛覆盖的文本和多模态数据集(如MMLU(Hendrycks等人,2021)和MMMU(Yue等人,2024))时,标准基线会损害性能,而GrAInS则能保持性能。例如,CAA(Rimsky等人,2024)使Llama-3.1-8B的MMLU性能下降了17.78%,而GrAInS几乎相同,仅下降0.12%。类似地,CAA导致Qwen2.5-VL-7B在MMMU上下降了17.13%,而GrAInS仅下降0.51%。这些结果凸显了选择性、归因引导的干预在细粒度多模态控制中的优势,且不会导致性能下降。
## 2 相关工作
**推理时引导。** 推理时干预通过修改隐藏激活而不更新模型权重,为微调提供了一种轻量级替代方案。在LLM中,诸如ITI(Li等人,2024b)、CAA(Panickssery等人,2023)和MAT-Steer(Nguyen等人,2025b)等方法使用对比示例或属性特定向量来引导行为。对于VLM,先前工作包括模态特定方法和激活工程方法:VTI(Liu等人,2024c)和MLLM-Steering(Khayatan等人,2025)主要将视觉和语言分开处理,ICT(Chen等人,2024a)执行令牌级干预但依赖目标检测器和监督,而SteerVLM(Sivakumar等人,2025)引入了一个轻量级学习的引导模块,使用配对的目标和反向提示动态调整隐藏激活。相比之下,GrAInS通过使用基于梯度的归因来识别有影响力的视觉和文本令牌,并直接从输入构建逐层引导向量,从而统一了跨模态的引导。这避免了模态特定的启发式方法、学习到的辅助引导模块和全局干预(Liu等人,2024c;Chen等人,2024a;Rimsky等人,2024),实现了有效且可解释的控制。
**归因与可解释性。** 令牌级归因方法被广泛用于解释LLM和VLM的输出。积分梯度(IG)(Sundararajan等人,2017)是一项基础技术,通过从基线输入积分梯度来估计令牌贡献。其他梯度归因方法如SmoothGrad(Smilkov等人,2017)和Guided IG(Kapishnikov等人,2021)提高了稳定性并降低了噪声。这些方法已被应用于分析注意力和调试幻觉(Wu等人,2023;Chang等人,2024;Yang等人,2025),但通常局限于事后解释。正如Lin等人(2025)所指出,可解释性工具很少用于模型控制。在这项工作中,我们弥合了这一差距,通过使用基于梯度的归因来识别有影响力的令牌并计算对比的逐层引导向量,从而指导干预,实现无需重新训练的输入敏感控制。
## 3 方法
参考图标注
图2:我们用于VLM的归因引导引导方法概览。我们的方法包含三个阶段:(A) 使用对比积分梯度计算令牌级归因,识别最有影响力的正负令牌(绿色/红色)。(B) 通过掩蔽这些令牌构建对比输入,提取对应的隐藏状态,并应用PCA获得方向性引导向量。(C) 在推理时,将这些向量按层注入模型的隐藏状态,经过缩放和归一化以保持表示规模。
在此,我们介绍**基于梯度的归因推理时引导**(GrAInS),一种选择性作用于最有影响力输入令牌的引导方法。我们的方法包含三个步骤:(1) 基于偏好数据使用对比归因识别重要令牌,(2) 从对比激活中构建层特定引导向量,(3) 在推理过程中应用选择性和归一化的干预。我们在图2中展示了GrAInS,并在下文描述每个步骤。注意,第3.1节和第3.2节中的步骤是一次性成本,每个引导目标仅执行一次。
### 3.1 通过积分梯度进行令牌归因
**目标。** 我们首先针对模型的预测识别最有影响力的令牌。设 \(P_\theta\) 为具有参数 \(\theta\) 的模型的输出分布,模型接受输入序列 \(x = \{x_1, x_2, \ldots, x_T\}\),在VLM情况下包括文本和视觉令牌嵌入。为了找到关键令牌,我们利用基于偏好数据的对比归因信号。具体而言,我们不是针对单个输出logits计算梯度,而是使用基于偏好的损失来定义归因目标:²²²在偏好数据不可用的情况下,我们在附录A.3的消融研究中表明,使用单个参考输出(例如 \(y_{\text{pos}}\))仍然有效。
\[
f(x) = \log P_\theta(y_{\text{pos}} \mid x) - \log P_\theta(y_{\text{neg}} \mid x),
\]
其中 \(P_\theta(y \mid x)\) 表示模型分配给输出 \(y\)(给定输入 \(x\))的条件对数概率。这里,\(y_{\text{pos}}\) 和 \(y_{\text{neg}}\) 分别表示偏好响应和非偏好响应。例如,如果引导模型减少毒性,\(y_{\text{pos}}\) 将是非毒性响应,而 \(y_{\text{neg}}\) 将是负面响应。这种对比公式捕捉了相似文章
通过定向干预实现语言模型的多属性引导
MAT-Steer 提出了一种新颖的推理时干预框架,通过学习稀疏且正交的引导向量,选择性干预与每个属性相关的标记,从而在多属性冲突场景下引导大型语言模型,在问答任务和生成任务上的表现均优于现有方法。
你的LLM何时可引导?
本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。
FineSteer: 大规模语言模型推理时细粒度控制的统一框架
FineSteer 是一个新颖的推理时控制框架,将控制分解为条件控制和细粒度向量合成两个阶段,采用子空间引导条件控制(SCS)和混合控制专家(MoSE)机制来提高安全性和真实性,同时保持模型效用。实验表明在 TruthfulQA 上相比最新方法有 7.6% 的性能提升,且效用损失最小。
潜在奖励引导:一种在推理大语言模型中隐式促进认知行为的自适应推理时框架
介绍了潜在奖励引导(LRS),一种自适应推理时框架,利用稀疏自编码器的潜在状态和学习的奖励模型,隐式促进推理大语言模型中的验证和回溯等认知行为,从而在多个模型和基准测试中提升性能。
SALSA:通过学习的引导激活向量实现语音感知LLM的自适应
SALSA提出了一种轻量级自适应方法,用于语音感知的大语言模型,通过监督目标学习逐层引导向量,在域外语音基准上取得了显著改进(相对提升高达46.8%),并表明引导编码器层(尤其是较深层)比修改LLM主干更有效。