使用探针目标归因定位大型语言模型中的提示模糊性
摘要
介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。
arXiv:2606.05486v1 公告类型:新
摘要:提示模糊性是大型语言模型中常见的失败原因,但由于它是提示的潜在属性,而现有的归因方法旨在解释可观察的输出(如logits或生成的标记),因此难以定位。我们提出了PRIG,一种梯度归因方法,利用探针logits将潜在模糊性归因于标记位置。具体来说,PRIG训练一个线性探针来区分清晰提示和模糊提示,并将探针得分归因于残差流中较早的标记表示。为了进行标记级评估,我们通过重写每个提示中一个关键任务的句子,构建了涵盖编码、数学和写作的合成模糊数据集,并辅以人工编写的黄金基准。在此设置下,PRIG在定位模糊片段方面显著优于梯度归因基线,在合并的合成基准上达到0.840 AUROC,在黄金集上达到0.891 AUROC。它还在句子级模糊性识别上优于GPT-5.4,并保留了领域外的有用信号。这些结果确立了PRIG作为识别提示中模糊部分的实用工具。更广泛地说,它们表明潜在提示属性可以通过中间表示而非输出级归因来定位。
查看缓存全文
缓存时间: 2026/06/05 08:06
# 在大语言模型中通过探针目标归因定位提示歧义
来源:https://arxiv.org/html/2606.05486
Govind Ramesh 佐治亚理工学院 govind\.ramesh@gatech\.edu&Yao Dou 佐治亚理工学院 douy@gatech\.edu&Wei Xu 佐治亚理工学院 wei\.xu@cc\.gatech\.edu
###### 摘要
提示歧义是大语言模型中常见的故障来源,但由于它是提示的一个潜在属性,因此难以定位,而现有的归因方法旨在解释可观察的输出,例如 logits 或生成的 token。我们引入了 PRIG,一种梯度归因方法,它使用探针 logit 将潜在歧义归因到 token 位置。具体来说,PRIG 训练一个线性探针来区分清晰的提示和歧义的提示,并将探针分数归因到残差流中较早的 token 表示。为了启用 token 级别的评估,我们通过重写每个提示中一个任务关键的句子,构建了涵盖编程、数学和写作的合成歧义数据集,并辅以一个人类编写的黄金基准。在此设置下,PRIG 定位歧义片段的能力显著优于梯度归因基线,在综合合成基准上达到 0.840 AUROC,在黄金集上达到 0.891 AUROC。它在句子级别的歧义识别上也优于 GPT-5.4,并在域外保持有用的信号。这些结果确立了 PRIG 作为识别提示中哪些部分存在歧义的实用工具。更广泛地说,它们表明可以通过中间表示而非输出级别的归因来定位潜在的提示属性。代码可在此处获取 (https://github.com/govindramesh/LLM-Ambiguity-Attribution)。
## 1 引言
大语言模型 (LLMs) 越来越多地用于需要遵循复杂自然语言指令的场景,包括问答、代码生成和开放式的任务执行。LLM 的故障通常被认为是错误推理、规划或事实记忆的结果,但许多故障源于提示中的歧义,而非推理或知识的缺陷 (Min et al., 2020 (https://arxiv.org/html/2606.05486#bib.bib1); Stelmakh et al., 2022 (https://arxiv.org/html/2606.05486#bib.bib2))。先前的工作表明,歧义性问题在现实世界环境中很常见,并且后续错误的相当一部分可以追溯到输入本身的歧义,而不是模型能力的缺失 (Min et al., 2020 (https://arxiv.org/html/2606.05486#bib.bib1); Trienes and Balog, 2019 (https://arxiv.org/html/2606.05486#bib.bib3); Stelmakh et al., 2022 (https://arxiv.org/html/2606.05486#bib.bib2))。这种歧义可以表现为几种形式:提示可能省略或未充分指定约束,包含多个合理的语义解读,或依赖模糊或不完整的引用 (Yang et al., 2025 (https://arxiv.org/html/2606.05486#bib.bib47))。由此产生的故障在即使很小的规范差距也至关重要的领域(如编程、数学问题解决和写作任务)尤其严重 (Yang et al., 2025 (https://arxiv.org/html/2606.05486#bib.bib47))。在这些设置中,LLM 可能会自信地回应,但同时却推断错了任务,这使得歧义不仅是一个可用性问题,也是一个可靠性和信任问题,因为模型可能会幻觉出看似合理但错误的任务假设 (Ji et al., 2023 (https://arxiv.org/html/2606.05486#bib.bib4))。
参照图注
图 1:我们的贡献包括:从编程、写作和数学数据集生成歧义提示的合成数据;训练歧义探针以区分清晰和歧义提示;基于探针的 token 梯度归因于歧义。
最近的工作探索了澄清问题生成、选择性弃权、歧义基准和结构消歧,表明即使是前沿的 LLM 也难以自行可靠地解决歧义指令 (Kuhn et al., 2022 (https://arxiv.org/html/2606.05486#bib.bib5); Krasheninnikov et al., 2022 (https://arxiv.org/html/2606.05486#bib.bib6); Cole et al., 2023 (https://arxiv.org/html/2606.05486#bib.bib7); Mu et al., 2024 (https://arxiv.org/html/2606.05486#bib.bib8); Saparina and Lapata, 2025 (https://arxiv.org/html/2606.05486#bib.bib9))。因此,理解歧义在提示中源自何处对于调试提示、改进对齐和构建稳健的系统至关重要。然而,现有的归因方法主要设计用于解释模型输出,而不是输入本身的潜在属性 (Sundararajan et al., 2017 (https://arxiv.org/html/2606.05486#bib.bib12); Shrikumar et al., 2017 (https://arxiv.org/html/2606.05486#bib.bib13); Abnar and Zuidema, 2020 (https://arxiv.org/html/2606.05486#bib.bib14))。对于基于扰动和激活修补的方法来说,歧义是一个困难的归因目标,因为规范不足通常不能局部移除。也就是说,删除一个影响大的片段可能会使提示同样或更加歧义,而不是产生一个清晰的反事实。基于注意力的方法也不够充分,因为注意力权重反映的是模型关注哪里,而不是哪些 token 因果地决定行为 (Jain and Wallace, 2019 (https://arxiv.org/html/2606.05486#bib.bib15))。同时,深度自回归 Transformer 中的输入级梯度归因可能会在长上下文和高度非线性的 token 交互中扩散 (Hooker et al., 2019 (https://arxiv.org/html/2606.05486#bib.bib19); Zhao and Shan, 2024 (https://arxiv.org/html/2606.05486#bib.bib17))。
我们将提示歧义视为编码在 LLM 隐藏表示中的一个潜在属性,这些表示先前已被用于检测简单形式的歧义 (Zhang et al., 2025b (https://arxiv.org/html/2606.05486#bib.bib18); Skean et al., 2025 (https://arxiv.org/html/2606.05486#bib.bib40); Alain and Bengio, 2017 (https://arxiv.org/html/2606.05486#bib.bib21))。我们训练线性探针来区分清晰的提示和歧义的提示,将探针 logit 解释为歧义分数,并将该分数归因到 token 位置。
为此,我们通过重写每个提示中一个任务关键片段以引入歧义,同时保持主题和结构不变,构建了涵盖编程、数学和写作的合成歧义数据集。然后,我们应用集成梯度在中间隐藏状态上(而非输入嵌入)将歧义分数归因到 token。将归因限制在一个本地层跨度并使用探针 logit 作为目标,可以捕获 token 对下游歧义特征的贡献,同时减少归因扩散。本工作的主要贡献是:
- • 我们引入了一类针对潜在提示属性的特征级 token 归因问题,特别是用于识别歧义。
- • 我们构建了涵盖编程、数学和写作的合成任务级歧义数据集,支持直接的 token 级评估。
- • 我们提出了一种探针目标的残差集成梯度方法,通过中间隐藏状态将探针定义的歧义信号归因到 token 位置。
- • 我们表明,这种方法能准确识别歧义区域,跨域迁移,并且显著优于标准的基于梯度的 token 归因基线。
## 2 问题设定
设一个提示表示为 token 序列 x=\(x_1, \dots, x_n\)。对于一个具有 L 层的 Transformer,令 h_i^ℓ ∈ R^d 表示 token 位置 i 在第 ℓ 层之后的残差流表示。我们感兴趣的是歧义作为提示在输入时的一个潜在属性,而不是任何特定生成续文的属性。
我们假设歧义至少部分地可以从内部表示中线性解码。因此,对于每一层 ℓ,我们在残差激活 h^ℓ 上训练一个逻辑回归探针。我们将 h^ℓ 沿序列长度维度压缩,要么取最后一个 token h_n^ℓ,要么取所有 token 的均值以获得探针 F_ℓ:
h̄^ℓ(x) = (1/n) ∑_{i=1}^n h_i^ℓ, F_ℓ(x) = w_ℓ^⊤ h̄^ℓ(x), (1)
其中 w_ℓ ∈ R^d 是层 ℓ 的探针权重向量。在当前设置中,探针在无截距项的情况下训练,因此标量 F_ℓ(x) 恰好是逻辑非线性之前的探针 logit。
这为我们提供了一个可微的歧义函数:
F_ℓ(x) = (1/n) ∑_{i=1}^n ⟨w_ℓ, h_i^ℓ(x)⟩. (2)
归因目标是为每个 token 位置分配一个分数 a_i,其中 a_i 衡量位置 i 对 F_ℓ(x) 的贡献程度。
这种设置与标准的 token 归因不同,因为我们不是将输出 logit 归因到输入嵌入。在这里,我们将一个基于探针的内部特征归因到 token 表示。因此,我们的问题是表示空间中的特征级归因。
## 3 方法
### 3.1 背景
基于梯度的归因方法估计一个标量目标对输入或内部表示小幅变化的敏感度。Saliency maps 和 Gradient×Input 计算效率高,但它们依赖局部的一阶信息,这使得它们对深度网络中的饱和、尖锐非线性和局部不稳定性敏感 (Shrikumar et al., 2017 (https://arxiv.org/html/2606.05486#bib.bib13); Hooker et al., 2019 (https://arxiv.org/html/2606.05486#bib.bib19))。集成梯度 (IG) 被引入来解决这些问题,它通过沿着从基线 x′ 到输入 x 的路径对梯度进行积分 (Sundararajan et al., 2017 (https://arxiv.org/html/2606.05486#bib.bib12)):
IG_i(x; x′) = (x_i - x′_i) ∫_0^1 (∂F(x′ + α(x - x′)) / ∂x_i) dα. (3)
IG 在标准设置下满足敏感性和实现不变性,并且通常比原始梯度更稳定 (Sundararajan et al., 2017 (https://arxiv.org/html/2606.05486#bib.bib12))。然而,直接在嵌入空间应用 IG 仍然存在问题,原因是基线的选择、插值路径穿过不对应有效 token 的区域,以及归因在长上下文或许多弱相关位置上扩散 (Kapishnikov et al., 2021 (https://arxiv.org/html/2606.05486#bib.bib31); Goh et al., 2021 (https://arxiv.org/html/2606.05486#bib.bib32); Mersha and Kalita, 2026 (https://arxiv.org/html/2606.05486#bib.bib33))。这些担忧促使了 Transformer 模型中的平滑变体和逐层 IG 扩展 (Goh et al., 2021 (https://arxiv.org/html/2606.05486#bib.bib32); Mersha and Kalita, 2026 (https://arxiv.org/html/2606.05486#bib.bib33))。
### 3.2 探针目标的残差集成梯度
我们的方法由三个耦合的组件组成:在层 ℓ 的逐 token 探针分数,在从层 m 到层 ℓ 的截断残差流子图上的集成梯度,以及应用于所得 token 分数的 Gaussian 平滑步骤。
标准探针将 token 表示进行均值池化,然后应用探针权重向量,如公式 1 所示。对于分类,这已经足够。然而,对于归因,我们推导出层 ℓ 的特征 logit 为:
F_ℓ(x) = (1/n) ∑_{i=1}^n ⟨w_ℓ, h_i^ℓ(x)⟩, (4)
这是一个逐 token 点积的聚合。这基于一个假设:探针在表示空间中学习到特定的方向,因此与每个 token 表示的点积量化了该 token 代表该方向的程度。由于探针是线性的,当残差激活 h^ℓ 被均值池化时,公式 1 和 4 在数值上是等价的,但如果探针是在最后一个 token 表示 h_n^ℓ 上训练的,则不等价。
令 ℓ 是评估歧义探针的层,令 m < ℓ 是执行归因的层。记
R^m(x) = [h_1^m(x), ..., h_n^m(x)] ∈ R^{n×d} (5)
为层 m 处残差表示的矩阵。定义残差空间函数
G_{ℓ,m}(R) = F_ℓ(f_{ℓ:m}(R)), (6)
其中 f_{ℓ:m} 表示从层 m 到层 ℓ 的前向计算。直觉上,G_{ℓ,m} 将层 m 处的残差流视为输入,将层 ℓ 处的探针 logit 视为标量输出。
我们在残差空间中使用零基线。对于插值参数 α ∈ [0,1],路径为
R_α^m = α R^m(x). (7)
在此路径上的集成梯度产生一个维度上的归因
A_{i,j}^{ℓ,m}(x) = h_{i,j}^m(x) ∫_0^1 (∂G_{ℓ,m}(R_α^m) / ∂h_{i,j}^m) dα, (8)
其中 h_{i,j}^m 是层 m 处 token 位置 i 的第 j 维。实践中,我们使用 50 个点的黎曼和来近似积分。每个 token 的最终分数通过对残差维度求和得到:
a_i^{ℓ,m}(x) = ∑_{j=1}^d A_{i,j}^{ℓ,m}(x). (9)
我们不将归因通过从嵌入到特征 logit 的完整路径传播,而是将反向图限制在紧邻探针层之前的层。我们将 h^m 的序列位置视为与输入的 token 位置等价。这是基于以下直觉:在 Transformer 计算中,每个 token 位置保留一个对应的残差流向量,连续的注意力机制和 MLP 块更新该向量,同时保持序列中的位置对齐。尽管一个位置上的表示逐渐融合了其他 token 的上下文信息,但残差流在整个网络中仍然由 token 位置索引。因此,我们将中间层的残差状态视为上下文 token 表示,它们仍然与原始序列中的 token 位置保持有意义的对齐。现在,我们分析的是层 m 的 token 位置上的残差状态如何贡献于层 ℓ 解码的歧义特征。对于我们的问题,这有助于减少在完整的输入空间归因中经常出现的扩散,尤其是在长 Transformer 上下文中。
原始的 token 级归因分数可能仍然有噪声,因为子词分词可能会分割语义连贯的短语,并且局部的梯度估计可能在相邻位置上变化剧烈。为了减少这些伪影,我们使用一维 Gaussian 核平滑原始的 token 分数:
ã_i = ∑_{j=1}^n K_σ(i - j) a_j, (10)
其中 K_σ 是离散 Gaussian 核。在所有报告的实验中,我们使用 σ=3。此外,由于我们评估的是更复杂的任务级歧义而非词级歧义,孤立的 token 尖峰很少是我们关注的有意义对象;也就是说,任务级歧义更常见于一小部分相邻 token 共同模糊了用相似文章
提示语言与翻译理论驱动的提示在大型语言模型中的作用:以西中新闻翻译为例
本研究探讨了提示语言和翻译理论驱动的提示设计如何影响GPT-5.2生成的西中新闻翻译质量,发现尽管自动化指标偏好基线提示,但在专家评估下,理论驱动提示改善了文体。
链式思考在探针时刻为何有效?局部共现而非全局推导
本文探究了为什么在探针时刻加入链式思考提示能提升语言模型准确率,发现其提升主要源于局部词元共现和词汇激活,而非全局的逻辑推导。
当 Attribution Patching 存在偏差:诊断与二阶修正
本文诊断了 attribution patching 中的系统性误差——这是一种用于语言模型因果定位的基于梯度的近似方法——并提出了一种使用 Hessian-vector product 的二阶修正,该修正以极小的额外计算成本提高了可靠性。
语言模型中锚定路径的定位
本文研究提示中无关数字如何导致语言模型中的锚定效应,并利用基于归因的电路方法在Qwen和Llama模型上定位携带该信号的内部路径。
大语言模型的维度级意图保真度评估:来自结构化提示消融的证据
本文介绍了一种使用结构化提示消融来测量大语言模型意图保真度的维度级评估方法。