校准内容如何塑造基于注意力的重排序
摘要
本文展示,基于注意力的重排序中的校准内容在详细指令下可能降低性能,并提出插值空校准作为一种无需训练的方法,以在指令密集的任务上恢复排名。
arXiv:2609.17764v1 公告类型:新
摘要:基于注意力的重排序器通过聚合查询到文档的注意力并减去空查询校准传递来评分文档,以消除位置和结构偏差。尽管广泛使用,这种校准假设空传递从每个文档中移除了无关信号。我们表明,现代提示内容,例如约束、指令、角色和演示,在进入评分读出时可能违反这一假设,使空传递变得相关感知而非空。我们发现,当应用于包含更长、更详细指令的提示时,校准尤其有害,因为空传递步骤会移除相关信号。基于这些发现,我们提出插值空校准,一种无需训练的修改,控制多少指令内容进入空基线。它在指令密集的任务上恢复基于注意力的重排序性能,在这些任务中标准校准失败,同时当空传递保持相关无关时保留校准的益处。在指令密集的任务上,恢复的排名超越生成式重排序器。我们还表明,上下文中的演示以很少的校准干扰改善基于注意力的重排序,因为演示仅通过查询传递作用,并保持空传递不变。
查看缓存全文
缓存时间: 2026/09/17 08:58
# 校准内容如何影响基于注意力的重排序
来源:https://arxiv.org/html/2609.17764
Hossein Rajaby Faghihi(Google)
Peter Chen(Google DeepMind)
Rui Zhu(Google DeepMind)
Noveen Sachdeva(Google DeepMind)
Yan Zhu(Google)
Julian McAuley(加州大学圣地亚哥分校)
###### 摘要
基于注意力的重排序器通过聚合查询到文档的注意力来评分文档,并通过减去空查询校准过程来消除位置和结构偏差。尽管广泛使用,但这种校准假设空查询过程能去除每个文档中的无关信号。我们证明,现代提示内容(例如约束条件、指令、角色描述和示例)在进入评分读出时可能违反这一假设,使空查询过程成为相关性感知而非空查询。我们发现,当应用于包含更长、更详细指令的提示时,校准尤其有害,因为空查询步骤会移除相关信号。基于这些发现,我们提出了**插值空校准**,这是一种免训练的改进方法,可控制指令内容进入空基线的程度。它在指令繁重的任务上恢复了基于注意力的重排序性能(而标准校准在此失败),同时在空查询保持与相关性无关时保留了校准的优点。在指令繁重的任务中,恢复的排名性能超过了生成式重排序器。我们还表明,上下文内示例对基于注意力的重排序的改进几乎不受校准干扰,因为示例仅通过查询过程起作用,而空查询过程保持不变。
## 1 引言
图1:我们三个评分输入的可视化。基础排序模板始终存在;每个过程切换查询槽(\(q\) 或空查询 \(\varnothing\))和*任务*指令槽(\(I\) 或空 \(\varnothing\)),任务指令与查询一起位于评分读出(查询 → 文档注意力)中。标准校准从查询过程中减去包含指令的空查询过程 \(s_d(\varnothing, I)\)。
文档排序已从交叉编码器和嵌入模型(Karpukhin 等, 2020)(https://arxiv.org/html/2609.17764#bib.bib13);(Izacard 等, 2022)(https://arxiv.org/html/2609.17764#bib.bib14)发展到使用解码器语言模型的生成式排序(Qin 等, 2024)(https://arxiv.org/html/2609.17764#bib.bib25)。解码器模型提供了嵌入方法所缺乏的能力,例如遵循自然语言指令以调整排序标准(Weller 等, 2024a)(https://arxiv.org/html/2609.17764#bib.bib1);(Sun 等, 2024b)(https://arxiv.org/html/2609.17764#bib.bib3),融入少样本示例进行领域适应(Drozdov 等, 2023)(https://arxiv.org/html/2609.17764#bib.bib22),并受益于推理时扩展(Zhuang 等, 2026)(https://arxiv.org/html/2609.17764#bib.bib23);(Yang 等, 2025b)(https://arxiv.org/html/2609.17764#bib.bib24)——所有这些都无需重新训练。最近,上下文内排序(ICR)(Chen 等, 2024)(https://arxiv.org/html/2609.17764#bib.bib2)已成为生成式排序的高效替代方案。给定由候选文档和查询组成的输入,ICR 通过聚合查询到文档的注意力权重为每个文档评分。这在需要 O(1) 次预填充并绕过生成式方法(如 RankGPT)使用的解码步骤的同时,获得了有竞争力的结果。
为了从模型原始的注意力分数中分离出真实的相关性特征,标准 ICR 依赖于两阶段流程:初始查询过程,随后立即进行调整步骤以清理数据。此步骤称为空查询校准过程,是 ICR 有效性的核心。通过减去使用无内容查询获得的注意力分数,校准消除了原本会主导聚合的位置和结构偏差。这种校准设计已被后续基于注意力的重排序器不加修改地采用:QRHeads(Zhang 等, 2025)(https://arxiv.org/html/2609.17764#bib.bib4)使用校准分数选择查询相关头部,CoReTran(等, 2026)(https://arxiv.org/html/2609.17764#bib.bib5)在校准分数之上应用对比头部选择,ReAttn(Tian 等, 2026)(https://arxiv.org/html/2609.17764#bib.bib6)在校准后添加基于 IDF 的 token 重新加权,HeadRank(Wang 等, 2026)(https://arxiv.org/html/2609.17764#bib.bib7)在熵正则化头部选择之前“统一”应用校准。所有这四种方法都提出了更强的聚合方法,同时将校准步骤本身视为固定不变的。
然而,现代排序提示通常除了候选文档和查询外,还包含指令、少样本示例和角色描述(Weller 等, 2024a)(https://arxiv.org/html/2609.17764#bib.bib1);(Oh 等, 2024)(https://arxiv.org/html/2609.17764#bib.bib21)。ICR 通过查询 token 获得的注意力为每个文档评分,我们称之为*读出*。我们证明,指令只有在成为此读出的一部分时才能引导排序。将其放在文档之前(如标准模板所示)几乎不会改变分数。因此,我们将任务指令在文档后、查询前插入。这种放置方式对于遵循指令是必要的,但也意味着空查询过程会处理该指令。空查询过程仅捕获位置偏差的假设不再成立。
本文首次系统研究了空查询校准与更丰富提示内容之间的交互作用。我们的主要贡献结构如下:
- • **最优指令放置**:我们确定,遵循指令的 ICR 需要将任务指令放置在查询到文档注意力读出*内部*,而不是其传统的文档前位置。
- • **校准机制分析**:我们绘制了四种内容类型(纯查询、约束、每查询指令和示例)的校准行为。我们发现,性能取决于指令的空查询过程足迹是*相关性跟踪型*(按文档相关性改变分数,校准会破坏)还是*相关性无关型*(均匀改变分数,校准能正确移除)。
- • **方法扩展**:我们开发了插值空校准,一种免训练技术,用于在校准过程中调节指令的可见性。在复杂指令任务(如 InstructIR)上,此方法比 RankGPT 高达 40.5%。
- • **上下文内示例**:我们表明 ICR 从上下文内示例中受益,并且这种益处不受校准选择的影响。
## 2 背景
### 2.1 基于注意力的排序
ICR(Chen 等, 2024)(https://arxiv.org/html/2609.17764#bib.bib2)通过聚合查询到文档 token 的预填充注意力权重为文档评分。它分解为两个过程:查询过程和校准过程。在*查询过程*中,所有文档和查询被放置在一个提示中进行单次前向传播。对于每个文档,通过某种形式的查询到文档 token 的注意力聚合(例如,跨层和头求和)计算相关性分数:
\[ s_{d,q} = \sum_{l,h} \sum_{j \in \mathcal{T}_d} \frac{1}{|\mathcal{T}_q|} \sum_{i \in \mathcal{T}_q} a_{i,j}^{l,h} \quad (1) \]
其中 \(\mathcal{T}_q\) 和 \(\mathcal{T}_d\) 分别是查询和文档 \(d\) 的 token 范围,\(a_{i,j}^{l,h}\) 是层 \(l\)、头 \(h\) 中从 token \(i\) 到 token \(j\) 的注意力权重。从查询过程产生的分数 \(s_{d,q}\) 继承了因果注意力中位置编码带来的位置偏差。为了消除这些偏差,ICR 提出了第二次校准过程。在校准过程中,查询被替换为空字符串(通常为“N/A”),同时保持文档和所有其他提示内容不变。校准分数在聚合前逐 token 减去空查询过程分数:
\[ S(d) = \sum_{j \in \mathcal{T}_d} \left[ s_{d_j,q} - s_{d_j,\text{N/A}} \right] \quad (2) \]
此减法旨在移除与相关性无关的位置效应。最近的方法如 CoReTran(等, 2026)(https://arxiv.org/html/2609.17764#bib.bib5)、ReAttn(Tian 等, 2026)(https://arxiv.org/html/2609.17764#bib.bib6)和 QRHeads(Zhang 等, 2025)(https://arxiv.org/html/2609.17764#bib.bib4)在 ICR 基础上构建,同时保留了这个相同的校准步骤。
### 2.2 校准作为点态互信息
ICR 的校准大致类似于点态互信息(PMI)评分——从“条件”注意力(真实查询)中减去“无条件”注意力(无内容查询)——这与少样本分类的空输入校准(Zhao 等, 2021)(https://arxiv.org/html/2609.17764#bib.bib17)、领域条件 PMI(Holtzman 等, 2021)(https://arxiv.org/html/2609.17764#bib.bib16)和对比解码(Li 等, 2023)(https://arxiv.org/html/2609.17764#bib.bib15)背后的原理相同。注意力分数不是对数概率,因此这不是一个正式的 PMI 估计,但它们共享相同的原理:减法估计器仅在其基线独立于被测量量(此处为相关性)时才有信息量。然而,在 ICR 方法的空查询过程中,处理了完整的提示——保留了指令、示例和偏好,仅省略了查询。因此,如果此提示内容诱导的文档级注意力模式在查询和空查询过程之间存在差异,校准可能会移除有用的信号而不仅仅是偏差。本文的其余部分将测试这种独立基线何时成立,何时失效。
### 2.3 位置偏差:校准移除了什么
表 1:位置偏差消融研究。nDCG 均值和标准差(基于 5 种文档排序)。\(\tau\) 是原始排序和打乱排序分数之间的平均肯德尔相关系数。标准的 N/A 校准(✓)降低了排序敏感性,并在所有三个模型中提高了排序质量。
我们首先评估校准移除其原始声明目的——位置偏差的能力。因为 ICR 在单个序列中对所有文档进行评分,因果掩码和位置编码使注意力依赖于位置——某些位置的文档无论相关性如何都会系统地获得更多注意力——而校准旨在减去这个与相关性无关的部分(Chen 等, 2024)(https://arxiv.org/html/2609.17764#bib.bib2);(Liu 等, 2023)(https://arxiv.org/html/2609.17764#bib.bib18)。对于 BEIR(Thakur 等, 2021)(https://arxiv.org/html/2609.17764#bib.bib11)中 scifact 和 nfcorpus 分割的每个 80 个查询,我们对 5 种排序下的文档进行评分(ICR 使用的默认逆 BM25 排序加上 4 种打乱),并测量默认排序与每种打乱排序之间的肯德尔 \(\tau\)(\(\tau\) 是一致对的比例;\(\tau=1\) 表示完全位置不变性)。结果见表 1(https://arxiv.org/html/2609.17764#S2.T1)。没有校准时,分数显示出严重的排序依赖性(\(\tau \leq 0.285\))。校准使排序不变性加倍,并改善了所有模型的排序质量。虽然有益,但校准后的指标仍远未达到最优(\(\tau \ll 1\)),表明校准是减轻而非消除位置偏差,尽管这不在我们的研究范围内。
## 3 三阶段分解与插值空校准
标准上下文内重排序(ICR)假设空查询校准过程主要捕获位置和结构信号。我们形式化了当提示携带非平凡内容时此假设如何失效。为了评估这一点,我们引入了一个三阶段分解框架,该框架隔离了指令在空查询过程中的足迹,使我们能够测量指令对校准的影响何时会有意义地贡献于最终排序。
### 3.1 三阶段分解
为了分析校准与提示内容的交互作用,我们用两个槽来描述每个前向传播:*查询槽*,保存真实查询 \(q\) 或空查询 \(\varnothing\)(“N/A”);*指令槽*,保存指令 \(I\) 或无内容(\(\varnothing\))。1 我们广泛使用“指令”一词,包括任何额外的提示内容,例如引导指令、角色描述和示例。令 \(s_d(x, c)\) 表示来自查询槽 \(x \in \{q, \varnothing\}\) 和指令槽 \(c \in \{I, \varnothing\}\) 的前向传播对文档 \(d\) 的聚合注意力(公式 (1)(https://arxiv.org/html/2609.17764#S2.E1))。我们的分析使用三个过程:
\[ \underbrace{s_d(q, I)}_{\text{查询+指令}} , \quad \underbrace{s_d(\varnothing, I)}_{\text{空查询+指令}} , \quad \underbrace{s_d(\varnothing, \varnothing)}_{\text{纯空查询}} . \quad (3) \]
图 1(https://arxiv.org/html/2609.17764#S1.F1)说明了每个过程的提示。标准 ICR 带校准的评分为 \(S_{\text{std}}(d) = s_d(q, I) - s_d(\varnothing, I)\),即查询过程减去包含指令的空查询过程。
### 3.2 校准何时有益?
校准已被证明可以提高位置不变性,从而在标准排序任务中获得更好的性能(Chen 等, 2024(https://arxiv.org/html/2609.17764#bib.bib2);第 2.3 节(https://arxiv.org/html/2609.17764#S2.SS3))。然而,指令的存在也会影响校准分数。我们假设某些指令(如冗长的用户角色描述或带有引导约束的指令)可能会将相关性信号泄漏到 \(s_d(\varnothing, I)\) 中。为了正式测量指令在空查询过程中对每个文档的影响,我们引入:
\[ \Delta_N(d) = s_d(\varnothing, I) - s_d(\varnothing, \varnothing) , \quad (4) \]
我们将 \(\Delta_N\) 称为指令的*足迹*,并将用它来表征标准校准在 ICR 中何时有害。
标准 ICR 为 \(S_{\text{std}}(d) = s_d(q, I) - s_d(\varnothing, I)\)。将空查询过程写为 \(s_d(\varnothing, I) = s_d(\varnothing, \varnothing) + \Delta_N\),可将其分为两项:
\[ S_{\text{std}}(d) = \underbrace{\big[ s_d(q, I) - s_d(\varnothing, \varnothing) \big]}_{\text{位置校准}} - \underbrace{\Delta_N(d)}_{\text{指令足迹}} . \quad (5) \]
第一项减去位置信号和偏差,因为没有指令。第二项减去上面定义的指令足迹。如果指令足迹提供相...相似文章
校准偏好学习:以标签排序为例
本文形式化了概率标签排序的校准定义,引入了校准概念的层次结构,并表明常见模型校准不佳。进一步展示了在RLHF奖励模型中的应用,其中校准与准确性相关但不完全相同。
未匹配不等于错误:不完整的参考集在开放式心智理论追踪中可以逆转校准排名
论文表明,在开放式心智理论追踪中,不完整的参考集可以逆转校准排名,并提出了使用人工飞行员修正评估的方法。
当校准排名反转时:面向LLM公平比较的精度控制评估
本文证明,诸如期望校准误差(Expected Calibration Error)等全局校准指标会受到模型精度的混杂影响,并提出了ACE,一个用于公平比较大语言模型的精度控制评估框架。
低方差奖励下群组相对优化中的优势尺度校准不平衡:诊断与有界恢复
本文针对低方差奖励下群组相对优化中的优势尺度校准问题,提出了如Reward-Resolution Protocol和MaxNorm-AC等方法,以过滤亚分辨率抖动并为可信差距提供有界恢复。
为何对齐评估需要校准(8分钟阅读)
本文认为,对齐评估(evals)需要进行适当的校准才能有意义,讨论了常见的陷阱和改进校准的技术。