位置偏置校正不足以实现单遍注意力排序

arXiv cs.CL 论文

摘要

本文测试了修正注意力分数中的位置偏置是否能实现长上下文问答中的单遍文档排序。作者发现,尽管去偏有一定帮助,但其准确率无法与迭代排序相比,表明重复排序提供了超出单纯偏置校正的额外收益。

arXiv:2606.27793v1 公告类型:新 摘要:长上下文语言模型存在位置偏置问题,其中中间位置的信息未被充分利用。注意力排序通过根据注意力模式迭代重排文档来解决此问题,但多次排序和生成循环增加了部署成本。我们假设位置偏置是主要瓶颈,并提出去偏单遍注意力排序(Debiased One-Pass Attention Sorting),该方法从低注意力的大多数文档中估计每个提示的位置偏置曲线,并用其修正原始注意力分数(通过减法或除法),从而实现单遍排序。我们在两个模型上的实验否定了这一假设:在LLaMA-2-7B-32K-Instruct上,去偏产生了与未校准的单遍排序相同的结果(94.83% 包含准确率),而在YaRN-Llama-2-7b-64k上,去偏将准确率提高了8.67个百分点,但仍比迭代排序低14.84个百分点,仅缩小了37%的差距。这些结果表明,位置偏置校正不足以达到迭代排序的性能,重复排序提供了偏置校正之外的额外收益。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:24

# 位置偏差校正不足以实现单遍注意力排序
来源:https://arxiv.org/html/2606.27793
FARS,Qiong Tang222Equal contribution; human authors listed in alphabetical order by first name\.,Xiangkun Hu222Equal contribution; human authors listed in alphabetical order by first name\.,Xiangyang Liu222Equal contribution; human authors listed in alphabetical order by first name\.,Yiran Chen222Equal contribution; human authors listed in alphabetical order by first name\.,Yunfan Shao222Equal contribution; human authors listed in alphabetical order by first name\.。 Analemma fars@analemma\.ai

###### 摘要

长上下文语言模型存在位置偏差,即中间位置的信息未被充分利用。注意力排序(Attention Sorting)通过基于注意力模式迭代重排文档来解决此问题,但其多次排序和生成的循环增加了部署成本。我们假设位置偏差是主要瓶颈,并提出去偏单遍注意力排序(Debiased One-Pass Attention Sorting),该方法利用文档中注意力较低的大部分来估计每个提示的位置偏差曲线,并用其校正原始注意力分数(通过减法或除法),从而实现单遍排序。我们在两个模型上的实验在测试设置中反驳了这一假设:在 LLaMA-2-7B-32K-Instruct 上,去偏产生了与未校准单遍排序相同的结果(94.83% 的包含准确率),而在 YaRN-Llama-2-7b-64k 上,去偏将准确率提高了 8.67 个百分点,但仍比迭代排序低 14.84 个百分点,仅缩小了 37% 的差距。这些结果表明,位置偏差校正不足以匹配迭代排序,并且重复重排提供了超出偏差校正的额外优势。

> 披露:本文由 FARS(全自动研究系统)111https://analemma.ai/fars/ 生成,该系统自主完成了构思、文献综述、实验设计与执行、结果分析以及稿件撰写。随附代码已公开。222https://gitlab.com/fars-a/calib-attnsort-onepass人类作者进行了审阅和少量编辑修订。他们已验证了所有引用参考文献的真实性,并确认所有报告的实验结果均源于实际代码执行。读者应注意,本文的散文体和呈现方式主要由机器生成,可能未达到完全人类作者作品的标准。

## 1 引言

长上下文语言模型越来越多地部署于检索增强生成(RAG)和多文档问答任务中,模型必须从长上下文中识别并提取相关信息。然而,这些模型表现出系统性的位置偏差:它们倾向于过度关注上下文开头或结尾的信息,而忽视中间位置,这种现象被称为“中间迷失”(Liu et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib1))。当相关信息出现在不利位置时,这种偏差会显著降低性能。

注意力排序(Attention Sorting)(Peysakhovich and Lerer, 2023 (https://arxiv.org/html/2606.27793#bib.bib14)) 通过基于注意力模式迭代重排文档来解决此限制。通过测量每个文档在生成过程中获得的注意力,并将高注意力文档放在末尾(因为具有近因偏差的模型能更有效地关注末尾),该方法显著提高了长上下文问答的准确性。然而,注意力排序需要 k 次排序迭代,每次生成一个答案,这显著增加了长上下文的延迟。

我们假设,迭代排序之所以必要,主要是因为原始注意力分数受位置偏差干扰:一个相关的文档若远离末尾,单次遍历中可能无法获得足够注意力以被最优放置。如果能够显式估计并校正这种位置依赖的偏差,那么单次排序遍历就应足以匹配迭代排序的准确性。为验证此假设,我们提出去偏单遍注意力排序(Debiased One-Pass Attention Sorting),该方法利用文档中注意力较低的大部分来估计每个提示的位置偏差曲线,并用其校正原始注意力分数(通过减法或除法),仅需一次排序遍历加一次生成遍历。

我们在 SynthWiki@28K 上使用两个不同偏差特性的模型进行的实验,在测试设置中反驳了这一假设。在 LLaMA-2-7B-32K-Instruct 上,去偏产生了与未校准 k=1 排序相同的结果(94.83% 准确率),在 600 个示例中未带来任何改进。在表现出严重近因偏差的 YaRN-Llama-2-7b-64k 上,去偏将准确率从未校准 k=1 提高了 8.67 个百分点,但仍比 k=5 排序低 14.84 个百分点,仅缩小了 37% 的差距。

我们的贡献有三点。首先,我们提出并评估了去偏单遍注意力排序,该方法通过估计并校正注意力分数中的位置偏差来实现单遍文档重排。其次,我们展示了这种校正在强 k=1 的 LLaMA-2-7B-32K-Instruct 设置中并非必需,但在高偏差的 YaRN 设置中是有益的,这使得效果具有强烈的模型依赖性。第三,我们提供了证据表明,仅靠位置偏差校正无法在 YaRN 上恢复迭代排序的效果,这表明迭代排序提供了超出偏差校正的额外好处,未来的研究应予以关注。

## 2 相关工作

### 2.1 大语言模型中的位置偏差

大语言模型在处理长上下文时表现出系统性的位置偏差。Liu 等人 (2024 (https://arxiv.org/html/2606.27793#bib.bib1)) 发现了“中间迷失”现象,表明大语言模型在相关信息出现在输入开头或结尾时表现最佳,而在中间位置性能显著下降。这种 U 型注意力模式被归因于内在的注意力偏差,即极端位置的 token 无论其语义相关性如何,都获得不成比例的高注意力 (Hsieh et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib2))。Yi 等人 (2025 (https://arxiv.org/html/2606.27793#bib.bib4)) 将其描述为“注意力盆地”现象,表明浅层注意力层在决定哪些位置获得注意力方面起着关键作用。Qiang 等人 (2025 (https://arxiv.org/html/2606.27793#bib.bib3)) 进一步论证了初始 token 显著性可能导致 U 型注意力偏差,并提出了直接缩放初始 token 注意力权重的方法。另外,Xiao 等人 (2024 (https://arxiv.org/html/2606.27793#bib.bib5)) 发现了“注意力汇”——即使语义上不重要,初始 token 也会吸收多余的注意力质量——这使得高效流式推理成为可能,但也导致了位置依赖的注意力分配。我们的方法与这些校准方法不同,它通过从相同上下文中估计提示特定的文档级偏差曲线,而不是干预 token 级注意力权重或位置编码。

### 2.2 上下文窗口扩展

扩展预训练大语言模型的上下文窗口一直是一个活跃的研究领域。旋转位置编码(RoPE)(Su et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib13)) 使用旋转矩阵编码绝对位置,同时在自注意力中融入相对位置信息,从而允许灵活的序列长度。然而,基于 RoPE 的模型无法泛化到其训练序列长度之外。位置插值(Position Interpolation)(Chen et al., 2023 (https://arxiv.org/html/2606.27793#bib.bib6)) 通过线性缩小位置索引以适应原始上下文窗口,将 LLaMA 模型扩展到 32K token,且只需极少的微调。YaRN (Peng et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib7)) 在此基础上进行了改进,提出了一种计算高效的扩展方法,所需 token 数量少 10 倍,训练步数少 2.5 倍,使上下文窗口可达 128K token。最近,LongRoPE (Ding et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib8)) 通过渐进式扩展和非均匀位置插值将上下文窗口扩展到 2M token。这些方法专注于实现更长的上下文,但并未直接解决影响这些上下文中信息利用的位置偏差。

### 2.3 基于注意力的文档排序

有几种方法利用注意力模式进行检索增强生成中的文档排序。注意力排序(Attention Sorting)(Peysakhovich and Lerer, 2023 (https://arxiv.org/html/2606.27793#bib.bib14)) 基于文档在生成过程中获得的注意力迭代重排文档,将高注意力文档放在末尾,以便具有近因偏差的模型能更有效地关注。Chen 等人 (2025 (https://arxiv.org/html/2606.27793#bib.bib15)) 提出了上下文重排(ICR),利用查询引起的注意力模式变化进行高效的零样本重排,仅需两次前向传播。为解决基于 LLM 的排序中的不一致性,Zeng 等人 (2024 (https://arxiv.org/html/2606.27793#bib.bib16)) 引入了 LLM-RankFusion,通过校准和排序器聚合来缓解顺序和传递不一致性。Tang 等人 (2024 (https://arxiv.org/html/2606.27793#bib.bib17)) 提出了排列自一致性,通过对不同列表顺序边缘化来产生与顺序无关的排序。最近,Jin 等人 (2025 (https://arxiv.org/html/2606.27793#bib.bib18)) 表明简单的检索重排序可以缓解长上下文 RAG 中的难负样本和中间迷失效应。我们的工作建立在注意力排序的基础上,但研究了显式位置偏差校正是否能减少所需的排序迭代次数。

## 3 方法

### 3.1 问题设置

我们考虑长上下文抽取式问答,其中模型接收一个查询 q 和 N 个文档 D = {d_1, ..., d_N} 连接成一个提示,且恰好有一个文档包含答案。由于位置偏差 (Liu et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib1)),大语言模型倾向于过度关注上下文开头或末尾附近的文档,而忽视中间位置。对于表现出近因偏差的模型,将相关文档放在上下文末尾可提高答案准确性。目标是重排文档,使相关文档在生成答案之前出现在高注意力位置(通常是末尾)。

### 3.2 注意力排序基线

注意力排序 (Peysakhovich and Lerer, 2023 (https://arxiv.org/html/2606.27793#bib.bib14)) 通过基于注意力模式迭代重排文档来解决位置偏差。对于每个占据 token 跨度 S_i 的文档 d_i,该方法通过聚合来自第一个生成 token 的所有层 ℓ 和头 h 的注意力权重,计算原始注意力质量 a_i:

a_i = ∑_{ℓ=1}^L ∑_{h=1}^H ∑_{t∈S_i} A_t^{ℓ,h},  (1)

其中 A_t^{ℓ,h} 是从第一个输出 token 到索引为 t 的输入 token 在层 ℓ 和头 h 处的注意力权重。然后通过升序 a_i 对文档进行排序,将高注意力文档放在末尾。此过程重复 k 次迭代,每次迭代后生成一个答案;使用最后迭代的答案。对于 k=5,这导致 5 次排序和生成循环,与单次生成遍历相比,显著增加了长上下文的延迟。

### 3.3 去偏单遍排序

我们假设迭代排序之所以必要,主要是因为原始注意力分数 a_i 受到位置偏差的干扰:一个远离末尾的相关文档在单次遍历中可能无法获得足够注意力以被最优放置。如果能够显式估计并移除这种位置依赖的偏差,那么单次排序遍历就应足够。

参见图注图 1:标准迭代注意力排序(k=5,5 次排序和生成循环)与提出的去偏单遍方法(k=1,1 次排序加 1 次生成遍历)的对比。所提出的方法从文档中注意力较低的大部分估计位置偏差曲线,并用其校正原始注意力分数以进行文档重排。我们提出的方法,如图 1 所示,运行如下。首先,我们使用单个解码步骤提取每个文档的原始注意力质量 a_i,与标准注意力排序的第一次迭代相同。其次,我们根据同一提示内的注意力-位置对 (p_i, a_i) 估计位置偏差曲线 b̂(p),其中 p_i 表示文档 i 的位置索引。假设大多数文档是相关性近乎为零的干扰项,我们修剪注意力最高的前 α 比例的文档以排除可能相关的文档,将剩余位置分成 B 个等宽区间,在每个区间内计算汇总统计量(中位数或均值),然后线性插值得到连续偏差曲线 b̂(p)。第三,我们计算去偏后的分数 s_i = a_i - b̂(p_i)(加法模式)或 s_i = a_i / max(b̂(p_i), ε)(除法模式,在我们的实现中 ε=10^{-10})。最后,我们使用去偏后的分数调整文档顺序,并从重排后的提示生成答案。

超参数(α、B、聚合函数、去偏模式)和重排策略的选择在报告的同一评估数据上按模型进行调整,如第 4 节所述。此方法仅需一次排序遍历加一次生成遍历,其计算量与 k=1 注意力排序相当,但旨在通过显式偏差校正而非迭代细化来实现 k=5 的准确性。

## 4 实验

### 4.1 实验设置

我们在 SynthWiki 基准测试 (Peysakhovich and Lerer, 2023 (https://arxiv.org/html/2606.27793#bib.bib14)) 上评估去偏单遍注意力排序,该基准测试包含合成长上下文抽取式问答实例,其中有一个黄金文档位于多个干扰项中。遵循原始设置,我们通过采样干扰文档来构建约 28K token 的上下文,并将其中一个替换为随机位置的黄金文档。

我们测试了两个具有不同位置偏差特性的模型:LLaMA-2-7B-32K-Instruct333https://huggingface.co/togethercomputer/Llama-2-7B-32K-Instruct,这是 Llama 2 的指令调优变体 (Touvron et al., 2023 (https://arxiv.org/html/2606.27793#bib.bib19)),具有 32K 上下文窗口和适中的位置偏差;以及 YaRN-Llama-2-7b-64k (Peng et al., 2024 (https://arxiv.org/html/2606.27793#bib.bib7)),这是一个上下文扩展模型,未进行指令调优,表现出严重的近因偏差。我们比较四种方法:(1)无排序(原始生成),(2)注意力排序 k=1(单遍按原始注意力排序,然后生成),(3)去偏 k=1(我们提出的方法,计算量与 k=1 相同),以及(4)注意力排序 k=5(迭代排序基线)。在 k=5 条件下,实现每次排序迭代后生成一个答案,并使用最后迭代的答案,导致 5 次排序和生成循环。444这与原始注意力排序实现一致,后者在每次迭代评估中间答案。我们使用贪心解码并报告归一化子串匹配准确率(如果预测包含任何可接受的黄金答案,则计为正确)。

相似文章

思考越多,偏见越大:推理模型中由长度驱动的位置偏见

arXiv cs.AI

本研究论文探讨了推理模型中的位置偏见,发现偏见并非随着“更多思考”而消除,而是与推理轨迹的长度成正比。该研究提供了因果证据,并提供了一套诊断工具包,用于审核多选问答评估中这种由长度驱动的偏见。

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。

多视频摘要中多模态大语言模型位置偏差的系统性评估

arXiv cs.CL

吉林大学研究人员对多模态大语言模型(MLLMs)在多视频摘要任务中的位置偏差进行了系统性评估,基于 ActivityNet 和新闻视频构建了评测基准,并采用覆盖率、方向性位置偏差(DPB)和中间-边缘差距(MEG)等指标对九个模型进行了全面评估。结果表明,位置效应因领域和模型而异,且增加视觉输入或生成预算并不能统一消除这种不平衡现象。