RoPE在长上下文中既不能区分位置也不能区分标记,可证明
摘要
本文提供了理论证明,表明基于Transformer的语言模型中的旋转位置嵌入(RoPE)在长上下文中会失去其局部性偏差和区分标记顺序的能力,注意力分数变得不比随机更好。作者证明,增加RoPE基频会在位置区分和标记区分之间进行权衡,且多头、多层架构无法弥补这一基本限制。
arXiv:2605.15514v1 公告类型:新
摘要:我们识别了基于Transformer的长上下文语言模型中旋转位置嵌入(RoPE)的内在局限性。我们的理论分析抽象掉上下文的特定内容,仅依赖于其长度。我们证明,随着上下文长度增加,基于RoPE的注意力变得不可预测,并失去对其有效性至关重要的两个特性。首先,它失去了局部性偏差:RoPE不再更倾向于较近的位置而非较远的位置。其次,它失去了标记相关性的连贯性:在一个位置获得比另一个备选键向量更高注意力得分的键向量,在另一个位置可能获得更低的得分。在这两种情况下,失败的概率趋近于0.5,不比随机猜测更好。我们进一步证明,当关键标记移动到不同位置,甚至被不同标记替换时,注意力得分可以保持不变,这表明无法区分位置或标记。调整RoPE基频会在区分位置和区分标记之间进行权衡,但无法同时保留两者。增加RoPE基频超参数(这是当今长上下文模型的常见做法)有助于区分不同标记,但不可避免地牺牲了区分位置的能力。我们的实证分析表明,多头、多层架构不足以克服这些局限性。我们的发现表明,未来的Transformer长上下文语言模型可能需要全新的位置和标记顺序编码机制。
查看缓存全文
缓存时间: 2026/05/18 06:31
# RoPE 在长上下文中既无法区分位置也无法区分标记——可证明
来源:https://arxiv.org/html/2605.15514
Yufeng Du
University of Illinois at Urbana\-Champaign, USA
yufengd4@illinois\.edu
&Phillip Harris
University of Bonn, Germany
Minyang Tian
University of Illinois at Urbana\-Champaign, USA
&Eliu A Huerta
Argonne National Laboratory, USA
Srikanth Ronanki
Amazon AGI, USA
&Subendhu Rongali
Amazon AGI, USA
&Aram Galstyan
Amazon AGI, USA
Hao Peng
University of Illinois at Urbana\-Champaign, USA
haopeng@illinois\.edu
###### 摘要
我们识别了基于 Transformer 的长上下文语言模型中旋转位置嵌入(RoPE)的固有限制。我们的理论分析抽象掉了上下文的具体内容,仅依赖于其长度。我们证明,随着上下文长度的增加,基于 RoPE 的注意力变得不可预测,并失去了对其有效性至关重要的两个特性。第一,它失去了局部性偏差:RoPE 不再比远距离位置更倾向于邻近位置。第二,它在标记相关性上失去了一致性:在一个位置上获得比其他位置更高注意力分数的键向量,在另一个位置上可能获得更低的分数。在这两种情况下,失败的概率趋近于 0.5,不比随机猜测更好。我们进一步证明,当一个键标记被移动到不同位置,甚至被替换为不同标记时,注意力分数可能保持不变,这表明无法区分位置或标记。调整 RoPE 基参数需要在区分位置和区分标记之间进行权衡,但无法同时保留两者。增加 RoPE 基超参数(当今长上下文模型中的常见做法)有助于区分不同标记,但不可避免地牺牲了区分位置的能力。我们的实证分析表明,多头、多层架构不足以克服这些限制。我们的发现表明,未来的 Transformer 长上下文语言模型可能需要全新的机制来编码位置和标记顺序。
## 1 引言
位置嵌入在 Transformer 中至关重要,因为注意力机制本身是排列不变的,无法区分标记顺序(Vaswani et al., 2017 (https://arxiv.org/html/2605.15514#bib.bib39))。在众多位置嵌入中,旋转位置嵌入(RoPE,Su et al., 2021 (https://arxiv.org/html/2605.15514#bib.bib1))已成为现代基于 Transformer 的大型语言模型(LLM)的事实标准。RoPE 的流行源于几个吸引人的特性。通过旋转操作,RoPE 编码了标记之间的相对距离,并引入了倾向于邻近标记而非远距离标记的局部性偏差(Su et al., 2021 (https://arxiv.org/html/2605.15514#bib.bib1))。这种归纳偏置与自然语言的结构相一致,并且被证明对训练收敛(Gelber et al., 2025 (https://arxiv.org/html/2605.15514#bib.bib6))和扩展到更长上下文长度(Press et al., 2022 (https://arxiv.org/html/2605.15514#bib.bib5))都有益。
尽管最近 LLM 的广告上下文长度不断增加(Fu et al., 2024a (https://arxiv.org/html/2605.15514#bib.bib3); Team et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib2); DeepSeek-AI, 2026 (https://arxiv.org/html/2605.15514#bib.bib4)),但许多近期研究表明,这些模型即使在远低于其声称的上下文长度的输入长度下,也经常在应该完全在其能力范围内的长上下文任务中表现挣扎(Liu et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib31); Hsieh et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib34); Kuratov et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib35); Du et al., 2025 (https://arxiv.org/html/2605.15514#bib.bib38))。这些反复出现的失败引出了一个根本性问题:*这些失败是工程选择的产物,还是反映了 RoPE 本身的固有限制?*
回答这个问题很重要,因为它决定了未来长上下文 Transformer 的进步是主要依赖于改进的工程,还是需要全新的编码位置和标记顺序的机制。
我们的答案是,RoPE 本身在长上下文中具有固有限制。我们通过**单头注意力**的理论分析系统地解释了这一点,该分析抽象掉了上下文的具体内容,仅依赖于其长度。¹¹我们提供了多头和多层情况的讨论,见附录 E (https://arxiv.org/html/2605.15514#A5)。
我们证明,在温和假设下²²见§局限性 (https://arxiv.org/html/2605.15514#Sx1),随着上下文长度的增加,RoPE 对注意力的影响变得越来越不可预测,并破坏了使其在语言模型中有效的特性,在两个主要目标上表现挣扎:
- •第一,RoPE 无法区分位置(§3 (https://arxiv.org/html/2605.15514#S3))。随着上下文长度增长,同一个标记可能在更远的位置获得比更近的位置更高的注意力分数,概率趋近于 0.5(位置反转;§3.1 (https://arxiv.org/html/2605.15514#S3.SS1))。因此,RoPE 在倾向于邻近位置方面变得不比随机机会更好,有效失去了其局部性归纳偏置。我们进一步识别了一个特定的失败模式,我们称之为**位置混叠**:对于固定的查询和键,将键移动到不同位置可能使其注意力分数保持不变,因此模型不再可靠地区分位置(§3.2 (https://arxiv.org/html/2605.15514#S3.SS2); 图̃1 (https://arxiv.org/html/2605.15514#S1.F1))。
- •第二,RoPE 无法区分标记(§4 (https://arxiv.org/html/2605.15514#S4))。随着上下文长度增长,对于给定查询,两个不同键标记的相对排名(通过它们获得的注意力分数反映)可以在不同位置上任意反转:在一个位置上排名高于另一个的标记,在另一个位置上可能排名低于它(标记反转;§4.1 (https://arxiv.org/html/2605.15514#S4.SS1))。标记反转的概率也趋近于 0.5,不比随机机会更好。此外,更长的上下文引出了我们称之为**标记混叠**的现象:对于固定的查询和键位置,将键标记替换为不同标记可能使注意力分数保持不变,因此模型实际上无法可靠地区分标记(§4.2 (https://arxiv.org/html/2605.15514#S4.SS2))。
上述理论结果源于我们分析中的一个关键新见解,即将未归一化的注意力分数视为正态随机变量(§2.2 (https://arxiv.org/html/2605.15514#S2.SS2))。
参见图注
图 1:位置混叠导致注意力不变性失败:存在大量位置,交换两个键标记(dog, cat)使查询标记 `pet` 的注意力输出保持不变。
我们对 Llama 3.1-8B(Grattafiori et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib14))的实证分析(其声称的上下文长度为 128K 标记)证实了我们关于位置反转和标记反转的理论结论。它进一步表明,位置混叠和标记混叠都普遍发生:在仅 8K 标记的上下文长度中,存在惊人的 75K 对位置表现出位置混叠,且与位置邻近性无关;此外,在该范围内约有 150 个位置表现出标记混叠。我们的理论表明,常用的长度扩展技术并**没有**解决问题。调整 RoPE 基超参数是在两种失败模式之间进行权衡,而不是消除它们。特别是,增加 RoPE 基有助于保持标记相关性的一致性,但削弱了区分位置的能力。我们的实验证实,这些失败在真实的多头、多层 LLM 中持续存在(§5 (https://arxiv.org/html/2605.15514#S5))。我们在一个简单任务上测试了从 7B 到超过 100B 的 6 个流行模型:给定一个列表,模型必须识别第 k 个位置的值。这个任务测试的是区分位置的能力,而不是区分标记身份的能力,因为现代 LLM 通常通过检索风格的目标(Kamradt, 2023 (https://arxiv.org/html/2605.15514#bib.bib33))针对后者进行了优化。列表仅有 4 个不同值时,所有模型在短短 4K 标记长度上的表现不优于随机猜测,这个长度与这些模型训练时的长度不成比例。这加强了我们对单头情况的理论分析,表明相同的位置失败在实际模型中也存在。
我们的发现削弱了近期因快速增长的广告上下文长度而产生的一些乐观情绪。如果底层的位置机制随着上下文长度增长而退化,那么单独延长名义上下文长度是有缺陷的。我们的分析为近期研究中观察到的反复出现的长上下文失败提供了一种机制性解释(Liu et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib31); Hsieh et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib34); Kuratov et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib35); Du et al., 2025 (https://arxiv.org/html/2605.15514#bib.bib38)),暗示名义上下文限制与可靠使用远距离信息之间的差距可能无法仅通过更好的数据或工程来消除;相反,它们反映了位置机制的根本限制。通过识别这些限制,这项工作推动了进一步研究根本性新方法,以更好地适应长上下文语言建模的位置机制。
## 2 揭秘 RoPE 注意力
Transformer 中的注意力应实现两个目标:(1) **位置识别**,编码标记在文本中出现的位置,使注意力能够区分位置并捕获由词序塑造的上下文依赖。失败会损害模型理解上下文依赖的能力,并导致计数或推理等任务中的错误。(2) **标记识别**,使每个查询能够区分标记并识别那些上下文相关的标记。失败会导致模型忽略相关输入并生成幻觉内容。长上下文任务通常需要这两个目标的结合(Vaswani et al., 2017 (https://arxiv.org/html/2605.15514#bib.bib39); Liu et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib31); Bai et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib46))。
我们定义 **RoPE 乘积** 为未归一化的注意力分数,即在对查询和键应用 RoPE 后它们的点积。本节旨在通过 RoPE 乘积的视角回答两个问题:RoPE 乘积如何帮助位置识别和标记识别 (§2.1 (https://arxiv.org/html/2605.15514#S2.SS1))?随着上下文长度增加,基于 RoPE 的注意力行为如何变化 (§2.2 (https://arxiv.org/html/2605.15514#S2.SS2))?我们通过将 RoPE 乘积视为正态随机变量的关键见解来回答这两个问题。在整个论文中,我们的理论分析抽象掉了上下文的具体内容,仅考虑其长度。
### 2.1 背景
对于一对查询和键向量 \(\mathbf{q}\) 和 \(\mathbf{k}\),RoPE(Su et al., 2021 (https://arxiv.org/html/2605.15514#bib.bib1))将 \(d\) 个隐藏维度分成 \(h = d/2\) 对二维向量。随着标记位置变化,每个二维向量以其维度对所特有的角频率旋转。对两者应用 RoPE 后,\(\mathbf{q}\) 和 \(\mathbf{k}\) 之间的点积(RoPE 乘积)可以写成它们相对距离 \(m\) 的函数:
\[
S(m) = S_{\mathbf{q},\mathbf{k}}(m) = \sum_{n=0}^{h-1} a_n \cos(m\theta^n + \phi_n).
\]
基频率为 \(\theta = B^{-1/h} \in (0,1)\),其中 \(\Theta(B) > M\) 是 RoPE 基。³³按照标准实践,我们假设 \(M < \Theta(B)\),因为否则即使是频率最低的项也会振荡并失去其唯一性(Liu, 2026 (https://arxiv.org/html/2605.15514#bib.bib36))。因子可以是 \(2\pi\)、\(\pi\) 或其他值,取决于不同标准。向量 \(\mathbf{a}\) 和 \(\bm{\phi}\) 仅由 \(\mathbf{q}\) 和 \(\mathbf{k}\) 决定。对于第 \(n\) 个频率分量,其振幅 \(a_n > 0\) 是对应二维向量 \((q_{2n}, q_{2n+1})\) 和 \((k_{2n}, k_{2n+1})\) 的范数乘积,其相位 \(\phi_n \in [0, 2\pi)\) 是它们之间的夹角。
##### 高频分量振荡;低频分量衰减
对于上下文长度限制为 \(M\),分析 RoPE 乘积的一种典型方法是使用阈值 \(\lambda(M) = \Theta(h \log_B M)\)(Jonasson, 2025 (https://arxiv.org/html/2605.15514#bib.bib44); Liu et al., 2023b (https://arxiv.org/html/2605.15514#bib.bib19); Peng et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib27); Miranda and others, 2024 (https://arxiv.org/html/2605.15514#bib.bib37))将高、低频分量分开。对于 \(m \in [0, M)\),**高频**分量绕原点至少完成一圈,其中 \(n \ll \lambda(M)\);**低频**分量仅旋转一个小角度,其中 \(n \gg \lambda(M)\)。
参见图注
(a) RoPE 波形的整体模式。阴影部分表示 \(S(m)\) 作为正态分布的估计。
参见图注
(b) \(S(m)\) 的低频和高频部分,以及作为正态分布的均值和标准差。
参见图注
(c) \(S(m)\) 在 \(m \in [0, M)\) 上的完整分布。
图 2:当 \(S(m) = \sum_n \cos(m\theta^n)\),\(m \in [0, 32,768)\),\(h=64\),\(B=10^5\) 时,RoPE 乘积及其正态近似的说明。1k = 1,000。
[图̃2(b) (https://arxiv.org/html/2605.15514#S2.F2.sf2) 展示了高频分量的振荡和低频分量的衰减效应。⁴⁴严格来说,衰减并不保证发生,但仍然是可取的。见附录A (https://arxiv.org/html/2605.15514#A1.SS0.SSS0.Px4) 进行更深入的讨论。
RoPE 有助于实现前面讨论的两个主要目标。对于位置识别,高频振荡有助于捕获接近位置之间的差异,而低频衰减全局地区分远距离位置对,促进局部性归纳偏置。对于标记识别,低频分量起到稳定作用:它们的缓慢旋转保留了标记相关性的相对顺序,因为它们较少受到相对距离的扰动。
### 2.2 关键见解:RoPE 乘积作为正态随机变量
先前的工作主要关注低频衰减,因为它具有可分析性(Miranda and others, 2024 (https://arxiv.org/html/2605.15514#bib.bib37); Xu et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib22); Xiong et al., 2024 (https://arxiv.org/html/2605.15514#bib.bib23))。我们开发了 RoPE 乘积分布行为的概率性刻画。这一视角带来了对 RoPE 行为更深入的理解。本文的一个核心理论贡献可以非正式地表述如下:
###### 备注 2.1. 如果查询 \(\mathbf{q}\) 和键 \(\mathbf{k}\) 之间的距离 \(m\) 从任意区间 \([A, M)\) 中随机采样,其中 \(M-A\) 很大,则 RoPE 乘积 \(S_{\mathbf{q},\mathbf{k}}(m)\) 可以被建模为一个正态随机变量 \(\widetilde{S} = \widetilde{S}_{[A,M)}(\mathbf{q}, \mathbf{k}) \sim \mathcal{N}(\mu_M(\mathbf{q}, \mathbf{k}), \sigma_M^2(\mathbf{q}, \mathbf{k}))\)。相似文章
RoPE 在长上下文中既无法区分位置也无法区分词元,可证明
本文证明,基于RoPE的注意力机制在长上下文中无法区分词元位置和身份,解释了LLM在宣称的上下文长度内失败的原因。实验验证表明,针对检索优化的模型在简单列表任务上表现困难。
RoVE:面向相对位置依赖值路径的旋转值嵌入注意力机制
本文提出RoVE,一种无需参数的旋转位置嵌入改进方法,通过同时旋转值与键使值路径具备位置敏感性,将RoPE注意力转化为注意力卷积。在GPT-2模型上的实验表明,该机制在少样本上下文学习、分布外困惑度及长上下文检索方面持续提升性能。
通过相对位置编码对距离进行编码以增强基于Transformer的路由
本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。
@agopal42:今天在 #ICML2026 上介绍 PoPE!我们从内容-位置纠缠的角度重新审视 RoPE,并展示如何用极坐标…
新论文介绍了 PoPE,一种将内容与位置解耦的位置编码,解决了在多个 LLM(如 Qwen、Gemma、DeepSeek)中使用的 RoPE 的一个基本缺陷。已在 ICML2026 上展示。
高维动态旋转位置编码 [P]
介绍了 HDD-RoPE,这是旋转位置编码的一种扩展,它使用高维块和数据相关的旋转速率,在 TinyStories 数据集上显示出比 xPos 更快的收敛速度。