RoVE:面向相对位置依赖值路径的旋转值嵌入注意力机制
摘要
本文提出RoVE,一种无需参数的旋转位置嵌入改进方法,通过同时旋转值与键使值路径具备位置敏感性,将RoPE注意力转化为注意力卷积。在GPT-2模型上的实验表明,该机制在少样本上下文学习、分布外困惑度及长上下文检索方面持续提升性能。
查看缓存全文
缓存时间: 2026/06/11 13:46
# Rotary Value Embeddings:面向相对位置依赖值通路的注意力机制
来源:https://arxiv.org/html/2606.11275
\theorembodyfont\theoremheaderfont\theorempostheader
:\theoremsep \jmlrvolume334\jmlryear2026\jmlrworkshop数据科学中的拓扑、代数与几何
\NameAlejandro García\-Castellanos¹\Emaila\.garciacastellanos@uva\.nl \NameMaurice Weiler²\Emailm\.weiler\.ml@gmail\.com \NameErik J\. Bekkers¹\Emaile\.j\.bekkers@uva\.nl \addrAMLabMIT CSAIL²
###### 摘要
旋转位置编码(RoPE)使注意力得分具有位置相对性,但值通路仍对位置“盲”:无论值令牌与查询的距离如何,其所发送的信息均保持不变。我们提出RoVE,一种无参数修改方法,通过将值与键同步旋转来使值具有位置敏感性,并证明它能够将RoPE注意力转变为*注意力卷积*。这一新视角统一了计算机视觉、机器人技术以及现代大语言模型架构中对该操作的多种独立表述。在124M和354M参数的GPT-2模型上进行的训练表明,与RoPE相比,RoVE在少样本上下文学习、分布外困惑度以及长上下文检索方面均取得了一致的经验性改进,其中在需要长序列聚合的任务上改进最为显著。
###### 关键词:
旋转位置编码,注意力卷积,大语言模型
## 1引言
旋转位置编码(RoPE)(Su et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib35))使得注意力得分*移位等变*:通过将查询\(q_i\)和键\(k_j\)分别乘以依赖于位置的旋转矩阵\(R_i\)和\(R_j\),得到得分\(q_i^\top R_{j-i}k_j/\sqrt{d}\),该得分仅通过相对偏移量\(\delta=j-i\)依赖于位置。然而,值通路并未受到影响。在Transformer电路的语言中(附录E (https://arxiv.org/html/2606.11275#A5) 以及Elhage等人 (2021 (https://arxiv.org/html/2606.11275#bib.bib14))),RoPE使QK电路偏向于相对位置,同时使OV电路对位置保持“盲”:与卷积核不同,应用于\(x_j\)的信道映射\(W_V\)不包含关于\(x_j\)相对于查询位置的任何信息。
一种自然的补全方法是在聚合之前将位于位置\(j\)的值通过\(R_j\)旋转,然后通过\(R_i^{-1}\)将输出逆变换到位置\(i\)。正如我们所展示的,这将恒值映射\(W_V\)替换为依赖于偏移量的卷积核\(\psi_\delta=R_\delta W_V\),其中\(\delta=j-i\),从而使OV电路获得与QK电路相同的相对位置敏感性。
类似的“RoPE作用于值”的构造已在多个领域被独立发现。Miyato等人 (2024 (https://arxiv.org/html/2606.11275#bib.bib27)) 将其用于多视角新视角合成,对相机帧之间的几何关系进行编码;后续工作进一步将该机制扩展到计算机视觉 (Wu et al., 2026 (https://arxiv.org/html/2606.11275#bib.bib38); Li et al., 2026 (https://arxiv.org/html/2606.11275#bib.bib23)) 和机器人技术 (Klee et al., 2026 (https://arxiv.org/html/2606.11275#bib.bib21)) 中。在语言建模领域,DeepSeek-V4 (DeepSeek-AI, 2026 (https://arxiv.org/html/2606.11275#bib.bib12)) 从另一个角度得出了相同的操作:其压缩共享KV架构导致位置信息从键泄漏到值中,因此需要应用逆输出旋转作为纠正措施以维持相对位置。每项工作都基于特定应用的理由来论证该机制,但都没有对其在注意力算子中所起的作用提供结构性解释。
我们将这种作用于值流的位置编码机制独立提取出来,称为RoVE,并对该修改进行理论分析。随后,我们将其作为一个独立模块在标准(非共享KV)语言模型中进行评估——这是一个此前未被研究过的场景。我们的贡献如下:
- •**结构刻画**:我们证明RoVE能够将RoPE注意力转变为*注意力卷积*(Romero et al., 2020 (https://arxiv.org/html/2606.11275#bib.bib34); Fuchs et al., 2020 (https://arxiv.org/html/2606.11275#bib.bib17)):位置盲映射\(W_V\)被替换为依赖于偏移量的核\(\psi_\delta=R_\delta W_V\),并且矩阵混合算子(Hwang et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib20))获得了分块Toeplitz结构,而非Kronecker结构。
- •**实证验证**:我们训练了124M和354M参数的GPT-2语言模型,并在上下文学习(ICL)基准测试和长上下文任务上进行了评估。RoVE在ICL准确率、长上下文鲁棒性和检索性能方面持续优于标准RoPE注意力。
\floatconts
fig:mixer
图1:RoPE和RoVE的矩阵混合视角。RoPE分解为 (a) (a) 位置敏感的注意力权重和 (b) (b) 在全部偏移量上 (c) (c) 的*恒定*共享值投影\(W_V\)。(d) (d) RoVE将\(W_V\)替换为偏移量索引族\(\psi_\delta=R_\delta W_V\),(e) (e) 产生一个分块Toeplitz混合器,其对角线随相对偏移量系统性地旋转,这是注意力卷积的特征。\subfigure
[注意力权重]见标题\subfigure[RoPE核]见标题\subfigure[RoPE混合器]见标题\subfigure[RoVE核]见标题\subfigure[RoVE混合器]见标题
## 2背景
#### 矩阵混合器:
设\(X\in\mathbb{R}^{n\times d}\)为输入特征张量,其中\(n\)为序列长度,\(d\)为隐藏维度。我们用\(\operatorname{vec}(X)\in\mathbb{R}^{nd}\)表示\(X\)的向量化。任何形式为\(\operatorname{vec}(Y)=\mathcal{M}(X)\operatorname{vec}(X)\)的层,其中\(\mathcal{M}(X)\)是一个大小为\(nd\times nd\)的矩阵,被划分为\(d\times d\)的分块,都属于*矩阵混合器*族(Hwang et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib20))。
#### 注意力卷积:
经典的\(d\)维卷积通过一个固定的、依赖于偏移量的核\(\psi_\delta\in\mathbb{R}^{d\times d}\)来混合位置。*注意力卷积*(Romero et al., 2020 (https://arxiv.org/html/2606.11275#bib.bib34); Fuchs et al., 2020 (https://arxiv.org/html/2606.11275#bib.bib17)) 将固定权重替换为内容相关的标量\(A(X)_{ij}\in\mathbb{R}\),同时保留核:
\[
y_i = \sum_{j\in\mathcal{N}(i)} A(X)_{ij}\; \psi_{j-i}\; x_j,
\tag{1}
\]
其中\(A(X)_{ij}\)控制令牌\(j\)对位置\(i\)的贡献门控,\(\mathcal{N}(i)\)是\(i\)的邻域。对应的混合器是分块Toeplitz的:\(\mathcal{M}(X)\)中第\((i,j)\)个\(d\times d\)分块等于\(A(X)_{ij}\psi_{j-i}\),因此每条分块对角线承载相同的核,并由标量门控缩放。
#### 标准RoPE注意力:
设\(\mathcal{N}(i)\subseteq\{1,\dots,n\}\)表示查询\(i\)可见的位置集合。典型的选择包括因果掩码(\(\mathcal{N}(i)=\{j\leq i\}\))、完全注意力(\(\mathcal{N}(i)\equiv\{1,\dots,n\}\))和稀疏模式(Child et al., 2019 (https://arxiv.org/html/2606.11275#bib.bib8))。RoPE(Su et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib35)) 定义分块对角旋转矩阵\(R_t\in\mathrm{SO}(d)\),其中第\(m\)个\(2\times 2\)分块旋转角度\(t\omega_m\),频率\(\omega_m=\theta_0^{-2m/d}\)呈几何间隔,并计算
\[
y_i = \sum_{j\in\mathcal{N}(i)} A(X)_{ij}\, W_V x_j,\qquad
A(X)_{ij} = \operatorname{softmax}_{j\in\mathcal{N}(i)}\!\left(\tfrac{1}{\sqrt{d}}\, (W_Q x_i)^\top R_{j-i} (W_K x_j)\right).
\tag{2}
\]
混合器沿张量轴分解为\(\mathcal{M}^{\textsc{RoPE}}(X)=A(X)\otimes W_V\),将令牌路由与通道投影解耦(Elhage et al., 2021 (https://arxiv.org/html/2606.11275#bib.bib14))。
#### YaRN:
基于RoPE的模型通常在短上下文长度上训练,但部署在更长的长度上,这导致了一个分布外问题:低频分量会遇到训练期间未曾见过的旋转角度(Tian et al., 2026 (https://arxiv.org/html/2606.11275#bib.bib36))。均匀频率拉伸是一种自然的修复方法(Chen et al., 2023 (https://arxiv.org/html/2606.11275#bib.bib5)),但会破坏高频分量中的局部位置依赖性。YaRN(Peng et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib30)) 通过依赖于频率的插值解决了这个问题,即在保留高频的同时平滑地缩放较低频率。这种重新缩放可以事后应用,无需任何额外训练。更多相关工作见附录B (https://arxiv.org/html/2606.11275#A2)。
## 3方法
RoPE使得注意力得分具有位置相对性,但值通路保持不变:获得相同注意力权重的两个令牌,无论它们与查询的偏移量如何,对输出的贡献完全相同。RoVE通过将每个值在聚合之前额外旋转到查询的参考系中,从而扩展了这一机制。
###### 定义3.1 (RoVE)。
设\(\mathcal{N}(i)\subseteq\{1,\dots,n\}\)为任意邻域函数,\(A(X)_{ij}\)为来自(2 (https://arxiv.org/html/2606.11275#S2.E2))的RoPE注意力权重。RoVE计算
\[
\tilde{y}_i = R_i^{-1}\sum_{j\in\mathcal{N}(i)} A(X)_{ij}\, R_j\, W_V x_j
= \sum_{j\in\mathcal{N}(i)} A(X)_{ij}\; \underbrace{R_{j-i}W_V}_{\psi_{j-i}}\, x_j.
\tag{3}
\]
#### 卷积视角:
公式(3 (https://arxiv.org/html/2606.11275#S3.E3))是注意力卷积(1 (https://arxiv.org/html/2606.11275#S2.E1))的一个实例,其邻域为\(\mathcal{N}\),注意力权重为RoPE,位置相关核为\(\psi_\delta=R_\delta W_V\)(标准RoPE可通过退化选择\(\psi_\delta\equiv W_V\)恢复)。关键在于,值通路不再是一个单一的共享映射,而是受约束的族\(\{R_\delta W_V\}_\delta\),因此相对位置既调节令牌的*变换*(OV电路),也调节令牌的*选择*(QK电路)。
#### 矩阵混合器视角:
在混合器形式中,\(\mathcal{M}^{\mbox{{R\kern 0.1pto\kern-1.0ptVE}}}(X)\)的第\((i,j)\)个\(d\times d\)分块等于\(A(X)_{ij}R_{j-i}W_V\),替代了分解后的RoPE分块\(A(X)_{ij}W_V\)。因此,混合器继承了注意力卷积的*分块Toeplitz结构*(除了由\(A_{ij}\)引起的内容相关调制):位于相同相对偏移量对角线上的分块共享相同的旋转值核。图LABEL:fig:mixer直观展示了从恒定值核到偏移量索引值核族的转换。关于RoVE电路的进一步分析见附录E (https://arxiv.org/html/2606.11275#A5)。
#### 局部框架视角:
公式(3 (https://arxiv.org/html/2606.11275#S3.E3))具有清晰的框架变换解释:首先,每个值\(W_V x_j\)通过\(R_j\)从其局部框架变换到共享的全局框架;然后,在全局框架中聚合贡献;最后,通过\(R_i^{-1}\)将结果变换到查询的局部框架。有效核\(R_{j-i}W_V\)是由帧变换算子与学习的信道映射组合而成。这种帧变换视角是Miyato等人 (2024 (https://arxiv.org/html/2606.11275#bib.bib27)) 的主要动机,其中来自不同视角的特征在聚合之前被旋转到共同的参考框架。此外,在消息传递视角下,变换后的值\(R_j W_V x_j\)可以被视为*张量消息*(Lippmann et al., 2025 (https://arxiv.org/html/2606.11275#bib.bib25))。
#### 效率:
RoPE以类似于查询/键嵌入的方式嵌入值。这些操作具有线性复杂度\(\mathcal{O}(nd)\),因为旋转分别作用于\(n\)个独立令牌和\(\frac{d}{2}\)个通道对——因此其计算成本与\(\mathcal{O}(nd^2)\)的线性层和\(\mathcal{O}(n^2 d)\)的注意力层相比微不足道。与RoPE类似,RoVE与FlashAttention内核(Dao et al., 2022 (https://arxiv.org/html/2606.11275#bib.bib11))兼容,因为它在内核调用前后作用于值和注意力输出。此外,它不引入任何额外的可学习参数。
## 4实验
#### 实验设置:
我们将RoVE作为RoPE注意力中值通路的即插即用替代方案进行评估,在FineWebEdu-10B(Lozhkov et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib26))上训练小型(~124M)和中型(~354M)规模的GPT-2风格Transformer(Brown et al., 2020 (https://arxiv.org/html/2606.11275#bib.bib4)),上下文长度为1024个令牌。我们在以下方面进行评估:**DCLM-Core**,训练上下文内的少样本ICL准确率(Li et al., 2024a (https://arxiv.org/html/2606.11275#bib.bib22));**OOD困惑度**,在最长\(16\times\)上下文长度下,有无YaRN(Peng et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib30))的情况;以及**RULER**,4k/8k令牌长度下的长上下文检索,以NLL评分(Hsieh et al., 2024 (https://arxiv.org/html/2606.11275#bib.bib19))。完整细节及更多实验结果见附录A (https://arxiv.org/html/2606.11275#A1)。
表1:354M参数模型的核心ICL准确率与困惑度。Core在1024令牌训练上下文内测量;PPL从512到16384令牌测量。+YaRN表示推理时插值,Core保持不变。
#### RoVE在训练好的场景中有所改进:
表1 (https://arxiv.org/html/2606.11275#S4.T1) 和表3 (https://arxiv.org/html/2606.11275#A1.T3) 显示,RoVE在两种规模下均提高了Core ICL准确率和上下文内困惑度。因此,RoVE不仅在推长长度上提供了有用的归纳偏置,在训练分布内也是如此。
#### RoVE和YaRN是互补的:
RoVE显著降低了OOD困惑度,而YaRN改善了两个基线,同时基本保持它们之间的差距不变。因此,值流上的相对定位不会受到推理时频率插值的阻碍,即这两种方法解决了长上下文泛化的互补方面。
#### RoVE改进了长上下文检索:
表2 (https://arxiv.org/html/2606.11275#S4.T2) 和表4 (https://arxiv.org/html/2606.11275#A1.T4) 显示,困惑度的提升转化为合成长上下文检索任务上的改进,其中在需要长序列聚合的任务上改进最为显著。相似文章
RoPE在长上下文中既不能区分位置也不能区分标记,可证明
本文提供了理论证明,表明基于Transformer的语言模型中的旋转位置嵌入(RoPE)在长上下文中会失去其局部性偏差和区分标记顺序的能力,注意力分数变得不比随机更好。作者证明,增加RoPE基频会在位置区分和标记区分之间进行权衡,且多头、多层架构无法弥补这一基本限制。
高维动态旋转位置编码 [P]
介绍了 HDD-RoPE,这是旋转位置编码的一种扩展,它使用高维块和数据相关的旋转速率,在 TinyStories 数据集上显示出比 xPos 更快的收敛速度。
通过相对位置编码对距离进行编码以增强基于Transformer的路由
本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。
RIG-RoPE: Relation- and Instance-Gated Rotary Positional Encoding with Duration-Aware Temporal Coordinates
This preliminary technical report proposes RIG-RoPE, a relation- and instance-gated rotary positional encoding with duration-aware temporal coordinates, aiming to address spatial interference and improper temporal scaling in multimodal LLMs. It introduces a gating mechanism for height/width rotations and duration-aware temporal coordinates, but leaves large-scale empirical validation to future work.
Position Encoding in Transformers: From Absolute and Relative Methods to Rotary Position Embeddings and Long-Context Scaling
A technical survey on position encoding methods in Transformers, covering absolute and relative methods, RoPE, and long-context scaling techniques like Position Interpolation, NTK-aware scaling, YaRN, and LongRoPE.