旋转注意力中的相位结构:语义连续性与执行边界治理的频谱框架

arXiv cs.CL 论文

摘要

本文开发了一个频谱框架,用于分析Transformer语言模型中的旋转相位对齐、语义连续性和表示漂移,提出了一种有界频谱方法,并区分了内部连贯性与执行边界治理。

arXiv:2607.25507v1 公告类型:新 摘要:Transformer语言模型通常通过向量几何进行分析,但有序上下文和旋转位置编码在查询-键交互中引入了显式的相位结构。本文开发了一个有界频谱框架,用于检查旋转相位对齐、隐藏状态连续性和语义漂移,而不将语言模型视为字面物理波系统。它首先识别出有序的隐藏状态序列(而非词汇索引)作为频谱分解的有效域。然后,它将旋转位置编码(RoPE)注意力分数推导为幅度加权余弦项之和,并证明了一个局部稳定性引理:一致有界的相位位移限制了对应softmax前分数的退化。为了将相位分析扩展到原始RoPE坐标之外,本文在固定正交方向对上定义了复模态坐标,并引入了隐藏状态轨迹的加权相干函数。这些构造支持表示连续性与执行边界可接受性之间的严格区分。内部连贯性可以描述任务相关关系的保持,但不能授权一个后果性转移。与现有的几何、频谱、相位调制、表示分析和机械可解释性方法相比,该框架贡献了一个理论和方法论程序,用于确定频谱结构何时解释连续性,以及治理何时必须保持为执行的外部谓词。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:55

# 旋转注意力中的相位结构:语义连续性与执行边界治理的频谱框架
来源:https://arxiv.org/html/2607.25507
\(2026年7月\)

###### 摘要

Transformer语言模型通常通过向量几何进行分析,然而有序上下文和旋转位置编码在查询-键交互中引入了明确的相位结构。本文发展了一个有界的频谱框架,用于检查旋转相位对齐、隐藏状态连续性和语义漂移,而不将语言模型视为字面上的物理波动系统。它首先识别出有序的隐藏状态序列(而非词汇索引)作为频谱分解的有效域。然后,它将旋转位置嵌入(RoPE)注意力分数推导为幅度加权余弦项的和,并证明了一个局部稳定性引理:有界相位位移限制了对相应 softmax 前分数的衰减。为了将相位分析扩展到原生 RoPE 坐标之外,本文在固定的正交方向对上定义了复模态坐标,并为隐藏状态轨迹引入了一个加权相干泛函。这些构造支持对表征连续性与执行边界可接受性之间的严格区分。内部相干性可以描述任务相关关系的保持,但不能授权一个后果性的过渡。与现有的几何、频谱、相位调制、表征分析和 mechanistic interpretability 解释相对照,该框架提供了一个理论和方法论纲领,用于确定频谱结构何时解释了连续性,以及何时治理必须保持为对执行的外部谓词。

关键词:Transformer;旋转位置嵌入;RoPE;相位几何;频谱分析;语义连续性;表征漂移;AI 治理;执行边界

## 1 引言

现代语言模型通常通过几何来描述。Token 被嵌入为向量,经过连续层变换,通过内积进行比较,并转换为可能延续的概率分布。这种描述是正确的且不可或缺的。它识别了表征所在的空间以及用于转换这些表征的算子。

然而,几何并未穷尽可用的数学描述。Transformer 计算还包含有序轨迹、周期性位置算子、相位敏感相关性以及其对齐随上下文变化的分布式模态。旋转位置嵌入使这一点尤为明确:位置是通过协调旋转实现的,而相对位移直接出现在查询-键交互中。\[2 (https://arxiv.org/html/2607.25507#bib.bib2)\] 一旦认识到这种结构,Transformer 推理的某些部分就允许进行频谱处理,其中上下文兼容性可以通过相位对齐来检查,而语义连续性可以通过保持任务相关的模态关系来检查。

### 1.1 相关工作与贡献边界

该框架位于 Transformer 注意力、旋转位置编码、表征分析和 mechanistic interpretability 的交汇处。Transformer 文献将注意力定义为基于内容的查询-键兼容性,随后进行归一化分配。\[1 (https://arxiv.org/html/2607.25507#bib.bib1)\] RoPE 通过查询和键的分块旋转,使相对位置在代数上可用。\[2 (https://arxiv.org/html/2607.25507#bib.bib2)\] 中心核对齐及相关的表征分析方法比较学习到的空间,同时警告不要将任意坐标视为内在有意义的。\[4 (https://arxiv.org/html/2607.25507#bib.bib4)\] Mechanistic interpretability 致力于为注意力头实现的计算(包括归纳头行为)提供因果或电路层面的解释。\[5 (https://arxiv.org/html/2607.25507#bib.bib5)\]

三个更接近的工作线确立了必要的创新边界。Barbero 等人分析了训练好的模型如何使用 RoPE 频率,将高频分量与稳健的位置模式关联起来,发现优先使用低频,并假设这些频率携带语义信息。\[6 (https://arxiv.org/html/2607.25507#bib.bib6)\] Gu 等人通过对注意力逻辑产生的 Toeplitz 结构进行频谱分析,发展了内容-位置耦合的频谱分析,并研究了由此产生的收缩性质。\[7 (https://arxiv.org/html/2607.25507#bib.bib7)\] Liu 直接将 RoPE 表述为复振荡器组上的相位调制,并推导出涉及上下文长度、基频、深度和数值精度的界限。\[8 (https://arxiv.org/html/2607.25507#bib.bib8)\]

因此,本文并不声称是 RoPE 的首个相位解释、位置编码的首个频谱分析、新的编码方案或经验发现的电路。其独特的贡献是将这四个未在这些叙述中结合的要素联系起来:将旋转注意力精确分解为幅度加权的相位项;在有界相位位移下对 softmax 前分数损失的局部界限;用于跨生成状态轨迹的相位敏感连续性的有基构造;以及表征连续性与执行边界可接受性之间的形式化分离。最后一个区别是范畴性的:相位结构可以诊断轨迹内的保持,但不能赋予轨迹后果以权威性。

本文发展了这种处理,但不声称语言模型是物理波动系统。术语“频谱”、“相位”、“模态”和“相干性”指的是有序计算状态的数学表示。它们并不意味着传播能量、量子行为或物理空间中的字面振荡。

> 旋转注意力包含一个明确的相位几何,并且该几何为分析上下文强化、长距离漂移以及语义连贯性与机构可接受性之间的分离提供了有原则的基础。

## 2 频谱结构属于有序上下文

词汇索引是一个任意标识符。它没有内在的邻域、距离或频率。因此,频谱分析不应跨越 token ID 进行。合适的域是模型处理的有序序列。

令一个 Transformer 层 \(l\) 对长度为 \(L\) 的上下文产生隐藏表示:

\[h_0^{(l)}, h_1^{(l)}, \ldots, h_{L-1}^{(l)} \in \mathbb{R}^d \qquad (1)\]

将它们收集为:

\[H^{(l)} = \begin{pmatrix} (h_0^{(l)})^\top \\ (h_1^{(l)})^\top \\ \vdots \\ (h_{L-1}^{(l)})^\top \end{pmatrix} \in \mathbb{R}^{L \times d}. \qquad (2)\]

行的顺序是有意义的,因为它遵循活动上下文中的 token 位置。对于任何表征方向 \(u \in \mathbb{R}^d\),定义标量序列:

\[y_m^{(l,u)} = \left\langle h_m^{(l)}, u \right\rangle, \quad m = 0, \ldots, L-1. \qquad (3)\]

这个有序序列允许离散傅里叶表示:

\[\begin{aligned}
\widehat{y}_k^{(l,u)} &= \sum_{m=0}^{L-1} y_m^{(l,u)} e^{-2\pi i k m / L}, \\
y_m^{(l,u)} &= \frac{1}{L} \sum_{k=0}^{L-1} \widehat{y}_k^{(l,u)} e^{2\pi i k m / L}.
\end{aligned} \qquad (4)\]

系数 \(\widehat{y}_k^{(l,u)}\) 描述了选定的表征方向在不同位置频率上的变化强弱。同样可以直接定义向量值变换:

\[\begin{aligned}
\widehat{h}_k^{(l)} &= \sum_{m=0}^{L-1} h_m^{(l)} e^{-2\pi i k m / L}, \\
h_m^{(l)} &= \frac{1}{L} \sum_{k=0}^{L-1} \widehat{h}_k^{(l)} e^{2\pi i k m / L}.
\end{aligned} \qquad (5)\]

这种分解并不声称模型显式计算傅里叶变换。它表明有序的隐藏状态场可以通过正交位置模态进行分析。几何描述每个位置的表征;频谱分析描述表征如何跨位置变化。这种一般性的频谱分析属于通过尺度或频率局部化分量表示信号的更广泛数学传统。\[3 (https://arxiv.org/html/2607.25507#bib.bib3)\]

缓慢变化的模态可能捕获跨越整个序列的广泛上下文结构。较高频率的模态可能捕获局部交替、突变、重复或短距离位置变化。这些解释是假设而非自动的语义事实,需要经验验证。

因此,频谱对象不是作为孤立词汇项的 token。它是跨上下文生成的有序表征轨迹。

## 3 旋转位置嵌入作为相位几何

最初的 Transformer 架构用基于注意力的序列处理取代了循环和卷积。\[1 (https://arxiv.org/html/2607.25507#bib.bib1)\] 旋转位置嵌入随后通过编码位置(在成对坐标平面中进行旋转)引入了一种架构特定的相位结构。\[2 (https://arxiv.org/html/2607.25507#bib.bib2)\]

对于偶数维的查询或键向量,RoPE 将坐标分组为二维对。在位置 \(m\),每对旋转一个与 \(m\) 成比例的角度。对于频率参数 \(\theta_j\),定义:

\[R_{\theta_j, m} = \begin{pmatrix} \cos(m\theta_j) & -\sin(m\theta_j) \\ \sin(m\theta_j) & \cos(m\theta_j) \end{pmatrix}. \qquad (6)\]

完整的旋转算子是分块对角的:

\[R_{\Theta, m}^d = \operatorname{diag}\!\left( R_{\theta_1, m}, R_{\theta_2, m}, \ldots, R_{\theta_{d/2}, m} \right). \qquad (7)\]

令 \(q_j, k_j \in \mathbb{R}^2\) 表示查询和键的第 \(j\) 个坐标对。它们的位置编码形式是 \(R_{\theta_j, m} q_j\) 和 \(R_{\theta_j, n} k_j\)。由于旋转矩阵是正交的:

\[R_{\theta_j, m}^\top R_{\theta_j, n} = R_{\theta_j, n-m}. \qquad (8)\]

因此:

\[\left\langle R_{\theta_j, m} q_j, R_{\theta_j, n} k_j \right\rangle = \left\langle q_j, R_{\theta_j, n-m} k_j \right\rangle. \qquad (9)\]

相对位移直接出现在交互内部。

同样的结果在复数表示下尤为透明。将每个二维对关联一个复数标量:

\[q_j = q_{j,1} + i q_{j,2}, \quad k_j = k_{j,1} + i k_{j,2}. \qquad (10)\]

旋转变为乘以单位复数相位:

\[q_j^{(m)} = q_j e^{i m \theta_j}, \quad k_j^{(n)} = k_j e^{i n \theta_j}. \qquad (11)\]

旋转对的实内积为:

\[\left\langle R_{\theta_j, m} q_j, R_{\theta_j, n} k_j \right\rangle = \operatorname{Re}\!\left( q_j \overline{k_j} e^{i (m-n) \theta_j} \right). \qquad (12)\]

写成 \(q_j = |q_j| e^{i \alpha_j}\) 和 \(k_j = |k_j| e^{i \beta_j}\) 得到:

\[\left\langle R_{\theta_j, m} q_j, R_{\theta_j, n} k_j \right\rangle = |q_j| |k_j| \cos\!\left( \alpha_j - \beta_j + (m-n) \theta_j \right). \qquad (13)\]

对所有旋转对求和得到缩放前的完整查询-键分数:

\[\left\langle R_{\Theta, m}^d q, R_{\Theta, n}^d k \right\rangle = \sum_{j=1}^{d/2} |q_j| |k_j| \cos\!\left( \alpha_j - \beta_j + (m-n) \theta_j \right). \qquad (14)\]

这不是比喻性的相位语言。相位在数学上由每个二维 RoPE 对的角度坐标定义。每个对根据查询相位、键相位和相对位置相位贡献。因此,RoPE 将相对位置转换为跨多个角度尺度的分布式相位位移。

模型不仅仅是给表征附加一个位置标签。它改变了查询和键交互所依据的相位关系。

## 4 模态增强与衰减

在头 \(h\) 中,位置 \(m\) 和 \(n\) 之间的缩放注意力分数为:

\[S_{mn}^{(h)} = \frac{\left\langle R_{\Theta, m}^{d_k} q_m^{(h)}, R_{\Theta, n}^{d_k} k_n^{(h)} \right\rangle}{\sqrt{d_k}}. \qquad (15)\]

使用复对表示:

\[S_{mn}^{(h)} = \frac{1}{\sqrt{d_k}} \sum_{j=1}^{d_k/2} \rho_{mnj}^{(h)} \cos \delta_{mnj}^{(h)}, \qquad (16)\]

其中 \(\rho_{mnj}^{(h)} = \left\| q_{m,j}^{(h)} \right\| \left\| k_{n,j}^{(h)} \right\|\),\(\delta_{mnj}^{(h)} = \alpha_{m,j}^{(h)} - \beta_{n,j}^{(h)} + (m-n) \theta_j.\)

每个旋转对贡献一个幅度加权的余弦项。当 \(\delta_{mnj}^{(h)}\) 位于 \(2\pi\) 模零附近时,该对贡献正值且接近其最大幅度。当位移接近 \(\pi/2\) 时,贡献变小。接近 \(\pi\) 时,该对贡献负值。

得到的分数是通过跨多个携带相位的坐标对的代数增强和衰减来组装的。这并不意味着 Transformer 包含物理波。这意味着其位置注意力分数是相位敏感的模态贡献之和。

对于因果自注意力,掩码必须显式表示:

\[M_{mn} = \begin{cases} 0, & n \leq m, \\ -\infty, & n > m. \end{cases} \qquad (17)\]

Softmax 然后将掩码分数转换为竞争性权重:

\[A_{mn}^{(h)} = \frac{\exp\!\left( S_{mn}^{(h)} + M_{mn} \right)}{\displaystyle \sum_{\ell=0}^{L-1} \exp\!\left( S_{m\ell}^{(h)} + M_{m\ell} \right)}. \qquad (18)\]

该过程有两个不同的阶段:相位结构化的兼容性,随后是竞争性分配。相位对齐影响分数,而掩码 softmax 确定该分数在允许的替代键的竞争中如何存活。

因此,注意力并不是经典线性时不变意义上的频谱滤波器。其权重取决于内容、层、头和当前上下文。更精确的描述是,RoPE 注意力是一个自适应相关系统,其位置分量是显式相位结构化的。

## 5 RoPE 分数稳定性引理

相位公式直接为旋转查询-键兼容性产生了一个稳定性结果。令

\[S = \sum_{j=1}^{J} \rho_j \cos \delta_j, \quad \rho_j \geq 0,\]

相似文章

Kuramoto注意力:在环面上同步自注意力

arXiv cs.LG

介绍了Kuramoto注意力,一种自注意力层,其中隐藏状态是环面上的相位角,通过门控余弦相似度和循环均值更新实现同步。该层在字符级语言建模上的性能与标准Transformer相当。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。