Bifocal Attention: 协调几何与频谱位置嵌入以实现算法泛化

arXiv cs.CL 论文

摘要

本文介绍了Bifocal Attention,它将位置编码解耦为几何(标准RoPE)和频谱(Learnable Harmonic Operators)两种模态,以解决固定RoPE的'Spectral Rigidity'问题,从而改善超出训练窗口的算法泛化能力。

arXiv:2601.22402v2 Announce Type: replace Abstract: 旋转位置编码(RoPE)已成为大型语言模型(LLMs)的标准,因为它们能够通过几何旋转编码相对位置。然而,我们发现了一个我们称之为“Spectral Rigidity”的显著局限性:标准RoPE使用固定的几何衰减($\theta^{-i}$),该衰减针对局部句法连贯性进行了优化,但无法捕捉递归逻辑和算法推理中固有的长程周期结构。这导致了“Structure Gap”问题,即在浅层推理链上训练的模型无法外推到更深层的递归步骤。在这项工作中,我们引入了Bifocal Attention,这是一种将位置编码解耦为两个不同模态的架构范式:Geometric Eyes(标准RoPE)用于精确的token级操作,以及Spectral Eyes(Learnable Harmonic Operators)用于跟踪长程递归深度。我们提出了一种新的训练协议Spectral Evolution,该协议将位置频率初始化为静态几何参数,但允许它们通过梯度下降演化为针对任务特定算法拓扑优化的谐波基。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:38

# 双焦注意力:调和几何与频谱位置嵌入以实现算法泛化
原文链接:https://arxiv.org/html/2601.22402

###### 摘要

旋转位置嵌入(RoPE)因其通过几何旋转编码相对位置的能力,已成为大型语言模型(LLM)的标准。然而,我们识别出一个显著的限制,称为“频谱刚性”:标准RoPE使用固定的几何衰减(θ−iθ^{-i}),优化于局部句法连贯性,但未能捕捉递归逻辑和算法推理中固有的长距离周期结构。这导致了一个“结构鸿沟”,即仅在浅层推理链上训练的模型无法外推到更深的递归步骤。在这项工作中,我们引入了双焦注意力,一种将位置编码解耦为两种不同模态的架构范式:用于精确词元级操作的“几何视觉”(标准RoPE),以及用于跟踪长距离递归深度的“频谱视觉”(可学习谐波算子)。我们提出了一种新颖的训练协议——频谱演化,该协议将位置频率初始化为静态几何参数,但允许它们通过梯度下降演化为针对特定算法拓扑优化后的谐波基。

## 1 引言

现代Transformer的性能很大程度上依赖于其对序列顺序的表示。虽然像RoPE这样的相对方案(Su et al., 2021 (https://arxiv.org/html/2601.22402v1#bib.bib2))允许理论上无限的上下文,但在需要模型进行超出训练窗口的算法推理时,实际性能会迅速下降。

### 1.1 静态几何的极限

标准RoPE使用固定的基频率(通常θ=10000θ=10000或500000500000),创建了一个刚性的“几何级数”波长。这种设计在自然语言建模中表现出色,因为依赖关系具有局部衰减性(即,词语与其紧邻邻居关联性强)。然而,对于诸如代码块或算术循环之类的逻辑结构,这种设计是次优的。这些结构具有独特的、通常非几何的周期性,固定嵌入无法高效表示。

### 1.2 “结构鸿沟”假设

我们区分两种类型的序列信息:

- •内容(身份):由嵌入层处理,识别词元类型(例如,{ vs })。
- •结构(关系):由注意力机制处理,识别词元在层次结构中的位置(例如,“这个}闭合了50行前的那个{”)。

当前架构遭受“静态陷阱”之苦。以往尝试将递归偏置注入静态嵌入层。然而,随着向量在Transformer层中传播,标准的注意力机制——数学上是一种平滑操作——可能会冲刷掉这些高频分形细节,将精确逻辑视为噪声。为解决此问题,频谱组件必须从输入移动到交互。我们必须动态旋转查询和键向量,迫使模型在推理阶段(注意力)而非仅仅阅读阶段就尊重递归结构。

参见图注图1:波长失配问题。(A) 标准RoPE使用固定的几何基。在远距离(例如N=60N=60)下,固定频率通常与目标词元对齐不佳,产生“结构鸿沟”。(B) 频谱RoPE允许频率θθ演化。模型发现一个共振频率使得cos⁡(θ⋅N)≈1cos(θ⋅N)≈1,从而创建连接递归结构起点和终点的“谐波桥”(蓝点)。

## 2 背景与预备知识

### 2.1 旋转位置嵌入 (RoPE)

RoPE通过在复平面上旋转嵌入向量xx来编码词元的位置mm。对于维度dd,旋转由一组频率Θ={θi}i=1d/2Θ={θi}i=1d/2定义,其中通常θi=10000−2i/dθi=10000−2i/d。旋转由fRoPE(x,m)=x⋅eimΘfRoPE(x,m)=x⋅eimΘ给出。两个位于位置mm和nn的向量点积仅依赖相对距离m−nm−n:

⟨f(q,m),f(k,n)⟩=Re(∑jqjkj∗ei(m−n)θj)⟨f(q,m),f(k,n)⟩=Re(∑jqjkj∗ei(m−n)θj) (1)

这种几何衰减特性确保了邻近词元具有高注意力分数。然而,旋转角度是固定的超参数。模型被迫将数据拟合到这些角度,而不是根据数据调整数学表达。

### 2.2 “波长失配”问题

在递归算法中,相关信息通常以特定间隔重复出现。例如,将右括号}与其对应的左括号{匹配需要恰好回看NN步。标准RoPE使用固定的几何基来近似这个距离。如果距离NN很大,由于高频振荡,旋转角度会变得实际上随机,与噪声难以区分。为了跨越NN个词元的鸿沟,模型需要一个特定频率ωω使得cos⁡(ω⋅N)≈1cos(ω⋅N)≈1。这种必要性在相关词元之间创建了一个“谐波桥”。我们的实验揭示,标准模型最初难以形成这个桥,而可学习的频谱基则能提取出信号。

## 3 方法论

我们引入了频谱RoPE引擎,它作为标准旋转位置嵌入的直接替换,将频率基参数化,将静态几何规则转变为可学习的频谱算子。

### 3.1 可学习的频谱基

标准RoPE将频率实现为一个固定缓冲区。我们将其替换为一组可学习参数Ω∈Rd/2Ω∈Rd/2。我们的频谱旋转依赖于三个可学习组件:频率 (ΩΩ)、振幅 (AA) 和相位 (ΦΦ):

fSpectral(x,m)=A⊙(x⋅ei(mΩ+Φ))fSpectral(x,m)=A⊙(x⋅ei(mΩ+Φ)) (2)
- •ΩΩ (可学习频率):初始化为标准几何衰减θ−2i/dθ−2i/d,以确保初始化时与基线在数学上一致(安全性条件)。训练期间,梯度调整ΩΩ以发现任务最优波长。
- •AA (振幅调制):一个可学习的尺度参数,初始化为1。它允许模型放大携带高保真递归信号的特定频带,同时抑制仅贡献噪声的频带。
- •ΦΦ (相位偏移):一个可学习的偏移量,用εε噪声(N(0,10−3)N(0,10−3))初始化。该术语允许对齐校正而无需移动注意力头本身,并能够实现非单调的注意力模式。

参见图注(a)标准
参见图注(b)自适应频率
参见图注(c)振幅增益
参见图注(d)相位偏移

图2:频谱RoPE引擎架构。(a) 标准RoPE应用固定旋转。(b) 频谱RoPE调整频率(节拍)。(c) 振幅调制放大信号抑制噪声。(d) 相位偏移允许精确对齐。
### 3.2 实现:外科手术式集成

一个核心贡献是“外科手术式集成”协议。与标准微调更新预先存在的权重(WQ,WK,WVWQ,WK,WV)不同,我们的方法修改了计算图。

1. 1.黄金标准提取:我们从预训练模型(例如 Llama-2-7b)中提取精确的逆频率张量。
2. 2.模块替换:我们定位注意力模块,并将静态的 RotaryEmbedding 类替换为我们初始化的 SpectralRoPE 模块。
3. 3.前向补丁:我们修补前向方法,将位置标识符路由通过我们的可学习引擎。

这迫使注意力机制与逻辑频率“共振”。

### 3.3 理论优势:相空间中的正交性

主要动机是解决深度递归中的“流形塌缩”。在标准RoPE中,第10层与第11层之间的位置差异是细微的。使用频谱RoPE,模型学习到一个作为独特“深度计数器”的频率ωdepthωdepth。通过优化ΦΦ,模型确保第10层处的向量旋转驻留在一个与第11层不同的相位子空间中(⟨vd=10,vd=11⟩Spectral≈0⟨vd=10,vd=11⟩Spectral≈0)。

参见图注图3:注意力头的拓扑几何。(A) 标准RoPE表示遭受流形塌缩;递归深度聚集成一般性团块。(B) 频谱RoPE将表示展开成一个谐波螺旋。注意力机制将递归深度映射到连续的1D流形,实现了深度的精确区分。

## 4 实验:在形式语言上的评估

为了将“结构鸿沟”与语义记忆隔离,我们在三个形式语言任务套件上进行评估,这些任务通过要求关注长距离、刚性结构依赖关系来挑战标准注意力机制。

### 4.1 实验设置

- •标准 Llama(基线):基于 Llama-2 的配置(128隐藏维度,4个头),使用固定几何RoPE。
- •频谱 Llama(我们的):相同的主干,配备频谱RoPE引擎。参数初始化为标准基线以确保t=0t=0时的一致性,然后允许其演化。

两个模型都在探测乔姆斯基层级(Chomsky, 1956 (https://arxiv.org/html/2601.22402v1#bib.bib5))的任务上训练了400步。

### 4.2 任务

1. 1.Dyck-3(栈测试):生成具有多种括号类型的深度嵌套序列(例如 [ { ( . . . ) } ])。这测试了为不同作用域类型维护独立相位状态的能力。
2. 2.生物旋转(距离测试):识别被100-200个字符的噪声分隔开的基序,然后生成其反向互补序列。这迫使模型桥接非几何距离。
3. 3.模算术(循环测试):计算类似(a+b+c)(mod7)(a+b+c)(mod7)的表达式。标准LLM在循环数轴上存在困难;频谱RoPE理论上应能调节频率以匹配模数。

### 4.3 结果

表1 (https://arxiv.org/html/2601.22402v1#S4.T1) 总结了最终的困惑度。频谱RoPE架构有效解决了标准基线失败的任务。

表1:注意力机制的比较分析(收敛后的损失)
### 4.4 收敛分析

结果揭示了学习能力的根本差异。在生物旋转任务中,标准 Llama 尽管经过训练仍停滞不前,实际上是在盲目猜测。相比之下,频谱 Llama 收敛到接近零的损失。这意味着模型成功“演化”出一个特定频率ωω,创建了一个绕过中间噪声的“谐波桥”。

参见图注图4:损失景观比较(生物旋转任务)。标准RoPE(灰色)很早便达到“熵地板”(损失≈1.07Loss≈1.07)。频谱RoPE(蓝色)在第150步出现“锁定”事件,此时演化的频率与序列长度共振,将损失驱至零。

## 5 讨论

实证结果证实频谱RoPE能够解决对标准RoPE具有挑战性的合成拓扑任务。

### 5.1 非单调逻辑相位

在标准RoPE中,词元之间的相位关系是严格线性的(θ⋅(m−n)θ⋅(m−n))。这迫使注意力机制是单调的。检查我们的频谱模型中学习到的参数揭示了一个偏差:学习到的相位偏移(ΦΦ)演化成一个独特的振荡“锯齿”模式(平均偏移≈7.6×10−4≈7.6×10−4 弧度)。这表明模型自发地学会了打破平移对称性。通过交替相位偏移,模型在其注意力几何中创建了一个“拨动开关”,可能适应了层次结构(例如,缩进/回退逻辑)。

### 5.2 真实世界代码中的微适应

我们在 PyTorch 源代码数据集上进行了微调。使用我们的Δ0.0000Δ0.0000协议初始化,频谱模型在早期匹配了标准模型的性能,验证了频谱RoPE是一种安全替换。尽管宏观损失轨迹保持竞争力,但内部机制出现了分歧。在真实世界训练运行中出现的“锯齿”相位模式证明了该机制并非合成数据的产物。

### 5.3 共振频率适应

生物旋转任务上损失减少99.9%支持了“波长失配”假设。标准RoPE使用通用的几何衰减。频谱RoPE执行自适应频率调谐,有效求解ωω使得cos⁡(ω⋅N)≈1cos(ω⋅N)≈1。这将注意力机制转变为一个可调谐接收器,锁定信号频率,同时滤除中间序列的“白噪声”。

参见图注图5:共振频率效应。(A) 标准RoPE如同固定在静态信道上的收音机,常与数据周期性冲突。(B) 频谱RoPE如同可调接收器。ΩΩ演化以与数据固有的周期性共振,允许跨越远距离的强注意力。Transformer架构与位置嵌入。自从Transformer引入以来(Vaswani et al., 2017 (https://arxiv.org/html/2601.22402v1#bib.bib1)),扩展上下文一直是核心挑战。早期模型如BERT(Devlin et al., 2018 (https://arxiv.org/html/2601.22402v1#bib.bib6))和GPT-3(Brown et al., 2020 (https://arxiv.org/html/2601.22402v1#bib.bib7))使用绝对位置嵌入,其泛化能力较弱,对于比训练时更长的序列表现不佳。相对位置方法提供了改进;T5(Raffel et al., 2020 (https://arxiv.org/html/2601.22402v1#bib.bib9))引入了可学习的相对偏置,而Transformer-XL(Dai et al., 2019 (https://arxiv.org/html/2601.22402v1#bib.bib15))使用了循环。ALiBi(Press et al., 2021 (https://arxiv.org/html/2601.22402v1#bib.bib8))通过使用线性衰减偏置注意力展示了显著的外推能力。然而,RoPE(Su et al., 2021 (https://arxiv.org/html/2601.22402v1#bib.bib2))因其表达能力和效率的平衡,已成为现代大型语言模型如 Llama 2(Touvron et al., 2023 (https://arxiv.org/html/2601.22402v1#bib.bib3))和 PaLM(Chowdhery et al., 2022 (https://arxiv.org/html/2601.22402v1#bib.bib13))的标准。

算法推理与长上下文。尽管有这些进展,LLM仍然在复杂的算法任务上挣扎(Graves et al., 2014 (https://arxiv.org/html/2601.22402v1#bib.bib14)),这些任务需要精确跟踪深层输入。诸如思维链(Wei et al., 2022 (https://arxiv.org/html/2601.22402v1#bib.bib10))和思维树(Yao et al., 2023 (https://arxiv.org/html/2601.22402v1#bib.bib11))等技术尝试通过提示策略来缓解,但并未解决底层架构限制。高效的注意力机制如Longformer(Beltagy et al., 2020 (https://arxiv.org/html/2601.22402v1#bib.bib12))和FlashAttention(Dao et al., 2022 (https://arxiv.org/html/2601.22402v1#bib.bib4))解决了计算瓶颈,但并未根本改变模型的几何先验。我们的工作聚焦于这个架构缺陷,特别关注固定位置嵌入的频谱刚性。

## 6 结论:迈向逻辑原生

相似文章

功能注意力:从成对亲和性到功能对应关系

Hugging Face Daily Papers

功能注意力是一种新颖的注意力机制,它将注意力重新解释为自适应基之间的功能对应关系,用受几何功能映射启发的结构化线性算子取代了softmax亲和性。该方法在包括PDE求解和3D分割在内的算子学习任务上实现了最先进的性能,同时保持了分辨率不变性。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。