深度交错斐波那契间距的稀疏注意力:静态调度超越学习型膨胀,并在密集注意力失败处实现外推
摘要
本文研究了具有斐波那契间距偏移和逐层缩放因子的稀疏自注意力,发现静态逐层调度优于学习型或固定型调度,且稀疏变体在训练长度4倍时仍能稳健外推,而密集注意力则崩溃。
arXiv:2606.28560v1 公告类型:新
摘要:我们研究了稀疏自注意力机制,其中每个查询关注一个密集的局部窗口加上一组斐波那契间距的偏移,并有一个逐层标量 alpha 来压缩或扩展间距。在根据同一配方训练的 21 个语言模型(6000 万参数,512 隐藏维度,16 层,4.26 亿 token)上,我们比较了四种在不同深度设置 alpha 的方式:固定、逐层学习型、静态线性交错以及该互质的(抗网格化)重新分配,再加上一个范围匹配的 2 的幂次控制。三个结果突出显示。首先,静态逐层交错在困惑度上优于固定和学习的 alpha,且提升与基数无关:将相同的交错应用于 2 的幂次基数,使其高于固定斐波那契,并与学习型斐波那契注意力持平。其次,逐层学习是无效的:它无法超越静态调度,且推理延迟大约高出五倍。第三,也是最关键的点,所有稀疏变体都能外推到训练长度的四倍,且几乎没有退化,而配方匹配的密集基线则崩溃(在 4 倍长度时困惑度上升 201%);我们将其归因于固定偏移注意力仅查询训练中见过的相对位置。我们还报告了两个诚实的负面结果:在训练长度下,最佳稀疏模型的困惑度比密集基线高约 26%,且交错提升在各上下文位置上均匀,而非集中在长距离上。
查看缓存全文
缓存时间: 2026/06/30 05:27
# 静态调度胜于学习到的稀疏模式,并在密集注意力失败处成功外推代码、论文源码和实验数据库见 https://github.com/ccapps42/scaled-fibonacci-attention。
来源:https://arxiv.org/html/2606.28560
###### 摘要
我们研究稀疏自注意力,其中每个查询关注一个密集的局部窗口加上一组斐波那契间隔的偏移量,并带有一个逐层标量 α 来压缩或扩展间隔。在 21 个语言模型(60M 参数、512 隐藏维度、16 层、426M 词元)上,我们比较了四种设置 α 跨深度的方法:固定、每层学习、静态线性交错、以及该交错的一个互质(抗网格化)重新分配,同时还有一个可达匹配的 2 的幂次控制。三个结果突出。首先,静态逐层交错在困惑度上优于固定和学习到的 α,并且这种增益与基数无关:将相同的交错应用于 2 的幂次基数使其超过固定斐波那契,并与学习到的斐波那契注意力持平。其次,学习每层 α 是无效的:它没有超过静态调度,并且推理延迟大约高出五倍。第三,也是最重要的,所有稀疏变体在外推到训练长度四倍时几乎没有或没有退化,而一个匹配配方的密集基线则崩溃了(在 4 倍长度时困惑度上升 201%);我们将此归因于固定偏移注意力仅查询训练期间见过的相对位置。我们还报告了两个诚实的负面结果:在训练长度上,最佳稀疏模型的困惑度比密集基线高出约 26%,并且交错增益在上下文位置上均匀分布,而不是集中在长距离上。
## 1 引言
稀疏注意力通过限制每个查询只关注一个键子集来降低自注意力的二次成本。一个反复出现的设计问题是*选择哪个*子集,特别是所选偏移量如何随深度变化。许多方案固定一种模式,并依靠堆叠层的组合来扩大感受野;其他方案在不同头之间改变模式。相对而言,关于在可控语言建模设置中*逐层*变化一个单一间距参数的情况知之甚少。
我们将偏移量定为斐波那契序列(短距离密集,长距离呈几何稀疏),并附加一个逐层标量 α,它按比例缩放每个偏移量,d_k = α f_k。最初的动机是一个“弹簧”:让每一层*学习*它自己的 α,以便在训练过程中出现适合深度的间距。这个假设没有得到我们数据的支持。学习到的标量几乎不偏离其初始化,并且与固定调度相比没有优势。真正有帮助的是*静态地*但每层不同地设置 α,这是一个我们强加而非学习到的跨深度固定交错。本文报告了完整的弧线,包括关于学习的负面结果,因为获胜的静态调度比我们本打算研究的机制更简单。
我们的贡献是:
- • 对四种逐层 α 调度(固定、学习、静态线性交错、互质交错)和一个可达匹配的 2 的幂次控制进行了受控比较,所有方法共享一个注意力实现和一个训练配方,涵盖 21 个训练模型和一个窗口扫描 W ∈ {6,8,10,12}(第 4 节)。
- • 证据表明静态逐层交错是主导杠杆:它优于固定和学习到的 α,并且是*基数无关的*:对 2 的幂次基数应用交错使其超过固定斐波那契,并与学习到的斐波那契注意力持平。然后斐波那契基数在其上增加了可分离的增益(第 4.2 节)。
- • 一个长度外推结果:结构化稀疏注意力在训练长度四倍时鲁棒,而匹配配方的密集基线崩溃,其机制(无分布外相对位置)也解释了稀疏变体之间的排序(第 4.5 节)。
- • 两个诚实的负面结果对声明进行了限定:训练长度上的质量差距与密集版本,以及一个位置分辨分析显示交错增益是均匀的而不是长距离特定的(第 4.6 节)。
## 2 方法
#### 关注集。
对于位置 i 的一个查询,关注的键集是密集局部窗口和一组缩放后的斐波那契偏移量的并集。窗口覆盖距离 {0,1,...,W}(包含自身位置,因此没有查询有空的键集)。稀疏偏移量使用基本序列
fib = [1,2,3,5,8,13,21,34,55,89,144,233,377,610,987],K=15,
每个梯级按比例缩放到目标距离 d_k = α f_k,并在键/值行 i - d_k 处收集。由于 d_k 是连续的,我们通过 floor 和 floor+1 位置之间的线性插值进行收集,这即使在每个梯级与整数位置重合时也保持对 α 的非零梯度。旋转位置嵌入在收集前应用于真实位置。偏移量在所有查询之间共享,因此这组是移位收集而不是每个位置的索引列表。
#### 逐层标量。
我们写作 α = 0.5 + sigmoid(θ) ∈ [0.5, 1.5],其中 θ 是唯一增加的参数。基本序列在 α=1 时已经覆盖上下文(f_15 = 987 ≈ 1024),因此有用的动态范围是压缩(α<1)加上略高于 1 的余量。我们研究了跨 L=16 层设置 θ 的四种方法:
- • 固定:所有层 α_l = 1。
- • 学习:θ_l 是每层自由参数,初始化为 α=1。
- • 交错(线性):α_l = 0.5 + l/(L-1),一个从层 0 的 0.5 到层 L-1 的 1.5 的固定斜坡。
- • 交错(互质/HDC):相同的 α 值多重集,通过互质步长 l ↦ (S*l mod L) 其中 S=7 重新分配到各层,因此相邻层获得最大程度不同的间距。这将对空洞卷积中的抗网格化思想(Wang 等人,2018)移植到逐层注意力间距中。
#### 控制基数。
作为控制,我们将斐波那契基数替换为可达匹配的 2 的幂次基数(对数稀疏)。它以更少的梯级达到相同的最大距离,从而在相等可达范围而不是梯级数量上隔离了间距*密度*的效果。
#### 实现说明。
一个硬布尔注意力掩码不会向 α 传递梯度,因此学习变体使用插值收集。固定和交错变体有整数偏移量,可以使用融合布尔掩码路径,但我们将它们通过相同的收集模块报告,以消除任何数值路径混杂;对于长度外推研究,整数偏移变体在评估时额外通过融合的布尔掩码注意力,这在数值上相同且更快。所有变体与密集基线共享投影、GQA 形状和 RoPE;唯一增加的参数是 θ 标量。
## 3 实验设置
#### 模型和训练。
所有模型使用相同架构:d_model=512,16 层,8 注意力头,2 键/值头(GQA),头维度 64,词表 32,768,序列长度 1024,SwiGLU 前馈网络比例 8/3,RMSNorm,RoPE(θ_rope=10^4),权重绑定的嵌入,无丢弃。训练对所有运行相同:13,000 步,有效批大小 32,768 词元(共 426M 词元),AdamW(β=0.9,0.95,权重衰减 0.1),学习率 3×10^{-4},300 步预热和余弦衰减,梯度裁剪 1.0,bf16 自动混合精度,种子 42。密集基线(记作 dense)完全共享此配方;唯一的区别是其注意力机制(通过逐字段配置比较验证)。非嵌入参数总数为 44.1M(包括绑定的嵌入则为 60.9M)。
#### 数据和评估。
模型在固定词元混合上训练,大致词元比例:35% FineWeb-Edu(Penedo 等人,2024),22% Wikipedia(Wikimedia Foundation,2023),20% TinyStories(Eldan 和 Li,2023),以及 23% 数学(MATH 数据集(Hendrycks 等人,2021)和 OpenMathInstruct-2(Toshniwal 等人,2024))。我们通过词元级困惑度在四个留出集上评估:FineWeb-Edu、Wikipedia、TinyStories,以及一个从 OpenMathInstruct-2 中留出的数学集(问题-解答对,训练数学的一个不重叠分片)。我们另外记录了一组辅助评估(两个合成多跳推理任务,RULER 变量追踪(Hsieh 等人,2024)和 LEGO(Zhang 等人,2022),加上一组从训练框架中继承的廉价探针)和一个分析性的 FLOPs/吞吐量分解。在这个规模下,该评估组统一受能力限制(第 4.6 节)。稀疏模型仅在密集版本基础上增加了 θ 标量,因此与 dense 的比较基本上是参数匹配的。
#### 运行矩阵。
我们对以下每种方法扫描局部窗口 W ∈ {6,8,10,12}:固定斐波那契、学习斐波那契、线性交错斐波那契、互质交错(HDC)斐波那契,以及线性交错 2 的幂次。普通的 2 的幂次控制(固定,α=1)在 W=8 运行。这产生了 21 个训练模型。吞吐量说明:学习变体通过非融合插值收集运行,在相同 FLOPs 下推理速度比融合整数偏移变体慢大约 5 倍;我们将效率视为背景而非选择标准,因为在此形状下注意力项是每层计算中的少数。
## 4 结果
### 4.1 困惑度:交错是主导杠杆
表 1 报告了整个矩阵的留出困惑度。在斐波那契基数内,每个窗口和数据集的排序一致:
交错 ≈ 互质 > 学习 > 固定,
并且整体最佳模型是 W=12 处的线性交错(FineWeb 42.02,Wikipedia 37.59)。互质重新分配在每个窗口与线性交错在种子尺度差异内持平,因此逐层间距的*级联顺序*并不重要;只有间距的多重集重要。普通的 2 的幂次控制是矩阵中最弱的模型。
表 1:全部 21 个模型的留出困惑度(越低越好)。在斐波那契基数内,每个窗口处交错 ≈ 互质 > 学习 > 固定。最佳模型是 W=12 处的线性交错。
### 4.2 交错增益与基数无关,且基数在其上增加
对 2 的幂次基数应用交错使其显著提升:在 W=8 时,普通对数稀疏的 FineWeb 困惑度从 44.78 提升到 43.60,只需应用相同的线性 α 斜坡。该效果最清晰的陈述使用 W=12 时三个种子的均值(表 5):*交错的 2 的幂次(42.84)击败了固定斐波那契(43.18)并与学习斐波那契(42.85)持平*。一个较差的基数,仅仅经过交错,就达到或超过了更好的基数,无论它是固定还是学习。因此,逐层间距多样性主导了基数选择,并且学习 α 没有带来任何交错所没有的东西。(一个种子曾暗示交错的 2 的幂次略微领先学习斐波那契 0.16;但三个种子下该差距消失为 0.01,在表 5 的种子噪声带内,因此我们报告为持平。)
然而,斐波那契基数仍然贡献了可分离的增益。在匹配的交错下,斐波那契在每个窗口都击败了 2 的幂次(FineWeb:W=6 时 42.93 对比 44.11,降至 W=12 时 42.02 对比 42.69)。这两个因素(交错和基数密度)是加性的而非冗余的。
#### 为什么交错拓宽了覆盖。
在固定 α=1 时,每一层关注相同的偏移量,因此整个堆栈中可到达的不同距离集等于一层的偏移量(在序列长度 1024 时,窗口之外大约有 19 个不同距离)。线性 α 斜坡为每一层提供了相同梯级的不同缩放副本,在相同每层稀疏性和相同注意力 FLOPs 下,将可到达距离的并集提高了大约 4 倍(到约 75)。
这个不同距离计数仍然低估了感受野,因为梯级不是点采样。宽度为 W 的密集局部窗口在每一层作为平滑核:在几层之内,每个词元的表示已经聚合了其 ±W 的邻居,并且模糊随深度累积。因此,在距离 d_k = α f_k 处读取的梯级返回一个半宽度约为 W 的软带,以 d_k 为中心,而不是单个位置。连续的斐波那契梯级被 f_{k+1} - f_k = f_{k-1} 分隔,因此每当该间距低于约 2W 时,相邻梯级的带会重叠,它们之间的明显间隙不再是真实空洞。这在短距离处自动成立,因为梯级密集(1,2,3,5,8,...);间距仅在大远处超过 2W(例如 610→987),那里精确偏移量最不重要。交错强化了这种效应:因为每一层将相同的名义梯级缩放到不同的绝对距离,各层的并集在任何一个单层会留空的区间内放置了几个带,并且多跳组合增加了连续层中使用的梯级之和 d_a + d_b。因此,不同距离计数是对覆盖的一个保守下界。
这个论点解释了为什么该方案没有功能性的空洞,但没有说明其测量到的优势来自何处。第 4.6 节中的位置分辨分析显示交错增益在上下文位置上均匀分布,而不是集中在长距离,因此拓宽的感受野更好地被解读为交错不牺牲覆盖的证据,而不是困惑度改进的来源。
### 4.3 学习标量是无效的
学习调度优于固定(表 1),但从未达到静态交错,并且它以大约 5 倍的推理延迟为代价,因为非整数偏移量需要非融合收集。学习到的 α 值保持接近初始化,这在第 4.4 节的一个受控检索探针中得到了直接确认。我们打算研究的机制,一个可训练的弹簧,因此被我们手动强加的固定调度所支配。我们将此解读为证据表明益处是结构性的(多样的逐层间距),而不是梯度下降需要发现的东西。
### 4.4 机制探针:标量不移动
为了直接测试这种惰性,我们在语言建模之外使用一个受控检索任务。每个序列在从查询起的一个选定偏移 d 处放置一个键-值对,并在其他地方放置干扰对,使得模型必须进行真正的距离依赖的检索。相似文章
SCALE:面向智能体工作流调度的可扩展交叉注意力学习与外推方法
本文提出SCALE,一种面向智能体LLM工作流DAG的深度强化学习调度器,通过交叉注意力与结构化表示正则化,泛化至未见过的集群规模,无需重新训练即可降低响应时间。
学习跳跃块:自我发现的超度量路由用于硬件加速稀疏注意力
本文介绍了动态超度量注意力(Dynamic Ultrametric Attention),这是一个框架,其中Transformer在训练期间学习每头块稀疏路由拓扑,然后在推理时将这些拓扑卸载到自定义的Triton块稀疏内核上,与密集注意力相比,实现了高达28倍的加速和98.4%的内存减少。
图注意力何时应稀疏?学习逐边的 Tsallis 指数
本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。
ConSA: 通过可学习分配实现混合注意力中的可控稀疏性
ConSA是一个框架,它通过L0正则化和增广拉格朗日约束,在用户指定的稀疏性目标下学习全注意力和滑动窗口注意力之间的最优分配。在0.6B和1.7B规模的LLM上,它相比基于规则的基线表现出一致的提升。
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。