超立方体上的旋转稀疏布线:一种无需搜索即可覆盖所有位置的注意力替代方案
摘要
本文提出一种利用超立方体上旋转稀疏布线替代神经网络注意力的方法,在显著降低计算成本和参数量的同时,实现相当或更优的性能。
arXiv:2609.18145v1 公告类型:新
摘要:注意力机制在每一层、针对每个输入时,都需要付出搜索连接对象的代价。我们探究了使用固定、稀疏且仅在层间简单旋转的布线能达到何种程度。将序列的 $n$ 个位置视为 $\log_2 n$ 维超立方体的顶点,并在第 $\ell$ 层将每个位置连接到其沿维度 $\ell \bmod \log_2 n$ 的邻居,信息从每个位置到达其他位置需要 $\log_2 n$ 层,每层有 $2n$ 条连接,而非 $n^2$ 条。在一个除非所有位置都被到达否则无法解决的合成任务上,这种旋转在 $1/32$ 的连接数下匹配了全连接布线,而跨层保持相同稀疏模式的方法则失败;关键在于每个维度都被触及,而非顺序。在公开语料库(enwik8 的前 $12$ 百万字符)的字符级语言建模中,一个在十六层稀疏层中保留两层注意力层的混合模型,在相同步数预算下(每个三个种子,无重叠),其验证集损失比相同宽度的完全注意力模型低 $0.06$ 比特每字符,连接数仅为 $1/7$,参数减少 $42\%$,墙钟时间减少 $2.4\times$;纯旋转调度与混合模型相当。在第二个包含日语、英语和代码的混合语料库上,同样的排序成立,差距扩大到 $0.16$。在两者上,可用学习率窗口比注意力宽四到八倍。我们还报告了未奏效的方法——学习坐标和一种"动力学"变体,其表面增益被证明是饱和内核的伪影——以及测量规范(冻结语料库、全覆盖评估、种子分布作为排名标准),我们认为这些对于在此规模上做出任何结论都是必要的。
查看缓存全文
缓存时间: 2026/09/17 09:18
# 无需搜索到达每个位置:在超立方体上旋转稀疏连接作为注意力的替代方案 来源:https://arxiv.org/html/2609.18145 Yoshiaki Takashita††注:本研究独立完成,不隶属于任何实验室。 2026年9月 ###### 摘要 注意力机制在每个层、针对每个输入,都要付出*搜索*连接对象的成本。我们探讨,如果使用固定、稀疏的连接方式,仅在层间进行*旋转*,能取得多大进展。将序列的n个位置视为log₂n维超立方体的顶点,并在第l层将每个位置与其在第(l mod log₂n)维度上的邻居相连,那么信息将在log₂n层内从每个位置传达到其他所有位置,每层使用2n条链接,而非n²。在一个若未到达所有位置则无法解决的合成任务上,这种旋转连接以1/32的链接数匹配了全连接的效果;而相同的稀疏模式若固定不旋转则失败;关键在于每个维度都被触及,而非触及顺序。在一个公开语料库(enwik8的前1200万字符)的字符级语言建模任务中,一个在十六层稀疏层中保留两层注意力层的混合模型,在相同步数预算下(各三个种子,无重叠),达到了比同等宽度的全注意力模型低0.06比特/字符的*更低*留出损失,同时仅使用1/7的链接、减少42%的参数、以及减少2.4倍的壁钟时间;纯旋转调度的性能与该混合模型持平。在包含日文、英文和代码的第二个语料库上,顺序保持不变,差距扩大到0.16。在两个语料库上,可用学习率窗口都比注意力机制宽四到八倍。我们还报告了未起作用的方法——学习坐标,以及一个“动力学”变体(其表面增益被证明是饱和核的产物)——以及我们发现的在此规模下进行任何有效讨论所必需的测量规范(冻结语料库、全覆盖评估、以种子分散度作为排序标准)。 ## 1引言 注意力机制的昂贵之处不在于混合;而在于搜索。每一层、针对每一个输入,注意力都会重新计算哪些位置应影响哪些位置,并为此付出O(n²)的代价。本文的问题有意聚焦:如果连接是*固定*的——即选择一次,与输入无关——注意力质量能保留多少,而其成本能减少到多少? 固定的稀疏模式并非新事物(Child et al., 2019;Beltagy et al., 2020;Zaheer et al., 2020);蝴蝶或超立方体调度能在log n阶段触及每个位置的观察也非新见(Dao et al., 2019)。我们的贡献是隔离了一个变量——*旋转*:改变每个层使用的超立方体维度——并将其与保持其他一切不变(相同权重、相同数据、相同步数、相同链接数)的对照组进行测量,首先在可达性即是整个问题的合成任务上,然后是在语言任务上。在此过程中,我们发现一些我们自己的中间“结果”实际上是测量产物,并将它们作为发现一并报告(§9)。 #### 声明. (A) 旋转是使稀疏连接可达的关键:使用每层相同的2n条链接,旋转维度匹配了全连接的效果,而未旋转的对照组则没有(§4)。(B) 在语言任务上,窗口为256时,一个在十六层中包含两层注意力层的混合模型,在公开语料库上比全注意力低0.06 bpc,在私有语料库上低0.16 bpc,且步数预算相同,链接数仅为1/7,可用学习率窗口宽四到八倍(§5)。在窗口为64时,混合模型仅与注意力持平,而纯稀疏调度落后于密集混合——这是我们之前未通过重新测量证实的预冻结声明(§9)。(C) 其中一个粗超立方体门控细超立方体的层次结构改变了*可训练性*,而非容量:渐近线相同,在500步时快30个点,种子分散度小43倍(§6)。(D) 一个“动力学”变体(其中位置在学习力作用下移动)通过饱和核产生了早期增益,该核将模型简化为指针链;在修正尺度后,步数数量的影响符号发生逆转(§7)。 ## 2相关工作 稀疏注意力保留了softmax搜索,但限制了其可能查看的位置:跨步和局部模式(Child et al., 2019),带有少数全局令牌的滑动窗口(Beltagy et al., 2020),或在两者上都添加随机链接(Zaheer et al., 2020)。路由方法则相反,通过哈希(Kitaev et al., 2020)或聚类(Roy et al., 2021)为每个输入学习模式。在这两类方法中,连接仍是在运行时决定的,而这正是我们试图消除的成本。 另一类方法完全移除了搜索。MLP-Mixer使用固定的密集位置映射混合令牌(Tolstikhin et al., 2021);Hyena用固定滤波器的长卷积替代注意力(Poli et al., 2023);Mamba保留选择性的、依赖输入的状态空间循环(Gu and Dao, 2023)。这些算子在位置上是密集的或携带逐位置状态。我们的方法每层仅需一次位移和两个线性映射,使用2n条链接。 我们使用的结构并不新。超立方体和蝴蝶网络在log n阶段到达每个节点,是并行计算中的标准结构(Leighton, 1992);蝴蝶分解已用于学习快速线性变换(Dao et al., 2019)。我们并未宣称该结构的所有权。我们隔离的是一个变量:逐层旋转维度,并将其与保持相同链接但不旋转的对照组进行测量。 ## 3方法 ### 3.1位置作为超立方体顶点 令n=2ᵇ。我们用b位整数索引位置,并在第l层将位置i连接到i ⊕ 2^(l mod b)——即其在某一超立方体维度上的邻居。因此,每层有2n条有向链接(加上自连接)。经过b个连续层后,每对位置都通过一条路径相连;在实践中,经过2b层后,网络即利用了这种连接性(§4)。对于因果语言建模,我们仅保留两个端点中较早的一个,这将调度变为并行前缀扫描。 ### 3.2在固定链接上的混合 一个跳数为k的稀疏层计算 yᵢ = W_self xᵢ + W_off xᵢ₋ₖ, (1) 即两个线性映射和一个位移。不存在依赖输入的路由。这是稀疏层使用的唯一操作,也是模型能仅使用标准算子导出到ONNX的原因(§8)。 ### 3.3调度 我们比较以下方案,同时保持权重、数据、优化器和步数固定: - • 密集(dense):全对全混合(每层n²条链接); - • 局部(local):每层k=1; - • 固定(fixed):一个超立方体维度,每层相同(“稀疏但不旋转”的对照组); - • 旋转(rot):第l层使用维度(l mod b); - • 混合(mixa):局部层和长距离层交替,长跳访问每个尺度一次(对于n=64,为32,16,8,4,2,1); - • 混合(hybrid):以mixa为骨干,其中两层替换为标准多头注意力。 确切的层列表在附录A中以简短的调度字符串给出。 ### 3.4层次结构与动力学 另外两个变体在合成任务上进行评估。在*层次*变体中,位置被分组;每个组是一个更粗超立方体的顶点,该超立方体遵循相同的移动规则并门控组内的耦合。力定律在各层之间共享,因此层次结构为一个12,482参数的模型增加了225个参数(+1.8%)。在*动力学*变体中,每个位置携带一个坐标pᵢ∈ℝᵈ;耦合为exp(−∥pᵢ−pⱼ∥²/τ),学习力移动坐标,并在读出前重复T次。缩放形式(“场”)在指数运算前将平方距离除以其因果行均值;“相位”形式还携带速度。 ## 4合成任务:旋转是可达的关键 #### 任务. 统计一个长度为n的随机二进制序列中的1的个数,仅从位置0读取答案。除非来自每个位置的信息都到达位置0,否则无法解决该任务。猜测最常见答案,在n=64时可得9.9%的准确率。 #### 结果(声明A). 当n=64,六层,且两种稀疏调度的权重和链接数完全相同时: 稀疏性并非关键;旋转才是。未旋转的对照组在链接数完全相同时处于随机水平。 #### 深度. 准确率在五层时为14.2%,在六层时跃升至98.8%。六是log₂64,即第一条完整路径存在的深度。它在约2 log₂n处饱和,在12层时达到99.8%,在16层时达到100%。对于n=256,基础log₂n=8给出28.0%,16层给出52.1%。有效深度再次约为基础值的两倍。 #### 顺序无关;覆盖是关键. 维度的随机排列达到99.0%。格雷码顺序(在16层内访问维度0八次,从不访问维度5)仅达到14.4%。每个维度都必须被触及。触及它们的顺序无关紧要。 ## 5语言建模 #### 设置. 字符级下一个字符预测,报告为留出比特/字符(bpc)。评估在非重叠窗口覆盖验证集,因此测量噪声为零;剩余的是优化器轨迹方差,我们用种子来估计。学习率对*每种*调度都进行网格搜索——在本工作早期,我们仅为一方调整并得出了三次错误结论(§9)。 我们在*两个*语料库上测量,每个语料库被冻结并通过其内容指纹识别。第一个是公开的:enwik8的前1200万字符,通过校验和从已发布存档重建(指纹c52380b41455,201,201个符号)。第二个是从本项目仓库固定提交中获取的1200万字符,包含混合日文、英文和代码(指纹e1634705154f,4,769,769个符号)。公开语料库是读者可以复现的;保留第二个是因为它是不同的分布,而我们感兴趣的是顺序在变化后是否保持不变。我们*不*将我们的enwik8数字与已发表文献比较:我们使用8%的块分割,而非惯常的90/5/5,因此这些数字内部可比,但与外部不可比。 ### 5.1公开语料库,窗口256,20–35M参数 十六层,宽度512,3,000步。学习率在七个值上扫描,最佳设置用三个种子重复。在其最佳速率下,注意力达到1.778 bpc(种子:1.772,1.771,1.791),使用526,336条链接和35.0M参数。混合模型达到1.718 bpc(1.703,1.712,1.740),使用72,184条链接和20.3M参数;旋转调度达到1.721 bpc(1.702,1.729,1.733),使用74,470条链接;学习坐标达到1.760 bpc(1.743,1.791,1.746),使用81,346条链接。 有两个分离在种子中经受住考验,一个则没有。混合模型和旋转调度低于注意力0.057–0.060 bpc,且种子之间无重叠;它们自身的差异0.003远在其分散度内,因此我们不对它们相互排序。学习坐标低于注意力0.018,但其种子与注意力的*重叠*,因此在该语料库上我们不声称它们有任何分离。所有曲线在第3,000步仍在下降(图1,右):这是在相等步数预算下的比较,而非收敛,并且我们此前已撤回“下降更快”的头条新闻(§9)。我们坚持的是在当前质量下的成本(表2):1/7的链接,减少42%的参数,以及在单个RTX 5070上每次运行减少2.4倍的壁钟时间。 #### 鲁棒性(声明B,后半部分). 混合模型在八倍学习率范围(0.0005–0.004)内保持在1.718–1.801 bpc。注意力在0.002及以上无法训练,在七个网格点中有三个失败(表1中的†),因此其可用窗口是0.000125–0.001。实际上,这种不敏感性与链接数量同样重要。 表1:公开语料库(enwik8,指纹c52380b41455),窗口256:学习率网格上的留出bpc,该单元格运行种子的平均值(由figs.py生成;粗体=每种调度最佳;†=训练失败)。hy=混合(十六层中的两层注意力),spin=旋转调度,warp=学习坐标。 表2:公开语料库,窗口256:每种调度在三个种子单元格中的最佳学习率下。s是这些种子上的总体标准差;links计算每层连接数,weights所有可训练参数,s/run在单个RTX 5070上进行3,000步的壁钟秒数。比率相对于注意力。 参考标题 参考标题 图1:公开语料库,窗口256:学习率网格(左)和每种调度在其最佳速率下的留出曲线(右)。 ### 5.2第二个分布:仓库语料库,窗口256 相同的网格应用于仓库语料库(指纹e1634705154f)。在其最佳速率下,注意力达到2.385 bpc(种子:2.381,2.370,2.405),使用526,336条链接和39.7M参数。旋转调度达到2.231 bpc(2.227,2.268,2.200),使用74,470条链接和25.0M参数;混合模型达到2.228 bpc(2.221,2.262,2.200),使用72,184条链接和25.0M参数;学习坐标达到2.248 bpc(2.259,2.243,2.241),使用81,346条链接。在三种稀疏调度中,0.003–0.020的差距位于0.018–0.068的种子分散度内,因此我们不对它们排序。三者都低于注意力0.14–0.16 bpc,且种子之间无重叠。参数计数与公开语料库仅在嵌入层和输出层不同,因为该语料库有4,769个不同符号,而enwik8有201个。 四种调度的顺序在两个语料库上相同,两个鲁棒性发现也相同。变化的是差距的大小:在
相似文章
学习跳跃块:自我发现的超度量路由用于硬件加速稀疏注意力
本文介绍了动态超度量注意力(Dynamic Ultrametric Attention),这是一个框架,其中Transformer在训练期间学习每头块稀疏路由拓扑,然后在推理时将这些拓扑卸载到自定义的Triton块稀疏内核上,与密集注意力相比,实现了高达28倍的加速和98.4%的内存减少。
ClusterAttention:一种无训练双向注意力加速方法
本文介绍了ClusterAttention,这是一种无训练方法,通过使用递归聚类实现块稀疏注意力,加速Transformer模型中的双向注意力。在表格数据上实现了2-6倍的加速,在视频生成上实现了1.8倍的加速,同时保持了高准确度。
通过稀疏电路理解神经网络
OpenAI 研究人员提出了一种训练稀疏神经网络的方法,通过强制大部分权重为零使其更易于解释,从而发现能够解释模型行为的小型解耦电路,同时保持性能。这项工作旨在推进机制可解释性,作为对稠密网络事后分析的补充,并支持 AI 安全目标。
Graph Machine: 通过边实现更优预训练
本文介绍了Graph Machine,一种通过动态指针将Transformer中的密集注意力层替换为稀疏层的方法,从而在预训练期间提高效率并保持或增强性能。
使用稀疏Transformer进行生成建模
OpenAI推出了稀疏Transformer,一种深度神经网络,将注意力机制的复杂度从O(N²)优化到O(N√N),使得能够对长度超过以前30倍的序列进行建模,适用于文本、图像和音频领域。该模型采用稀疏注意力模式和基于检查点的内存优化技术,可以训练深达128层的网络,在多个领域实现了最先进的性能。