Kuramoto注意力:在环面上同步自注意力
摘要
介绍了Kuramoto注意力,一种自注意力层,其中隐藏状态是环面上的相位角,通过门控余弦相似度和循环均值更新实现同步。该层在字符级语言建模上的性能与标准Transformer相当。
查看缓存全文
缓存时间: 2026/06/11 13:49
# Kuramoto 注意力:环面上的自注意力同步 来源:https://arxiv.org/html/2606.11585 Joshua Nunley [email protected] 印第安纳大学布卢明顿分校 信息学学院 Luddy信息学、计算与工程学院 认知科学项目 ###### 摘要 我们引入*Kuramoto注意力*,一种自注意力层,其中每个隐藏坐标是一个角度。该层通过门控余弦相似度对token进行评分,关注先前的相位状态,并通过注意力加权循环均值的切向分量更新每个token。由于值本身就是原始的相位状态,这个更新恰好是Kuramoto耦合项\(\sum_u A_{t,u}\sin(\theta_u - \theta_t)\),其中注意力矩阵充当一个自适应的、内容相关的耦合核。等价地,门控分数是环面上的一个学习度量,用于选择哪些token耦合,而更新则将每个token拉向其选择token的循环均值,从而加强它们的相位一致性。同样的两个要素,一个不变相似度分数和一个流形上的均值,在任何紧致群上定义了这样的层;环面是阿贝尔情形,两者都具有闭式解。Softmax权重解决了一个熵正则化的相位检索问题,而旋转位置嵌入在分数中表现为位置相关的相位漂移。在enwiki8字符级语言建模上,该层训练为一个功能性语言模型,其每字符比特数接近一个强匹配的RoPE+SwiGLU Transformer:在100万参数时相差0.02 BPC(1.637±0.010对比1.616±0.004),在500万参数时中位数持平(1.448对比1.452,基于五个随机种子),而Transformer在均值上领先(1.468对比1.456)。这些实验表明,受限的几何结构在此规模下是一个可行的语言模型;贡献在于结构本身及其同步解释。消融实验隔离了关键组件,结果在自注意力和相位同步之间建立了一个紧凑的桥梁。 ## 1 引言 自注意力通常被描述为基于内容的检索(Vaswani等人,2017 (https://arxiv.org/html/2606.11585#bib.bib3)):查询和键产生softmax权重,然后对值进行平均。我们引入一种自注意力层,其隐藏状态是相位值的,即环面上的一组相位振荡器,并且我们设计其值更新,使得该层计算一个自适应的Kuramoto同步步骤。在此步骤中,每个振荡器被拉向其关注的振荡器的注意力加权循环均值,而softmax注意力矩阵充当一个内容相关的耦合核。 由于值就是原始的相位,值更新恰好等于Kuramoto耦合项\(\sum_u A_{t,u}\sin(\theta_u - \theta_t)\)(命题1 (https://arxiv.org/html/2606.11585#Thmtheorem1));softmax权重解决了一个熵正则化的相位检索问题(命题2 (https://arxiv.org/html/2606.11585#Thmtheorem2))。这些权重是最佳分配,使得每个token的相位与其邻居的相位最匹配,同时尽可能分散(受熵惩罚限制),这意味着该层首先选择邻居,然后与它们同步。旋转位置在分数中作为位置相关的相位漂移进入(第3节 (https://arxiv.org/html/2606.11585#S3)),对于该层而言,这种漂移类似于Kuramoto模型中的自然频率;就像在Transformer中一样,它是一种位置选择,而不是核心层的一部分。在enwiki8上,该层训练为一个功能性字符级语言模型,其验证BPC接近匹配的Transformer:在500万参数时中位数持平(1.448对比1.452,基于五个随机种子),而Transformer在均值上领先(1.468对比1.456),在100万参数时相差0.02 BPC(1.637±0.010对比1.616±0.004)。消融实验隔离了关键组件。贡献在于结构及其同步解释;这些实验表明该结构在一个非平凡的规模和任务上是一个可行的语言模型。 #### 贡献. 1. 1.**一个新的注意力层。**我们引入Kuramoto注意力,一种自注意力层,其隐藏状态是相位值的,位于环面上。它的值是与几何本身一致的,因为值就是原始的相位状态,而不是学习到的投影,并且其增量是有界的,使得每次更新都保持在环面上(第2节 (https://arxiv.org/html/2606.11585#S2))。 2. 2.**Kuramoto恒等式。**由于其值就是原始相位,其值更新在每一步都恰好是Kuramoto耦合,其中softmax注意力矩阵作为耦合核(命题1 (https://arxiv.org/html/2606.11585#Thmtheorem1))。 3. 3.**选择与同步是一个连贯体。**Softmax权重解决了一个熵正则化的相位检索问题(命题2 (https://arxiv.org/html/2606.11585#Thmtheorem2)),因此该层选择一个软邻居集合。分数在学习度量下读取这种连贯性,而值更新遵循相同的连贯性将每个token拉向其选定的邻居,因此选择和同步是一个对象的两个方面(引理3 (https://arxiv.org/html/2606.11585#Thmtheorem3),该引理对固定的\(A\)成立;因为\(A\)依赖于相位,整个层不是一个单一的梯度流)。 4. 4.**旋转位置作为相位漂移。**旋转嵌入,我们使用的位置编码,在分数中作为位置相关的相位漂移进入,这种漂移类似于Kuramoto模型中的自然频率。如同在Transformer中,它是一个可选的位置选择,独立于核心层,并且其仅置于分数中是自然的(注释1 (https://arxiv.org/html/2606.11585#Thmremark1))。 5. 5.**乘法值路径。**Kuramoto注意力没有稠密的值或输出投影,并且它不将任何坐标的值加法地载入另一个坐标的更新:值仅通过门控和每个坐标的值门乘法地混合,加法值混合留给前馈块。设置那些每个坐标标量的门本身就是所有相位的稠密读出;它们乘法地作用于更新。这与标准注意力有显著不同(第3.5节 (https://arxiv.org/html/2606.11585#S3.SS5))。 6. 6.**一个功能层,附有消融实验。**作为enwiki8上的字符级语言模型,该层达到的BPC接近匹配的Transformer(500万参数时中位数持平,100万参数时相差0.02 BPC),这表明受限结构是一个可行的语言模型,而消融实验隔离了每个组件的贡献(第4节 (https://arxiv.org/html/2606.11585#S4)和4.3节 (https://arxiv.org/html/2606.11585#S4.SS3))。 Geshkovski等人(Geshkovski等人,2023 (https://arxiv.org/html/2606.11585#bib.bib5);2024 (https://arxiv.org/html/2606.11585#bib.bib6))分析了标准注意力并证明它仅渐近地聚类,而振荡器注意力模型如AKOrN(Miyato等人,2025 (https://arxiv.org/html/2606.11585#bib.bib7))通过设计将Kuramoto动力学添加到注意力中。我们设计一个相位状态注意力层,其值更新在每个层*恰好*是一个自适应的Kuramoto步骤,并且我们证明该层是一个功能性的语言模型,在字符级任务上性能接近标准Transformer。同步是该层自身的值更新,因此不需要额外的振荡器机制。 ## 2 Kuramoto注意力 我们将每个token的隐藏状态建模为一个相位向量\(\theta\in\mathbb{R}^k/(2\pi\mathbb{Z})^k\),即一组\(k\)个单位振荡器\(e^{i\theta_j}\)。一个层通过三个阶段将相位状态序列映射到相位增量:一个门控相似度分数,一个循环均值值更新,以及一个有界前馈块。Token作为学习到的相位嵌入,logits通过相位对齐读出。 #### 层概览。 记\(\psi(\theta)=(\cos\theta,\sin\theta)\)为提升,\(\rho\)为正门控,该层将token \(t\)、坐标\(j\)的相位映射到更新后的相位,如下: \[ \begin{aligned} g^q_t &= \rho\big(W_q\,\psi(\theta_t)\big), \quad g^k_t = \rho\big(W_k\,\psi(\theta_t)\big), \\ s_{t,u} &= \frac{\tau}{\sqrt{k}}\sum_j g^q_{t,j}\,g^k_{u,j}\cos\!\big(\theta_{t,j}-\theta_{u,j}+\omega_j(t-u)\big), \quad A_{t,\cdot} = \mathrm{softmax}_{u\leq t}\, s_{t,\cdot},\\ G_{t,j} &= \sum_{u\leq t} A_{t,u}\, e^{i\theta_{u,j}}, \quad a_{t,j} = -\sin\theta_{t,j}\,\mathrm{Re}\,G_{t,j} + \cos\theta_{t,j}\,\mathrm{Im}\,G_{t,j},\\ \theta_t &\leftarrow \theta_t + \mathrm{bound}\big(v(\theta_t)\odot a_t\big),\\ \theta_t &\leftarrow \theta_t + \mathrm{bound}\big(\mathrm{SwiGLU}(\theta_t)\big). \end{aligned} \] 两个残差更新依次应用。下面的小节定义每一行,第3节 (https://arxiv.org/html/2606.11585#S3)将它们解读为同步。 ### 2.1 门控相位相似度 每个token从其相位特征\(\psi(\theta)=(\cos\theta,\sin\theta)\)(即贯穿使用的\((\cos,\sin)\)提升)产生正的查询和键门控, \[ g^q_t = \rho\big(W_q\,\psi(\theta_t)\big), \qquad g^k_t = \rho\big(W_k\,\psi(\theta_t)\big), \] 其中\(\rho=\mathrm{softplus}\)后接均值归一化(\(\bar{g}=g/\mathrm{mean}(g)\))。分数将门控与原生环面余弦核以及一个旋转相位提前\(\omega_j(t-u)\)(带有学习到的每个坐标速率\(\omega_j\))相结合: \[ s_{t,u} = \frac{\tau}{\sqrt{k}}\sum_j g^q_{t,j}\,g^k_{u,j}\,\cos\!\big(\theta_{t,j}-\theta_{u,j}+\omega_j(t-u)\big), \qquad A = \mathrm{softmax}_{u}\!\big(s_{t,u}\big) \] 并带有因果掩码。位置仅通过分数进入,即每个坐标的相位漂移\(\omega_j(t-u)\);层的其余部分及其所有的同步结构都与位置无关。我们在这种漂移中使用旋转位置,带有学习到的每个坐标速率\(\omega_j\),设置\(\omega\equiv 0\)恢复裸环面余弦核(第3节 (https://arxiv.org/html/2606.11585#S3))。 #### 分数和值更新共享一个连贯体。 分数和值更新都构建于单个量,即成对相位相干和\(\sum_j\cos(\theta_{t,j}-\theta_{u,j})\)。分数在学习度量下读取这种相干性,并由此选择哪些token耦合。门控\(g^q g^k\)提供该度量,因为它们是一个位置相关的、每个坐标的加权,在\(\mathbb{T}^k\)上形成一个对角度量(附录B (https://arxiv.org/html/2606.11585#A2)),并且这个度量在各层间共享。下面的值更新遵循相同的相干性:它将每个token拉向其选择的token的注意力加权循环均值,从而同步它们的相位。第3节 (https://arxiv.org/html/2606.11585#S3)发展了这个共享结构(引理3 (https://arxiv.org/html/2606.11585#Thmtheorem3))。 ### 2.2 循环均值值更新 值就是原始的相位状态,不是学习到的投影。我们记\(G_{t,j} = \sum_u A_{t,u} e^{i\theta_{u,j}}\)为注意力加权合向量。这个合向量是被关注相位的循环均值。作为复平面上的一个点,其幅角是平均相位,其模量度量被关注相位的一致程度。更新然后将\(\theta_{t,j}\)移向这个均值。增量是\(G_{t,j}\)在当前相位处的切向分量,我们如下获得。单位切向量在\(\theta_{t,j}\)处为\((-\sin\theta_{t,j},\cos\theta_{t,j})\),将\(G_{t,j}=(\mathrm{Re}\,G_{t,j},\mathrm{Im}\,G_{t,j})\)投影到这个切向量上得到 \[ a_{t,j} = -\sin\theta_{t,j}\,\mathrm{Re}\,G_{t,j} + \cos\theta_{t,j}\,\mathrm{Im}\,G_{t,j}. \] 等价地,将相位写作单位相量\(z_{t,j}=e^{i\theta_{t,j}}\),从而\(G_{t,j}=\sum_u A_{t,u}z_{u,j}\),这个投影是单个复数乘积的虚部,\(a_{t,j} = \mathrm{Im}\!\big(\overline{z_{t,j}}\,G_{t,j}\big)\),由此立即得到\(|a_{t,j}|\leq|G_{t,j}|\leq 1\)。这个增量使运动保持在环面上,因为它沿圆前进角度,并且命题1 (https://arxiv.org/html/2606.11585#Thmtheorem1)表明这个增量等于Kuramoto耦合项。一个每个坐标的值门控\(v=v(\theta_t)\)缩放\(a\)。该门控是相位特征的带符号线性读出,因此正条目将坐标拉向被关注的循环均值,负条目将其推开;它是一个学习到的、内容相关的耦合强度,正为同步,负为排斥。然后一个\(\tanh\)界限将相位增量保持在学习半径内。该界限是范数匹配的,这意味着小的增量按学习半径缩放,否则保持比例,而大的增量被压缩朝向这个半径,因此饱和非线性限制了步长而不扭曲典型更新的相对大小。有界增量被加到状态上,\(\theta\leftarrow\theta+\mathrm{bound}(v\odot a)\)。 ### 2.3 前馈块 一个SwiGLU前馈块产生第二个有界增量,在各层之间重新定位状态。该块在局部相位坐标中作用,因为角度\(\theta\)是其输入特征,其输出是每个坐标的角度增量,\(\theta\leftarrow\theta+\mathrm{bound}\big(\mathrm{SwiGLU}(\theta)\big)\)。层在相位状态上是残差的。这个块是标准Transformer前馈网络在相位坐标中的形式,也是唯一不是从几何构建的组件。它在精确意义上是非几何的:它将原始角度\(\theta\)作为输入,而其他每个组件都读取\((\cos,\sin)\)提升,因此其输出依赖于所选相位的代表(\(\theta\)与\(\theta+2\pi\)),并且不是环面上的函数。单独的前馈块打破了层其余部分所遵守的周期性,一个作用于提升的变体是自然的几何原生替代。第3.5节 (https://arxiv.org/html/2606.11585#S3.SS5)会回到它,作为唯一加法地混合嵌入值的块。 #### 没有归一化层。 一个Transformer交替
相似文章
@gurtej__gill_: Kimi 团队在三月份写了一篇非常巧妙的论文,修复了我们似乎已经接受的一个基本缺陷……
Kimi 团队的论文 'Attention Residuals'(AttnRes)将 Transformer 中的均匀残差连接替换为基于深度的 softmax 注意力,使每一层能够动态选择先前的表示。该模型在 1.4 万亿个 token 上预训练,拥有 48B 参数,稳定了隐藏状态,并显著提升了推理任务的表现。
@tetsuoai: 注意力机制是一种查找。每个token构建一个查询,与序列中的每个键进行比较,并拉取值向量…
将Transformer中的注意力机制解释为一种查找操作:每个token构建查询,与键进行比较,并检索加权的值向量,附带视频覆盖完整流程。
@_rohit_tiwari_: https://x.com/_rohit_tiwari_/status/2063982924714901858
本文提供了大型语言模型中Transformer架构的可视化指南,涵盖自注意力、因果自注意力、掩码多头注意力以及输出层,并附有逐步解释和示例。
学习跳跃块:自我发现的超度量路由用于硬件加速稀疏注意力
本文介绍了动态超度量注意力(Dynamic Ultrametric Attention),这是一个框架,其中Transformer在训练期间学习每头块稀疏路由拓扑,然后在推理时将这些拓扑卸载到自定义的Triton块稀疏内核上,与密集注意力相比,实现了高达28倍的加速和98.4%的内存减少。
谱异常值揭示Transformer注意力中主导的学习结构
本文应用Marchenko-Pastur随机矩阵理论于预训练注意力权重,将每个投影矩阵分解为类随机体(bulk)和谱异常值。因果实验表明,在Mistral-7B中将这些异常值置零会使HellaSwag、MMLU和PIQA的性能接近随机水平,从而揭示谱异常值编码了11个Transformer中占主导地位的学习结构。