FourierQK:对查询-键投影进行频谱预处理提升Transformer注意力
摘要
本文介绍FourierQK,一种对Transformer注意力中的学习查询和键投影应用基于FFT的频域预处理的方法,在字符级语言建模上实现了显著的验证损失降低。该方法保留了完整的注意力分数结构,并展示了相对于标准点积注意力的可复现收益。
arXiv:2607.07478v1 公告类型:交叉
摘要:基于FFT的对学习查询-键(Q/K)投影的频谱预处理显著提升了Transformer在字符级语言建模上的注意力。在TinyShakespeare上:一个固定的随机频谱滤波器达到val=1.031(Delta=+0.443);一个在段落尺度上的单个学习频率达到val=0.608(Delta=+0.867);四个跨越段落到词语尺度的学习频率达到val=0.309(Delta=+1.166),比标准点积注意力降低了79%。单频率结果在三个随机种子上得到确认(平均val=0.236,标准差=0.019)。这四个频率收敛到一个近似几何的多尺度排序(49、27、10、6个标记/周期),对应段落、子段落、短语和词语尺度。这种增益是频谱预处理特有的:Q/K的随机正交和非正交投影没有产生可测量的改进,表明收益来自全局频域混合而非度量扭曲。所有结果通过针对位置泄露的混洗验证诊断得到验证。因果滤波器(高斯、墨西哥帽、莫莱)在字符级分词上并未比标准注意力有所改进:双边FFT核在结构上是非因果的,将每个位置与未来标记耦合。这定义了双边频谱注意力(本文)与真正因果频谱注意力在词语级分词(配套论文MorletQK)之间的架构边界。本工作与FNet(Lee-Thorp et al., 2021)在架构上不同,后者用标记嵌入的傅里叶混合替代注意力。这里,频谱预处理仅应用于Q/K投影,同时保留了完整的注意力分数结构。
查看缓存全文
缓存时间: 2026/07/09 07:53
# 对查询-键投影进行频谱预处理可改善Transformer注意力机制 来源: https://arxiv.org/html/2607.07478 Athanasios Zeris https://orcid.org/0009-0002-6907-2400 独立研究员,希腊雅典。 通信地址: [email protected]。ORCID: https://orcid.org/0009-0002-6907-2400。代码: https://github.com/AthanasiosZeris/energy-gated-attention。 属于关于Transformer注意力中频谱方法的七篇论文系列的一部分。 ###### 摘要 基于FFT的频域预处理对学习到的查询和键投影进行预处理,可显著改善字符级语言建模中的Transformer注意力。在TinyShakespeare上:固定随机频谱滤波器达到验证损失(val)=1.031 (Δ=+0.443);一个在段落尺度初始化的单一学习频率达到val=0.608 (Δ=+0.867);而具有四个学习频率(跨越从段落到单词尺度)的多频率频谱注意力达到val=0.309 (Δ=+1.166)——比标准点积注意力的验证损失降低了79%。单一频率的结果在三个独立的随机种子上得到确认(平均val=0.236,标准差=0.019),确立了可复现性。这四个学习频率收敛到一个接近几何级数的多尺度排序(每个周期49、27、10、6个token),对应于戏剧文本中的段落、子段落、短语和单词尺度。这种改进似乎特定于频谱预处理:对Q/K进行随机正交旋转或随机非正交投影均未产生超过标准注意力的可测量收益,这表明收益来自得分计算之前在频域中的全局序列混合,而非来自度量失真或表示重映射。所有结果均通过一个打乱验证诊断进行验证,该诊断提供了反对位置泄漏的证据。因果时域滤波器(高斯、墨西哥帽、因果Morlet)在字符级分词上并未优于标准注意力:双边FFT重构核κ(-τ)=κ(τ)在结构上是非因果的,无论边界如何处理,都会将每个位置与未来token耦合。这确定了全局混合频谱注意力(本文)与单词级分词下的真正因果频谱注意力 (Zeris, 2026f (https://arxiv.org/html/2607.07478#bib.bib6)) 之间的精确架构边界。本工作与Lee-Thorp等人 (2021 (https://arxiv.org/html/2607.07478#bib.bib12)) (FNet) 在架构上有所不同,FNet使用*token嵌入*的傅里叶混合替换了注意力,并且没有Q/K投影或注意力得分矩阵。在这里,频谱预处理仅应用于*学习到的Q/K投影*,同时保留了完整的注意力得分结构,使得频率层次结构能够从注意力机制本身涌现出来。 ## 1 引言 标准Transformer注意力将成对得分计算为学习到的查询和键投影的点积: e_{ij} = (q_i · k_j) / sqrt(d) q = W_Q x, k = W_K x (1) 这是在W_Q和W_K学习到的嵌入空间中计算相似度。一个自然的问题是:在计算相似度之前将Q和K变换到不同的表示空间能否改善注意力?本文研究了频谱预处理——在得分计算之前对Q和K应用频域滤波器。其动机来自本系列的前期工作:论文1-4 (Zeris, 2026a (https://arxiv.org/html/2607.07478#bib.bib1), b (https://arxiv.org/html/2607.07478#bib.bib2), c (https://arxiv.org/html/2607.07478#bib.bib3), d (https://arxiv.org/html/2607.07478#bib.bib4)) 确立了Transformer表示中的频谱能量和相位结构是信息丰富的信号。 #### 主要贡献。 我们证明基于FFT的Q/K投影双边频谱预处理能够真正改善语言建模,即使使用随机(未学习)滤波器也是如此。该改进通过一个打乱验证诊断得到验证:在重新排序的验证序列上训练的模型损失要高得多,确认增益来自真正的序列学习(由较大的打乱差距证明),而非位置伪影。 #### 与FNet的区别。 Lee-Thorp等人 (2021 (https://arxiv.org/html/2607.07478#bib.bib12)) (FNet) 用token嵌入的全局傅里叶混合替换了整个注意力机制——没有Q/K投影,也没有得分矩阵。我们的方法保留了标准的注意力结构(Q/K投影、T×T得分矩阵、因果掩码、值聚合),仅在得分计算前对Q和K表示应用频谱预处理。这是架构上不同的贡献。 #### Morlet负结果。 我们最初假设对Q/K投影进行Morlet小波互相关将是最优的频谱评分机制。我们报告了这一假设、实验发现以及对其为何在离散序列设置中失败的分析:双边FFT实现产生了循环边界泄漏,而因果时域实现则遭受子token尺度下的混叠。这一负结果被完全透明地报告,因为它为未来的因果频谱注意力研究提供了指导。 ## 2 频谱注意力 ### 2.1 架构 设q, k ∈ R^{T×d} 为给定层学习到的Q/K投影。频谱注意力 (Spectral Attention, SA) 对Q和K应用频域滤波器,然后从滤波后的表示计算注意力得分: q̃(b) = F^{-1}[q̂(ω)·φ(ω)](b) k̃(b) = F^{-1}[k̂(ω)·φ(ω)](b) (2) e_{ij} = (q̃_i · k̃_j) / sqrt(d) (3) 其中q̂(ω)=F[q](ω)是查询序列的DFT,φ(ω)是一个频域滤波器(已学习或固定)。在实验中使用的复数形式中: e_{ij} = (1/d) Σ_k Re[ q̃_k(i)* · k̃_k(j) ] (4) 其中q̃_k(i)是位置i处嵌入维度k的复数滤波表示。 ### 2.2 滤波器变体 我们测试了四种滤波器设计: - Random-QK:固定随机滤波器,从与Morlet小波相同函数形式中抽取,随机尺度,不学习。测试任何频谱预处理是否有帮助,无论滤波器质量如何。 - Fourier-QK:在DFT频点上的软高斯选择器,每头有一个学习的主导频率f*: φ(ω, f*) = exp(-(ω - f*)²/8) (5) 测试学习频谱特征是否重要。 - 因果滤波器 (高斯、墨西哥帽、因果Morlet):使用左侧仅有填充的时域因果卷积,K=32个抽头。测试对Q/K的局部因果滤波是否有帮助。 ### 2.3 与FNet的关系 FNet (Lee-Thorp等人, 2021 (https://arxiv.org/html/2607.07478#bib.bib12)) 对完整的token嵌入序列应用DFT,并使用实部作为新表示,完全绕过注意力:FNet(x)=Re[F(x)]。没有Q/K投影,也没有得分矩阵。SA在架构上不同:Q和K投影是学习到的(与标准注意力相同),得分矩阵被计算(相同结构),频谱滤波应用于得分前的Q和K,而非直接应用于嵌入。 ## 3 实验设置 与论文1-4相同:GPT风格解码器 (Vaswani等人, 2017 (https://arxiv.org/html/2607.07478#bib.bib17)), L=6, H=8, d=256, T=256, 字符级TinyShakespeare, 5000训练步, 种子42 (所有单模型比较使用种子42以保证一致性), AdamW与余弦学习率调度。 ### 3.1 泄漏验证 所有基于FFT的注意力机制都存在循环边界伪影的风险:其fft操作将序列视为周期性的,可能允许未来token信息通过重构的滤波信号泄漏到过去位置。为了验证结果的有效性,我们对每个模型同时训练一个打乱验证诊断:同一模型在token顺序打乱的验证集上进行评估。利用位置泄漏的模型在有序序列和打乱序列上的表现会相似。进行真正序列学习的模型(由较大的打乱差距证明)在打乱序列上的损失会高得多。我们报告打乱差距:打乱验证损失减去有序验证损失。较大的差距提供了反对位置泄漏的证据。 ## 4 结果 表1: 包含正交基线的完整结果。Δ = 相对于BASE-DOT的改进。Gap = val_shuffled - val (泄漏诊断)。Random-Orth和Random-Proj是非频谱控制;两者与BASE-DOT相当,确认增益专门来自频域全局序列混合,而非表示重映射或度量失真。 | 模型 | Val | Δ | Gap | 备注 | |------|-----|---|-----|------| | BASE-DOT | 1.4742 | — | +5.78 | 标准注意力 | | 非频谱控制 (增益是频谱的,非重映射) | | Random-Orth-QK | 1.4719 | +0.002 | +5.80 | R^T R = I, val ≡ BASE-DOT | | Random-Proj-QK | 1.4791 | -0.005 | +5.77 | 固定非正交,同样无效 | | 因果时域 (在字符尺度上无增益) | | Gaussian-QK | 1.522 | -0.048 | — | 真实低通,σ学习从4→6 bins | | MexHat-QK | 1.540 | -0.066 | — | 可容许,比高斯差 | | Morlet-causal | 1.512 | -0.038 | — | 最佳因果,周期从50→38 tok | | FFT 频率崩溃 (真正的,已验证) | | Random-QK | 1.0313 | +0.443 | +4.98 | 固定随机频谱 | | Fourier-QK | 0.8744 | +0.600 | +4.32 | 1个学习频率,初始化bin=32 | | Fourier-QK-Init4 | 0.6076 | +0.867 | +4.33 | 1个学习频率,初始化bin=4 | | MultiFourier-QK | 0.3085 | +1.166 | +3.58 | 4个学习频率,多尺度 | | 尺度图注意力 v1 (存在错误:三重缩放、跨尺度、无1/sqrt(a)) | | SA-K1 (v1) | 1.715 | -0.241 | — | 所有错误,比BASE差 | | SA-K2 (v1) | 1.986 | -0.512 | — | 所有错误,接近随机 | | SA-K8 (v1) | 1.594 | -0.120 | — | 最佳有问题的SA | | SA-QK-K1 (泄漏) | 0.4025 | +1.072 | ≈0 | Q/K投影+irfft泄漏 | | 尺度图注意力 v3 (所有错误已修复:单一缩放,矩阵乘法后求和,1/sqrt(a)) | | SA-K2-v1style | 1.988 | -0.514 | +3.82 | 错误重现,确认Δ=1.36 | | SA-K1-v3 | 0.794 | +0.681 | +5.08 | 1个尺度,收敛到2 tok | | SA-K2-v3 | 0.632 | +0.842 | +4.68 | 2个尺度,[1, 38] tok | | SA-K4-v3 | 0.645 | +0.829 | +4.68 | 4个尺度,[1,4,12,42] tok | | SA-K2-NoPhase-v3 | 1.423 | +0.052 | +5.36 | 仅能量;相位必要 | | SA-K2-NoEnergy-v3 | 1.111 | +0.363 | +5.41 | 仅相位;中等增益 | | SA-K2-FixScale-v3 | 0.784 | +0.691 | +4.59 | 固定[1,80] tok;学习带来Δ+0.15 | 参见标题 图1: FourierQK结果概要 (全部使用修正后的缩放)。左上: 关键模型的学习曲线,对比有错误的双重缩放 (点划线) 与修正后的单一1/sqrt(h_s)缩放 (实线);Init4修正后val从0.636提升至0.216。中上: 相位×位置编码矩阵 (§5 (https://arxiv.org/html/2607.07478#S5)),显示相位随机化在三种PE条件下均有害。右上: BASE-DOT、Init4和MultiFourier的多种子鲁棒性 (3个种子),有错误与修正版本对比。左下: Init4 (修正) 的打乱差距在训练过程中单调增长——这是真正时间顺序使用的清晰特征。中下: MultiFourier-QK学习到的接近二进制的频率层次结构随训练过程变化,标注了周期比率。右下: 尺度图注意力 (SA) 从v1到v3的错误修复过程。 ### 4.1 验证的增益 (FFT双边) #### 尺度图注意力 v3 (修正后的实现)。 原始SA中的三个实现错误影响了所有变体:三重注意力缩放 (1/(hs·K·sqrt(hs)) 代替 1/sqrt(hs),导致logits大约变软362倍);矩阵乘法前求和造成跨尺度干扰;缺少1/sqrt(a)的Morlet归一化导致梯度下降偏向小尺度。v1style控制(重现错误)得到val = 1.988, Δ=-0.514——比BASE-DOT更差,与原始SA结果一致。在所有错误修正后 (SA-v3),SA-K2达到val = 0.632, Δ=+0.842——仅通过修正实现就改善了+1.356。SA-v3发现: (1) 相位至关重要——SA-K2-NoPhase得到val = 1.423,接近BASE-DOT,确认cos(Δφ)项承载了信号;(2) 能量贡献中等——SA-K2-NoEnergy得到val = 1.111;(3) 尺度学习有适度帮助 (比固定尺度好+0.15);(4) SA-K2-v3 (val = 0.632) 与Fourier-QK-Init4 (val = 0.608) 具有竞争力,尽管没有学习Q/K投影。学习到的尺度收敛到[1, 38] tok——同时包含字符尺度和段落尺度。 #### Random-QK: val=1.031, Δ=+0.443, gap=+4.98。 对Q/K应用固定随机频谱滤波器显著优于标准注意力。打乱差距+4.98提供了反对位置泄漏的证据。这是最令人惊讶的发现:即使不学习滤波器,对Q/K进行频谱预处理也真正有帮助。 #### Fourier-QK: val=0.874, Δ=+0.600, gap=+4.32。 每头一个学习的主导频率相比随机滤波器有进一步改进。打乱差距+4.32提供了反对位置泄漏的证据。 修正 (频率稳定性,而非迁移): 此实验的早期版本对频率参数log f应用了权重衰减,这导致AdamW将f推向exp(0)=1 (周期=256个token),独立于损失信号。在正确将log f排除在权重衰减之外 (单独的无衰减参数组) 后,学习到的频率是*稳定的*,而非迁移:初始化为bin=4 (周期=64个token),在六层中收敛到bin≈3.5-4.1 (周期≈62-73个token),并在步骤1000到5000之间保持在这一狭窄范围内 (表2 (https://arxiv.org/html/2607.07478#S4.T2))。早期关于向bin≈27迁移的报告是一个优化器伪影,而非损失景观的真实属性;梯度下降的真实行为是定位段落尺度的最优值并停留在那里。 表2: Fourier-QK频率稳定性,log f被排除在权重衰减之外 (修正版)。六层,每头平均bin。 ### 4.2 频率消融:最优尺度 为了解哪个频率导致了增益,我们测试了覆盖全频谱的固定频率bins (表3 (https://arxiv.org/html/2607.07478#S4.T3))。结果是非单调的,并揭示了一个意想不到的最佳点。 表3: 固定频率消融。最优尺度是bin=4 (周期=64个token, 段落尺度),它显著优于学习到的Fourier-QK。MidFreq和HighFreq给出相同的val,表明存在一个阈值,低于该阈值频率变得定性上更具信息量。 #### 段落尺度的最佳点。 LowFreq2-QK (bin=4, 周期=64个token) 达到val=0.620,显著超过Fourier-QK (+0.264) 和Random-QK (+0.411)。一个位于段落尺度的单一固定频率优于初始化为bin=32的学习模型。 #### 非单调结构。 增益并非简单的“频率越低越好”:bin=1 (周期=256个token) 得到val=1.113,比bin=4 (周期=64个token) 更差。MidF
相似文章
@rohanpaul_ai: 有趣,这篇论文表明Transformer可能不需要独立的键和值投影就能表现良好。这篇论文…
本论文研究了Transformer是否需要独立的键和值投影,发现共享它们可将KV缓存减少50%,而困惑度仅增加3.1%,并且与GQA和MQA结合时进一步减少。
Transformer 真的需要三个投影矩阵吗?QKV 变体的系统性研究
本文系统研究了 Transformer 中 QKV 投影共享的各种变体,发现共享键和值投影(Q-K=V)可在仅造成 3.1% 困惑度下降的情况下实现 50% 的 KV 缓存压缩,结合 GQA/MQA 最高可达 96.9% 的缓存压缩率——以极小的质量损失实现实用的端侧推理。
光谱探针电路:识别预训练Transformer中注意力头电路的三步法
介绍了一种三步法,用于识别预训练Transformer中的注意力头电路,该方法使用频谱信号和任务模式筛选,无需标签,并在51M到1B参数模型及多种架构上验证。
针对《古兰经》语音识别的预训练Transformer模型比较研究:语音表示、标签格式与数据集构成
本文系统性地实证研究了针对《古兰经》自动语音识别(ASR)的预训练Transformer模型(Wav2Vec2.0、HuBERT、XLS-R)微调,在EveryAyah子集上实现了0.08的词错误率(WER),并将训练时间从140小时减少到40小时,其中Wav2Vec2-XLSR-53提供了最佳表示。
Flexformer:具有可学习注意力核的灵活线性Transformer
Flexformer提出了一种灵活的线性Transformer,使用随机傅里叶特征实现完全可学习的注意力核,在语言建模和序列分类任务中达到线性复杂度,同时匹配或超越softmax注意力的性能。