半直接傅里叶Delta注意力:基于相位控制的Delta记忆与构造性Chunk-WY核

arXiv cs.LG 论文

摘要

介绍了半直接傅里叶Delta注意力(SFDA),一种相位控制的Delta规则层,它通过块旋转傅里叶控制算子扩展了Kimi Delta注意力,提供了构造性Chunk-WY定理以实现高效的分块计算,并展示了在循环记忆和寄存器记忆上的表达能力。

arXiv:2607.11897v1 公告类型:新论文 \n摘要:线性注意力将softmax注意力不断增长的KV缓存替换为固定的循环状态,但这种压缩限制了精确的状态追踪和长上下文记忆。我们介绍\\emph{半直接傅里叶Delta注意力}(SFDA),这是Kimi Delta注意力的一种相位控制推广,将实对角衰减替换为块旋转傅里叶控制:\\[ S_t=(I-\\beta_t k_tk_t^*)\\Lambda_tS_{t-1}+\\beta_tk_tv_t^*, \\qquad \\Lambda_t=\\diag(\\alpha_t\\odot e^{i\\theta_t}). \\] 我们的主要结果是针对乘积\\(A_t=\\Lambda_t-u_tr_t^*\\)的构造性Chunk-WY分解,得到\\[ A_t\\cdots A_1=\\Gamma_t-Y_tM_tW_t^* \\] 其中秩增长被限制在固定块内。这提供了精确的仿射块转移、形式稳定性和复杂度界限,以及相位加低秩记忆的紧凑表征。我们通过数值验证了该代数,并在玩具状态追踪实验中展示了SFDA能够学习循环记忆,而相位禁用的KDA基线仍接近随机水平。融合内核和大规模语言模型的比较留待未来工作。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:16

# 基于相位控制的Delta记忆与构造性块WY核 来源:https://arxiv.org/html/2607.11897

## 半直积傅里叶Delta注意力:基于相位控制的Delta记忆与构造性块WY核

###### 摘要

线性注意力用固定大小的循环状态取代了softmax注意力不断增长的KV缓存,但固定状态记忆使得精确复制、算法状态追踪和长上下文检索变得困难。我们引入了*半直积傅里叶Delta注意力*(SFDA),这是一种相位控制的delta规则层,严格包含了Kimi Delta注意力(KDA)。SFDA将KDA纯实数对角衰减替换为块旋转的傅里叶控制算子。在复数坐标下,循环更新为:

\(S_{t}=(I-\beta_{t}k_{t}k_{t}^{*})\Lambda_{t}S_{t-1}+\beta_{t}k_{t}v_{t}^{*},\qquad\Lambda_{t}=\operatorname{diag}(\alpha_{t}\odot e^{i\theta_{t}}).\)

核心技术成果是一个构造性块WY定理。对于一个从左到右的乘积 \(P_{t}=A_{t}A_{t-1}\cdots A_{1}\),其中 \(A_{t}=\Lambda_{t}-u_{t}r_{t}^{*}\),这些因子可以显式更新为 \(P_{t}=\Gamma_{t}-Y_{t}M_{t}W_{t}^{*}\),且秩仅在固定块内增长。这将闭包性质转化为可实现的块局部递归,给出了精确的仿射写入摘要,并提供了形式化的成本和稳定性界限。我们还刻画了实际核兼容族的紧凑表达能力:每个块是一个结构化的相位/控制乘积加上一个秩为 \(C\) 的修正项,这紧凑地实现了乘积循环计数器、二面体相位定向记忆、寄存器/重置记忆以及在相应结构化控制下的有界栈。我们进一步解决了一个更广义的绑定写入仿射模板的有限状态表达能力问题:每个确定性有限自动机都可通过独热提升并将写入系数设为零来精确实现。我们用数值定理检验和玩具循环记忆实验验证了代数,而将融合Triton/CUDA速度和大型混合比例比较留待后续系统工作。

## 1 引言

序列建模中反复出现的一个主题是*并行捷径计算*与*循环状态追踪*之间的张力。浅层Transformer可以通过并行组合转移函数来模拟有限自动机(Liu et al., 2023 (https://arxiv.org/html/2607.11897#bib.bib19)),但捷径解在分布偏移和长度外推下可能脆弱。线性注意力和门控循环注意力则走向相反方向:它们维护一个固定大小的状态,以循环方式更新,这提高了推理效率,但限制了长上下文检索和精确算法记忆。

Kimi Delta注意力(KDA)是第二个方向的近期强有力例子。它维护一个矩阵值记忆状态

\(S_{t}=(I-\beta_{t}k_{t}k_{t}^{*})\operatorname{diag}(\alpha_{t})S_{t-1}+\beta_{t}k_{t}v_{t}^{*},\) (1)

并通过块化WY风格表示对角衰减加上秩一delta修正来获得实际效率(Kimi Team, 2025 (https://arxiv.org/html/2607.11897#bib.bib16))。KDA的经验成功提出了一个既理论又面向系统的问题:

> 我们能否在不破坏结构化块核的前提下,向KDA风格的循环记忆添加代数相位/控制动力学?

我们在一个受限但硬件友好的相位族中回答了这个问题。所提出的层*半直积傅里叶Delta注意力*(SFDA)在delta修正之前插入一个块旋转控制矩阵。在实数坐标下,

\(S_{t}=(I-\beta_{t}k_{t}k_{t}^{*})U_{t}D_{t}S_{t-1}+\beta_{t}k_{t}v_{t}^{*},\) (2)

其中 \(U_{t}\) 是 \(2 \times 2\) 旋转的直和,\(D_{t}\) 是正块/对角衰减。在恒等映射 \(\mathbb{R}^{2m} \simeq \mathbb{C}^{m}\) 下,这变为

\(S_{t}=(I-\beta_{t}k_{t}k_{t}^{*})\Lambda_{t}S_{t-1}+\beta_{t}k_{t}v_{t}^{*},\qquad\Lambda_{t}=\operatorname{diag}(\alpha_{t}\odot e^{i\theta_{t}}).\) (3)

因此代数控制是一个可学习的傅里叶相位,而delta修正保持秩一。关键并非仅在于相位参数化。如果相位控制矩阵是稠密的,核将退化为稠密的 \(d \times d\) 乘积。关键设计选择是将 \(U_{t}D_{t}\) 限制为对齐的 \(2 \times 2\) 旋转-衰减块,等价于复数对角 \(\Lambda_{t}\)。于是每个token转移具有形式

\(A_{t}=\Lambda_{t}-u_{t}w_{t}^{*},\) (4)

即相位衰减加上一个秩一delta修正。

#### 贡献。 本预印本将半直积/傅里叶自动机思想形式化为一个用于相位控制delta记忆的理论与核框架。

1. 我们将绑定SFDA定义为主要架构,并定义了一个写解耦变体用于精确自动机构造。KDA通过设置 \(U_{t}=I\)(等价于 \(\theta_{t}=0\))恢复。
2. 我们证明相位控制部分精确实现了有界循环记忆:旋转以恒定范数维护模计数器和相位追踪器。
3. 我们证明了一个构造性从左到右块WY定理。对于 \(P_{t}=A_{t}A_{t-1}\cdots A_{1}\),其中 \(A_{t}=\Lambda_{t}-u_{t}w_{t}^{*}\),因子 \(\Gamma_{t}, Y_{t}, M_{t}, W_{t}\) 允许显式递归。这比存在性闭包定理更强,是主要的核定理。
4. 我们证明了一个精确的仿射块转移,包括加法写入摘要 \(B_{C}=\sum_{i=1}^{C}A_{C:i+1}B_{i}\),并展示了如何通过零初始状态递归计算它。
5. 我们刻画了块内紧凑核兼容表达能力:长度为 \(C\) 的SFDA乘积是一个结构化的相位/控制乘积加上一个秩为 \(C\) 的修正项。这证明了在相应结构化控制下,乘积循环计数器、二面体相位定向记忆、寄存器/重置记忆和有界栈的紧凑精确实现。
6. 我们给出了一个读者友好的有限状态定理:每个确定性有限自动机,在独热提升后,都可以通过一个广义绑定写入仿射记忆系统精确实现。构造将写入系数设为零,因此擦写耦合对于有限状态机并非表达性障碍。剩下的问题是高效压缩实现,而非精确有限状态可实现性。
7. 我们增加了一个轨道限制的绑定写入编译定理。它展示了何时解耦的写入方向可以使用架构的结构化控制族从绑定键中路由,并明确分离了贡献路由与使用暂存/保护信道的全状态编译。
8. 我们包含了复数到实数实现、形式化成本界限、数值稳定性引理和秩增长原则:秩仅在固定块内增长,而非跨整个序列。

主要实验目标并非仅仅在玩具自动机上击败KDA。长期系统目标是测试更强的SFDA线性层是否能支持更高的线性与全局注意力比例,例如7:1或15:1,同时在相同计算量下匹配或超越KDA风格的3:1混合。

## 2 背景

### 2.1 自动机、捷径和循环记忆

一个有限半自动机 \(\mathcal{A}=(Q,\Sigma,\delta)\) 通过 \(q_{t}=\delta(q_{t-1},\sigma_{t}),\quad q_{t}\in Q,\ \sigma_{t}\in\Sigma.\) (5) 演化。每个符号映射 \(\delta(\cdot,\sigma)\) 生成一个有限变换半群。现有捷径结果表明,Transformer可以通过 \(O(\log T)\) 深度的并行前缀组合模拟任何有限半自动机,并且一些可解半自动机通过Krohn-Rhodes风格的分解允许常数深度捷径(Liu et al., 2023 (https://arxiv.org/html/2607.11897#bib.bib19))。然而,这些浅层捷径可能无法泛化到未见长度或偏移的输入分布,这激发了具有显式循环状态的架构。

#### 作为普通矩阵递归的有限自动机。 稍后使用的有限状态表达能力定理不需要自动机理论背景。如果 \(Q=\{q_{1},\ldots,q_{N}\}\),将状态 \(q_{i}\) 编码为独热向量 \(e_{i}\in\mathbb{R}^{N}\)。对于每个输入符号 \(\sigma\),定义一个矩阵 \(P_{\sigma}\) 使得 \(P_{\sigma}e_{i}=e_{j}\) 当 \(\delta(q_{i},\sigma)=q_{j}\)。 (6) 那么自动机递归正好是线性递归 \(s_{t}=P_{\sigma_{t}}s_{t-1}\)。 (7) 矩阵 \(P_{\sigma}\) 是确定性的独热转移矩阵:每列恰好有一个非零项,但矩阵不一定可逆。例如,重置转移可以将许多状态映射到同一个下一状态,因此 \(P_{\sigma}\) 不一定是置换矩阵。这个基本的独热观点是第4.1节和附录D中绑定写入实现结果所需的唯一有限自动机事实。我们使用的代数对象是半直积 \(N \rtimes H\),\((n_{2},h_{2})(n_{1},h_{1})=(n_{2}+h_{2}\cdot n_{1}, h_{2}h_{1})\), (8) 其中 \(H\) 是一个控制群,作用于记忆幺半群或向量空间 \(N\)。这一结构分离了两种操作:记忆存储和记忆传输的控制方式。

### 2.2 KDA作为仿射循环记忆

KDA通过方程(1)更新记忆矩阵 \(S_{t}\in\mathbb{F}^{d\times d_{v}}\)。抽象地,每个token定义一个仿射映射 \(S\mapsto A_{t}S+B_{t},\quad A_{t}=(I-\beta_{t}k_{t}k_{t}^{*})D_{t},\quad B_{t}=\beta_{t}k_{t}v_{t}^{*},\) (9) 其中 \(D_{t}=\operatorname{diag}(\alpha_{t})\)。仿射映射通过 \((A_{2},B_{2})\circ(A_{1},B_{1})=(A_{2}A_{1}, A_{2}B_{1}+B_{2})\) (10) 组合。因此可扫描性在数学上是直接的。难点在于效率:稠密乘积 \(A_{2}A_{1}\) 代价为 \(O(d^{3})\),因此有用的架构必须在块内保持对角加低秩结构。KDA高效是因为 \(A_{t}\) 是对角衰减加上一个秩一修正。其块化公式存储乘积的紧凑WY风格表示,并使用三角求解或UT风格变换来避免稠密矩阵乘积(Kimi Team, 2025 (https://arxiv.org/html/2607.11897#bib.bib16); Bischof and Van Loan, 1987 (https://arxiv.org/html/2607.11897#bib.bib5))。我们的目标是在保持相同结构不变量的同时添加相位/控制动力学。

### 2.3 与RoPE、SSM、DPLR和KDA的关系

区分旋转发生的位置是有帮助的。旋转位置嵌入旋转查询/键特征以编码相对位置。SFDA则旋转循环记忆转移本身:\(S_{t}=(I-\beta_{t}k_{t}k_{t}^{*})\Lambda_{t}S_{t-1}+\beta_{t}k_{t}v_{t}^{*}.\) (11) 因此SFDA相位是状态转移相位,而不仅仅是查询/键的位置相位。

表1:转移不变量的理论层面比较。
SFDA与复数对角SSM的不同之处在于它保留了delta规则的秩一修正。它与KDA的不同之处在于实数对角衰减被升级为复数相位衰减。它与无限制DPLR的不同之处在于低秩项与delta规则绑定,因此允许构造性块WY不变量。

###### 命题2.1 (KDA与复数对角SSM之间的插值)。 如果 \(\theta_{t}=0\),SFDA退化为KDA。如果 \(\beta_{t}=0\),SFDA退化为复数对角状态空间递归 \(S_{t}=\Lambda_{t}S_{t-1}\)。因此SFDA在KDA风格的delta记忆和振荡对角SSM风格的相位动力学之间进行插值。

### 2.4 为什么任意的正交控制是不可接受的

一个诱人的扩展是将 \(D_{t}\) 替换为学习到的稠密正交矩阵。这会破坏核:稠密正交矩阵与秩一修正的乘积不会保留廉价的对角加低秩表示。因此我们将控制算子限制为块旋转 \(U_{t}=\bigoplus_{j=1}^{d/2}R(\theta_{t,j}),\quad R(\theta)=\begin{bmatrix}\cos\theta & -\sin\theta \\ \sin\theta & \cos\theta\end{bmatrix}.\) (12) 将配对的通道解释为复数坐标后,\(U_{t}D_{t}\) 是对角的。这就是SFDA能够添加相位记忆同时保留类似KDA的核路径的原因。该设计也与将旋转位置编码解释为 \(2 \times 2\) 旋转乘积的常见理解一致(Su et al., 2024 (https://arxiv.org/html/2607.11897#bib.bib21))。

## 3 半直积傅里叶Delta注意力

我们现在定义该层。令 \(x_{t}\in\mathbb{R}^{d_{\mathrm{model}}}\) 为token表示。对于每个头,投影产生 \(q_{t},k_{t}\in\mathbb{F}^{d}\),\(v_{t}\in\mathbb{F}^{d_{v}}\),标量步长 \(\beta_{t}\in[0,1]\),逐通道衰减 \(\alpha_{t}\in[0,1]^{d}\),以及在复数坐标下的相位 \(\theta_{t}\in[-\theta_{\max},\theta_{\max}]^{d}\)。本文的主要架构是绑定SFDA递归

\(S_{t} = (I-\beta_{t}k_{t}k_{t}^{*})\Lambda_{t}S_{t-1}+\beta_{t}k_{t}v_{t}^{*},\) (13)
\(\Lambda_{t} = \operatorname{diag}(\alpha_{t}\odot e^{i\theta_{t}}).\)

输出为 \(o_{t}=S_{t}^{*}q_{t}.\) (14)

在实数实现中,复数乘法 \(\lambda_{t,j}=\alpha_{t,j}e^{i\theta_{t,j}}\) 通过一个 \(2 \times 2\) 旋转衰减块实现。不需要FFT。

#### 稳定参数化。 一个简单实现通过以下方式强制后续使用的稳定性假设:

\(\alpha_{t} = \alpha_{\min}+(\alpha_{\max}-\alpha_{\min})\sigma(a_{t}),\quad 0\leq\alpha_{\min}\leq\alpha_{\max}\leq 1,\) (15)
\(\theta_{t} = \theta_{\max}\tanh(b_{t}),\) (16)
\(\beta_{t} = \sigma(c_{t}),\) (17)
\(k_{t} = \tilde{k}_{t}/(\left\lVert\tilde{k}_{t}\right\rVert_{2}+\varepsilon).\) (18)

那么 \(\left\lVert\Lambda_{t}\right\rVert_{2}\leq 1\),\(0\leq\beta_{t}\leq 1\),且 \(\left\lVert k_{t}\right\rVert_{2}\leq 1\),因此 \(0\leq\beta_{t}\left\lVert k_{t}\right\rVert_{2}^{2}\leq 1\)。

###### 定义3.1 (绑定SFDA转移)。 对于token \(t\),

相似文章

动态线性注意力

arXiv cs.CL

本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。

Dynamic Linear Attention

Hugging Face Daily Papers

DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。

扩散语言模型的动态分块

arXiv cs.CL

本文介绍了扩散语言模型的动态分块(DCDM),该方法使用可微分的Chunking Attention机制,用内容定义的语义块替换块离散扩散中的固定位置块,在高达1.5B参数规模上实现了一致的改进。

线性注意力架构:机制、权衡与跨层路由

arXiv cs.LG

本文对比了softmax注意力与四种线性注意力架构(DeltaNet、Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2),并介绍了跨层路由机制。在350M参数规模的实验表明,使用Muon优化器的Kimi Delta Attention取得了最低的验证损失,而使用AdamW的纯Gated DeltaNet吞吐量最高。