Complex KDA:理解与增强 Kimi Delta Attention 的表达能力

Hugging Face Daily Papers 论文

摘要

本文介绍了 Complex KDA,这是 Kimi Delta Attention 的增强版本,它结合了 delta规则变换与反射以实现更高的表达能力,在某些任务中优于 Transformers,同时保持效率,并提供开源代码和模型。

基于 delta规则的线性RNNs实现了高效的序列建模,但其带有低秩修正的线性更新限制了它们的表达能力。先前的研究表明,在单次循环更新中组合两个 delta规则转换可以模拟二维旋转,但这与单个转换相比,增加了秩和更新的成本。我们证明,Kimi Delta Attention (KDA) 可以通过将单个 delta规则变换与其通道门提供的第二个反射相结合来实现二维旋转。这需要通过组合两个现有的范围扩展来扩展 KDA 的参数范围:允许门在[-1,1]范围内,delta规则系数 β 在[0,2]范围内。我们将生成的模型称为 Complex KDA (CKDA)。它保持了 KDA 的稳定性和效率,转换仍然是对角加秩一和非扩张的,同时达到了 DeltaProduct_2 的状态跟踪表达能力。我们表征了 CKDA 的表达能力,并证明每个正交对角加秩一矩阵恰好是 CKDA 的转换矩阵。单个 CKDA 层可以跟踪每个同构于 SO(3) 子群的有限群,与许多其他对角加秩一的 Linear RNNs 相比,许多状态跟踪结果使用 CKDA 时减少了一层。在实验上,结合两种扩展在 S_3、S_4 和周期性音频续写中,在测试的 KDA 范围设置中产生了最强的长度外推能力。在语言建模中,CKDA 优于 Transformers 和其他线性RNNs,获得了与 KDA 基线相似的结果,并显示出有前景的缩放行为。我们的代码开源在 https://github.com/OpenEuroLLM/ComplexKDA,我们的模型可在 https://huggingface.co/collections/openeurollm/complexkda 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/22 15:29

论文页面 - 复杂KDA:理解并增强Kimi Delta注意力的表达能力

来源:https://huggingface.co/papers/2609.24797 作者:

,

,

,

,

,

,

,

,

,

,

摘要

基于Delta规则的线性RNN能够实现高效的序列建模,但其通过低秩修正进行的线性更新限制了其表达能力。先前的工作表明,在单一循环更新中组合两个Delta规则转变可以模拟二维旋转,但这会增加更新的秩和计算成本。我们发现,Kimi Delta注意力可以通过结合单个Delta规则变换及其通道级门控提供的第二次反射来实现二维旋转。这需要通过组合两个现有的范围扩展来扩展KDA的参数范围:允许门控值在[-1, 1]范围内,以及Delta规则系数β在[0, 2]范围内。我们将由此产生的模型称为复杂KDA。它保留了KDA的稳定性和效率,其转变保持对角加秩一且非扩张,同时达到了DeltaProduct_2的状态跟踪表达能力。我们描述了CKDA的表达能力,并证明每个正交对角加秩一矩阵恰好是一个CKDA转变矩阵。单个CKDA层可以跟踪每一个同构于SO(3)子群的有限群,并且与其它对角加秩一线性RNN相比,许多状态跟踪结果在CKDA上使用更少的一层。实验表明,在S_3、S_4和周期性音频续写任务上,结合两种扩展在测试的KDA范围设置中产生了最强的长度外推能力。在语言建模方面,CKDA优于Transformer和其他线性RNN,获得了与KDA基线相似的结果,并显示出有前景的缩放行为。我们的代码在https://github.com/OpenEuroLLM/ComplexKDA开源,模型可在https://huggingface.co/collections/openeurollm/complexkda获取。

查看arXiv页面 (https://arxiv.org/abs/2609.24797) 查看PDF (https://arxiv.org/pdf/2609.24797) GitHub1 (https://github.com/OpenEuroLLM/ComplexKDA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24797)

将此论文加载到您的代理中:

hf papers read 2609.24797

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型4

openeurollm/complex-kda-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 27 • 1 (https://huggingface.co/openeurollm/complex-kda-1.3B-100B)

openeurollm/kda-sigmoid-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 8 • 1 (https://huggingface.co/openeurollm/kda-sigmoid-1.3B-100B)

openeurollm/complex-kda-hybrid-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 8 • 1 (https://huggingface.co/openeurollm/complex-kda-hybrid-1.3B-100B)

openeurollm/kda-sigmoid-hybrid-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 13 • 1 (https://huggingface.co/openeurollm/kda-sigmoid-hybrid-1.3B-100B)

引用此论文的数据集0

没有数据集链接此论文

在数据集的README.md中引用arxiv.org/abs/2609.24797以从本页面链接它。

引用此论文的Spaces0

没有Space链接此论文

在Space的README.md中引用arxiv.org/abs/2609.24797以从本页面链接它。

包含此论文的合集1

相似文章

你也能提出Kimi Delta Attention

Hacker News Top

这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。

MoonshotAI/FlashKDA

GitHub Trending (daily)

FlashKDA 是一个基于 CUTLASS 构建的高性能 Kimi Delta Attention (KDA) 内核实现,专为 SM90+ GPU 优化,并与 flash-linear-attention 集成。