Complex KDA:理解与增强 Kimi Delta Attention 的表达能力
摘要
本文介绍了 Complex KDA,这是 Kimi Delta Attention 的增强版本,它结合了 delta规则变换与反射以实现更高的表达能力,在某些任务中优于 Transformers,同时保持效率,并提供开源代码和模型。
查看缓存全文
缓存时间: 2026/09/22 15:29
论文页面 - 复杂KDA:理解并增强Kimi Delta注意力的表达能力
来源:https://huggingface.co/papers/2609.24797 作者:
,
,
,
,
,
,
,
,
,
,
摘要
基于Delta规则的线性RNN能够实现高效的序列建模,但其通过低秩修正进行的线性更新限制了其表达能力。先前的工作表明,在单一循环更新中组合两个Delta规则转变可以模拟二维旋转,但这会增加更新的秩和计算成本。我们发现,Kimi Delta注意力可以通过结合单个Delta规则变换及其通道级门控提供的第二次反射来实现二维旋转。这需要通过组合两个现有的范围扩展来扩展KDA的参数范围:允许门控值在[-1, 1]范围内,以及Delta规则系数β在[0, 2]范围内。我们将由此产生的模型称为复杂KDA。它保留了KDA的稳定性和效率,其转变保持对角加秩一且非扩张,同时达到了DeltaProduct_2的状态跟踪表达能力。我们描述了CKDA的表达能力,并证明每个正交对角加秩一矩阵恰好是一个CKDA转变矩阵。单个CKDA层可以跟踪每一个同构于SO(3)子群的有限群,并且与其它对角加秩一线性RNN相比,许多状态跟踪结果在CKDA上使用更少的一层。实验表明,在S_3、S_4和周期性音频续写任务上,结合两种扩展在测试的KDA范围设置中产生了最强的长度外推能力。在语言建模方面,CKDA优于Transformer和其他线性RNN,获得了与KDA基线相似的结果,并显示出有前景的缩放行为。我们的代码在https://github.com/OpenEuroLLM/ComplexKDA开源,模型可在https://huggingface.co/collections/openeurollm/complexkda获取。
查看arXiv页面 (https://arxiv.org/abs/2609.24797) 查看PDF (https://arxiv.org/pdf/2609.24797) GitHub1 (https://github.com/OpenEuroLLM/ComplexKDA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.24797)
将此论文加载到您的代理中:
hf papers read 2609.24797
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型4
openeurollm/complex-kda-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 27 • 1 (https://huggingface.co/openeurollm/complex-kda-1.3B-100B)
openeurollm/kda-sigmoid-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 8 • 1 (https://huggingface.co/openeurollm/kda-sigmoid-1.3B-100B)
openeurollm/complex-kda-hybrid-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 8 • 1 (https://huggingface.co/openeurollm/complex-kda-hybrid-1.3B-100B)
openeurollm/kda-sigmoid-hybrid-1.3B-100B 文本生成• 1B• 更新于约5小时前 • 13 • 1 (https://huggingface.co/openeurollm/kda-sigmoid-hybrid-1.3B-100B)
引用此论文的数据集0
没有数据集链接此论文
在数据集的README.md中引用arxiv.org/abs/2609.24797以从本页面链接它。
引用此论文的Spaces0
没有Space链接此论文
在Space的README.md中引用arxiv.org/abs/2609.24797以从本页面链接它。
包含此论文的合集1
相似文章
[R] 复杂KDA:理解与增强Kimi Delta Attention的表达能力
本文介绍了Complex KDA,这是对Kimi Delta Attention的增强,通过实现二维旋转和状态追踪能力,提高了线性RNN的表达能力,从而在长度外推和语言建模性能上取得了卓越表现。
你也能提出Kimi Delta Attention
这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。
Kimi-K3 技术报告 [pdf]
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
MoonshotAI/FlashKDA
FlashKDA 是一个基于 CUTLASS 构建的高性能 Kimi Delta Attention (KDA) 内核实现,专为 SM90+ GPU 优化,并与 flash-linear-attention 集成。
Kimi Linear: 一种富有表现力且高效的注意力架构
Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。