[R] 复杂KDA:理解与增强Kimi Delta Attention的表达能力
摘要
本文介绍了Complex KDA,这是对Kimi Delta Attention的增强,通过实现二维旋转和状态追踪能力,提高了线性RNN的表达能力,从而在长度外推和语言建模性能上取得了卓越表现。
Github: https://github.com/OpenEuroLLM/ComplexKDA HuggingFace: https://huggingface.co/collections/openeurollm/complexkda Arxiv: https://arxiv.org/abs/2609.24797 作者:Julien Siems*, Riccardo Grazzi*, Korbinian Pöppel*, Jaisidh Singh, Arber Zela, Timur Carstensen, Jenia Jitsev, Frank Hutter, Volkan Cevher, Antonio Orvieto, Aaron Klein(*同等贡献) 摘要:基于delta规则的线性RNN能够实现高效的序列建模,但其带有低秩校正的线性更新限制了其表达能力。先前的研究表明,在单次循环更新中组合两个delta规则转换可以建模二维旋转,但与单次转换相比,这会增加更新的秩和成本。我们证明,Kimi Delta Attention(KDA)可以通过将单次delta规则变换与通道级门控提供的第二次反射相结合,来实现二维旋转。这需要通过结合两个现有的范围扩展来扩展KDA的参数范围:允许门控值在[−1,1]范围内,以及delta规则系数β在[0,2]范围内。我们将得到的模型称为Complex KDA(CKDA)。它保持了KDA的稳定性和效率,转换仍然保持对角加秩一且非扩展,同时达到了DeltaProduct2的状态追踪表达能力。我们表征了CKDA的表达能力,并证明每个正交对角加秩一矩阵恰好是一个CKDA转换矩阵。单个CKDA层可以追踪每个与SO(3)子群同构的有限群,并且与许多其他对角加秩一线性RNN相比,许多状态追踪结果为CKDA少用一层。经验上,结合两种扩展在S3、S4和周期性音频延续测试中,在测试的KDA范围设置中产生了最强的长度外推能力。在语言建模中,CKDA优于Transformer和其他线性RNN,获得了与KDA基线相似的结果,并显示出有前景的扩展行为。 https://preview.redd.it/fjeysm4zn0rh1.png?width=2110&format=png&auto=webp&s=3d901f501e5ef7b0c72a5e5de3310d406bc8fec4
相似文章
Complex KDA:理解与增强 Kimi Delta Attention 的表达能力
本文介绍了 Complex KDA,这是 Kimi Delta Attention 的增强版本,它结合了 delta规则变换与反射以实现更高的表达能力,在某些任务中优于 Transformers,同时保持效率,并提供开源代码和模型。
你也能提出Kimi Delta Attention
这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。
Kimi-K3 技术报告 [pdf]
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
Kimi Linear: 一种富有表现力且高效的注意力架构
Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。
@nrehiew_: > LatentMoE > 896个专家中激活16个 > Kimi Delta Attention 和 AttnRes > 2.5倍更高效的扩展 这是……
讨论具有极端稀疏性(16/896专家)的LatentMoE架构以及Kimi Delta Attention,声称有2.5倍更高效的扩展,并猜测Kimi K3模型的能力。