Exact Linear Attention
摘要
本文介绍了一种名为Exact Linear Attention (ELA) 的机制,该机制通过利用核函数分解,在不引入近似误差的情况下实现了Transformer注意力的线性计算复杂度,并通过约束核函数解决了梯度爆炸和词元稀释问题。文中还提出了包括超链接(Hyper Link)、记忆叶(Memory Lobe)以及面向混合专家模型的路由偏置在内的工程创新。
arXiv:2605.18848v1 公告类型: 新论文
摘要: 本文介绍了Exact Linear Attention (ELA),一种利用核函数精确分解性质实现Transformer注意力线性计算复杂度、且无任何近似误差的机制。通过施加确保非负性、可辨别性和几何可解释性的核约束,该方法识别并解决了先前线性注意力方法中的梯度爆炸和词元注意力稀释问题。文中提出了多种核函数,包括哈达玛指数核(Hadamard Exp Kernel)、求和平方欧氏距离核(Summation Squared Euclidean Distance Kernel)和差分平方欧氏距离核(Subtraction Squared Euclidean Distance Kernel)。在核心注意力公式之外,本文还提出了三项工程创新:一种替代传统残差连接以缓解梯度退化的超链接(Hyper Link)结构;一种基于双向线性注意力的记忆叶(Memory Lobe)模块,可跨层捕获变换流以实现定性记忆和隐式强化学习范式;以及一种面向混合专家模型的路由分数偏置机制,以提升可解释性和语义对齐。
相似文章
动态线性注意力
本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。
变分线性注意力:用于长上下文 Transformer 的稳定联想记忆
本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。
Flexformer:具有可学习注意力核的灵活线性Transformer
Flexformer提出了一种灵活的线性Transformer,使用随机傅里叶特征实现完全可学习的注意力核,在语言建模和序列分类任务中达到线性复杂度,同时匹配或超越softmax注意力的性能。
Kimi Linear: 一种富有表现力且高效的注意力架构
Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。
Dynamic Linear Attention
DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。