MDN:通过并行化逐步动量优化 Delta 线性注意力
摘要
该论文介绍了动量 DeltaNet(MDN),一种线性注意力模型。它利用逐步动量和并行算法,在训练效率和性能上超越了 Mamba2 等模型。
查看缓存全文
缓存时间: 2026/05/11 07:22
论文页面 - MDN:并行化 Delta Linear Attention 的分步动量
来源:https://huggingface.co/papers/2605.05838
摘要
线性注意力模型面临信息衰减和收敛方面的挑战,这些问题通过一种基于动量的方法得到解决,该方法在训练效率和性能上优于现有的 Mamba2 和 GDN 等模型。
线性注意力(Linear Attention, LA)通过避免自注意力(self-attention)的二次复杂度,为将大型语言模型(Large Language Models, LLMs)扩展到长序列提供了一种有前景的范式。最近的 LA 模型(如 Mamba2 和 GDN)将线性递归解释为封闭形式的在线随机梯度下降(Stochastic Gradient Descent, SGD),但朴素的 SGD 更新在优化过程中存在信息快速衰减和收敛次优的问题。虽然基于动量的优化器(momentum-based optimizers)提供了一种自然的补救措施,但在同时实现训练效率和有效性方面带来了挑战。为此,我们开发了一种针对 LA 的块级并行算法,并通过几何重排更新系数实现了分步动量规则。此外,从动力系统(dynamical systems)的角度,我们将基于动量的递归分析为一个二阶系统,该系统引入了复共轭特征值(complex conjugate eigenvalues)。这一分析指导了稳定门控约束(gating constraints)的设计。所得到的模型——动量 DeltaNet(Momentum DeltaNet, MDN),利用 Triton 内核(Triton kernels)实现了与 Mamba2 和 KDA 等竞争性线性模型相当的训练吞吐量。在 400M 和 1.3B 参数模型上的大量实验表明,MDN 在多种下游评估基准上始终优于强大的基线模型,包括 Transformer、Mamba2 和 GDN。代码:https://github.com/HuuYuLong/MomentumDeltaNet。
查看 arXiv 页面 (https://arxiv.org/abs/2605.05838) 查看 PDF (https://arxiv.org/pdf/2605.05838) GitHub2 (https://github.com/HuuYuLong/MomentumDeltaNet) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.05838)
在您的 agent 中获取此论文:
hf papers read 2605.05838
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有链接到此论文的模型
在模型 README.md 中引用 arxiv.org/abs/2605.05838 即可从本页链接。
引用此论文的数据集 0
没有链接到此论文的数据集
在数据集 README.md 中引用 arxiv.org/abs/2605.05838 即可从本页链接。
引用此论文的 Spaces 0
没有链接到此论文的 Space
在 Space README.md 中引用 arxiv.org/abs/2605.05838 即可从本页链接。
包含此论文的合集 1
相似文章
动量作为深度学习优化中残差驱动的乘子校正
本文介绍了一个受ADMM启发的动量框架(AIM)和一个新的优化器RADAR,从理论上将动量解释为残差驱动的乘子校正,实验表明在强自适应基线上取得了持续改进。
动态线性注意力
本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。
Retrofitting Linear Attention into Diffusion Language Models
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
Dynamic Linear Attention
DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。
你也能提出Kimi Delta Attention
这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。