MDN:通过并行化逐步动量优化 Delta 线性注意力

Hugging Face Daily Papers 论文

摘要

该论文介绍了动量 DeltaNet(MDN),一种线性注意力模型。它利用逐步动量和并行算法,在训练效率和性能上超越了 Mamba2 等模型。

线性注意力(LA)为大规模语言模型(LLM)处理长序列提供了一个有前景的范式,因为它避免了自注意力机制的二次复杂度。最近的 LA 模型(如 Mamba2 和 GDN)将线性递归解释为闭式在线随机梯度下降(SGD),但朴素的 SGD 更新在优化过程中容易遭受快速的信息衰减和次优收敛。虽然基于动量的优化器提供了一种自然的解决方案,但在同时实现训练效率和高效果方面面临挑战。为了解决这一问题,我们通过几何重排更新系数,开发了一种带有逐步动量规则的 LA 块级并行算法。此外,从动力系统的角度,我们将基于动量的递归分析为引入复共轭特征值的二阶系统。这一分析指导了稳定门控约束的设计。由此产生的模型——动量 DeltaNet(MDN)——利用 Triton 内核,实现了与 Mamba2 和 KDA 等竞争性线性模型相当的训练吞吐量。在 4 亿和 13 亿参数模型上的大量实验表明,MDN 在多样化的下游评估基准上,持续优于包括 Transformer、Mamba2 和 GDN 在内的强大基线模型。代码:https://github.com/HuuYuLong/MomentumDeltaNet。
查看原文
查看缓存全文

缓存时间: 2026/05/11 07:22

论文页面 - MDN:并行化 Delta Linear Attention 的分步动量

来源:https://huggingface.co/papers/2605.05838

摘要

线性注意力模型面临信息衰减和收敛方面的挑战,这些问题通过一种基于动量的方法得到解决,该方法在训练效率和性能上优于现有的 Mamba2 和 GDN 等模型。

线性注意力(Linear Attention, LA)通过避免自注意力(self-attention)的二次复杂度,为将大型语言模型(Large Language Models, LLMs)扩展到长序列提供了一种有前景的范式。最近的 LA 模型(如 Mamba2 和 GDN)将线性递归解释为封闭形式的在线随机梯度下降(Stochastic Gradient Descent, SGD),但朴素的 SGD 更新在优化过程中存在信息快速衰减和收敛次优的问题。虽然基于动量的优化器(momentum-based optimizers)提供了一种自然的补救措施,但在同时实现训练效率和有效性方面带来了挑战。为此,我们开发了一种针对 LA 的块级并行算法,并通过几何重排更新系数实现了分步动量规则。此外,从动力系统(dynamical systems)的角度,我们将基于动量的递归分析为一个二阶系统,该系统引入了复共轭特征值(complex conjugate eigenvalues)。这一分析指导了稳定门控约束(gating constraints)的设计。所得到的模型——动量 DeltaNet(Momentum DeltaNet, MDN),利用 Triton 内核(Triton kernels)实现了与 Mamba2 和 KDA 等竞争性线性模型相当的训练吞吐量。在 400M 和 1.3B 参数模型上的大量实验表明,MDN 在多种下游评估基准上始终优于强大的基线模型,包括 Transformer、Mamba2 和 GDN。代码:https://github.com/HuuYuLong/MomentumDeltaNet。

查看 arXiv 页面 (https://arxiv.org/abs/2605.05838) 查看 PDF (https://arxiv.org/pdf/2605.05838) GitHub2 (https://github.com/HuuYuLong/MomentumDeltaNet) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.05838)

在您的 agent 中获取此论文:

hf papers read 2605.05838

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有链接到此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.05838 即可从本页链接。

引用此论文的数据集 0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.05838 即可从本页链接。

引用此论文的 Spaces 0

没有链接到此论文的 Space

在 Space README.md 中引用 arxiv.org/abs/2605.05838 即可从本页链接。

包含此论文的合集 1

相似文章

动态线性注意力

arXiv cs.CL

本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。

Retrofitting Linear Attention into Diffusion Language Models

arXiv cs.LG

This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.

Dynamic Linear Attention

Hugging Face Daily Papers

DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。

你也能提出Kimi Delta Attention

Hacker News Top

这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。