Dynamic Linear Attention
摘要
DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。
查看缓存全文
缓存时间: 2026/06/10 05:45
论文页面 - Dynamic Linear Attention
来源:https://huggingface.co/papers/2606.10650
摘要
DLA通过引入自适应状态合并和容量受限的记忆建模,改进了多状态线性注意力机制,解决了长上下文大语言模型中的局限性。
大语言模型(https://huggingface.co/papers?q=Large%20Language%20Models)在长上下文场景下的可扩展性从根本上受限于标准注意力(https://huggingface.co/papers?q=standard%20attention)的二次复杂度,这促使人们采用具有次二次成本的线性注意力机制(https://huggingface.co/papers?q=linear%20attention%20mechanisms)。为了提升长上下文下的表示能力,近期方法以多状态方式组织记忆。然而,现有的多状态线性注意力(https://huggingface.co/papers?q=multi-state%20linear%20attention)方法依赖于固定的状态合并策略,无法适应动态变化的token重要性(https://huggingface.co/papers?q=token%20importance),导致关键token被不可逆地掩盖,并在长序列中引发严重的误差累积。为解决这一问题,我们提出了DLA,一种针对多状态线性注意力(https://huggingface.co/papers?q=multi-state%20linear%20attention)的动态记忆建模框架。DLA引入了:(i) 信息感知动态状态合并(https://huggingface.co/papers?q=Information-Aware%20Dynamic%20State%20Merging),它根据token级别的信息变化自适应地确定状态边界,在语义转换附近保留高分辨率表示,同时主动压缩稳定区域;(ii) 容量受限记忆建模(https://huggingface.co/papers?q=Capacity-Bounded%20Memory%20Modeling),通过选择性地合并相邻的低信息状态,维持一个固定大小、按时间顺序排列的状态缓存,从而以最小信息损失控制记忆增长。我们在两种不同的线性注意力模型上预训练了DLA,并在三大类共16个数据集上进行了评估。实验结果表明,DLA优于当前最先进的方法。
查看arXiv页面(https://arxiv.org/abs/2606.10650)查看PDF(https://arxiv.org/pdf/2606.10650)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.10650)
在你的智能体中获取这篇论文:
hf papers read 2606.10650
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.10650 即可从此页面链接。
引用该论文的数据集0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.10650 即可从此页面链接。
引用该论文的Spaces0
暂无Space链接此论文
在Space README.md 中引用 arxiv.org/abs/2606.10650 即可从此页面链接。
包含该论文的合集0
暂无合集包含此论文
将这篇论文添加到合集(https://huggingface.co/new-collection)中即可从此页面链接。
相似文章
动态线性注意力
本文提出DLA,一种用于多状态线性注意力的动态内存建模框架,它能根据令牌信息变化自适应地合并状态,并维护固定大小的状态缓存,从而在无需标准注意力二次复杂度的前提下实现更好的长上下文表示。
变分线性注意力:用于长上下文 Transformer 的稳定联想记忆
本文介绍了变分线性注意力(VLA),这是一种用于稳定长上下文 Transformer 中线性注意力机制记忆状态的方法。VLA 将记忆更新重构为在线正则化最小二乘问题,证明了状态范数的有界性,并展示了相较于标准线性注意力和 DeltaNet 显著的速度提升以及更高的检索准确性。
内存
解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。
内存管理的长上下文注意力:可编辑请求本地内存的初步研究
本文研究了内存管理的长上下文注意力,这是一个将高效状态压缩与显式可编辑内存槽分开的研究方向。实验表明,结合快速循环/稀疏主干网络与显式内存管理的混合方法,在合成任务和长上下文基准测试中均优于纯固定状态或纯稀疏方法。
GLIDE: 引导的逐层混合注意力实现高效LLM推理
GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。