滑动窗口优于线性注意力
摘要
带有sink的滑动窗口注意力在长上下文任务上优于经过后训练的线性注意力,无需重新训练,为LLMs提供更便宜、更可靠的推理解决方案。
查看缓存全文
缓存时间: 2026/09/01 11:59
论文页面 - 滑动窗口机制超越线性注意力
来源:https://huggingface.co/papers/2608.28444
摘要
带有sink token的滑动窗口注意力机制在长上下文任务中无需重新训练即可超越经过后训练的线性注意力,提供了一种更低成本、更可靠的推理解决方案。
由于二次注意力(https://huggingface.co/papers?q=quadratic%20attention)的特性,大型语言模型(LLMs)消耗大量内存和能耗。生成每个新token的成本都高于前一个:每增加一个token,其键值对必须永久存储在内存中,这种模式难以持续。学界已提出多种替代方案来解决二次复杂度问题,其中之一是将LLMs改造为使用线性注意力(https://huggingface.co/papers?q=Linear%20Attention)。鉴于该方案有望以低成本实现接近最优性能的复杂度解决方案,这一研究方向备受关注。然而,该路线尚未与更简单的基线方案进行充分对比。本研究表明,带sink token的滑动窗口注意力(SWA,https://huggingface.co/papers?q=Sliding%20Window%20Attention)在性能上达到甚至超越经过后训练的线性注意力(https://huggingface.co/papers?q=Linear%20Attention)模型。我们在多种LLM架构和下游任务中观察到这一现象。在长上下文推理(https://huggingface.co/papers?q=long-context%20reasoning)任务(大海捞针(https://huggingface.co/papers?q=Needle-in-a-Haystack)与BABILong(https://huggingface.co/papers?q=BABILong))中,SWA实现了显著性能提升(比线性注意力(https://huggingface.co/papers?q=linear%20attention)高2至10倍)。SWA无需后训练、速度极快且内存占用低,因此是极其经济可靠的解决方案。为降低推理内存成本,我们强烈建议采用SWA替代线性模型后训练方案。线性注意力(https://huggingface.co/papers?q=Linear%20attention)模型虽展现一定潜力,但可能需要从头训练或大量后训练才能达到SWA的基本水平。
查看arXiv页面(https://arxiv.org/abs/2608.28444)查看PDF(https://arxiv.org/pdf/2608.28444)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.28444)
在智能体中获取本论文:
hf papers read 2608\.28444
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接本文
在模型README.md中引用 arxiv.org/abs/2608.28444 以从本页建立链接。
引用本文的数据集0
暂无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2608.28444 以从本页建立链接。
引用本文的Spaces0
暂无Space链接本文
在Space README.md中引用 arxiv.org/abs/2608.28444 以从本页建立链接。
包含本文的合集1
相似文章
在推理阶段为预训练大语言模型应用滑动窗口注意力 [P]
本项目为 Hugging Face 预训练大语言模型实现了一个可复用的滑动窗口注意力推理层,利用带 attention sinks 的受限 KV 缓存,显著降低显存占用并加快解码速度。在 Qwen2.5-7B 上的测试表明,16K 上下文下显存从约 923 MB 降至约 3.5 MB,不过依赖远距离上下文的任务可能会出现性能下降。
无需训练的滑动窗口适配中NLL引导的全注意力层选择
提出了一种无需训练的NLL引导方法,用于在混合注意力模型中选择保留全注意力的层,在长上下文任务中,使用1/4全注意力层即可达到与1/2周期性基线相当的准确率。
GLIDE: 引导的逐层混合注意力实现高效LLM推理
GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。
架构感知的强化学习使滑动窗口注意力在数学推理中具有竞争力
本文介绍 SWARR,一种两阶段方案,结合监督微调和强化学习,使滑动窗口注意力模型适应数学推理,表明强化学习能缩小其与自注意力的性能差距,同时保持效率优势。
@seclink: https://x.com/seclink/status/2072187033263784397
Hybrid Sliding Window Attention (Hybrid SWA) 是一种在长文本语言模型中平衡计算效率与全局长距离依赖的混合注意力机制,通过交替使用局部SWA层和全局注意力层,显著压缩KV Cache同时保持推理能力。文章详细介绍了其设计原理、在Gemma、Qwen等模型中的应用,以及vLLM和HuggingFace等开源项目中的最佳实践。