滑动窗口优于线性注意力

Hugging Face Daily Papers 论文

摘要

带有sink的滑动窗口注意力在长上下文任务上优于经过后训练的线性注意力,无需重新训练,为LLMs提供更便宜、更可靠的推理解决方案。

由于二次注意力的性质,大型语言模型消耗大量内存和能源。每个新token的成本都比前一个更高。每个额外的token都必须无限期存储在内存中,这是不可持续的。为了解决二次扩展问题,已经提出了几种替代方案,其中之一是改造LLMs以使用线性注意力。这个想法吸引了大量关注,因为它有望以低成本实现最先进的性能来解决二次扩展问题。然而,这条研究路线尚未与更简单的基线进行适当比较。在这项工作中,我们表明带有sink的滑动窗口注意力在性能上与经过后训练的线性注意力模型相当或更好。我们在多个LLMs的各种下游任务中观察到了这一点。对于长上下文推理任务(Needle-in-a-Haystack和BABILong),SWA实现了大幅更高的性能(比线性注意力高2到10倍)。SWA无需后训练,速度极快,且内存需求低;因此,它是一个极其便宜和可靠的解决方案。为了减少推理内存成本,我们强烈建议改用SWA而不是后训练线性模型。线性注意力模型可能显示出一些前景,但它们可能需要从头开始训练或进行大量后训练才能匹配SWA。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:59

论文页面 - 滑动窗口机制超越线性注意力

来源:https://huggingface.co/papers/2608.28444

摘要

带有sink token的滑动窗口注意力机制在长上下文任务中无需重新训练即可超越经过后训练的线性注意力,提供了一种更低成本、更可靠的推理解决方案。

由于二次注意力(https://huggingface.co/papers?q=quadratic%20attention)的特性,大型语言模型(LLMs)消耗大量内存和能耗。生成每个新token的成本都高于前一个:每增加一个token,其键值对必须永久存储在内存中,这种模式难以持续。学界已提出多种替代方案来解决二次复杂度问题,其中之一是将LLMs改造为使用线性注意力(https://huggingface.co/papers?q=Linear%20Attention)。鉴于该方案有望以低成本实现接近最优性能的复杂度解决方案,这一研究方向备受关注。然而,该路线尚未与更简单的基线方案进行充分对比。本研究表明,带sink token的滑动窗口注意力(SWA,https://huggingface.co/papers?q=Sliding%20Window%20Attention)在性能上达到甚至超越经过后训练的线性注意力(https://huggingface.co/papers?q=Linear%20Attention)模型。我们在多种LLM架构和下游任务中观察到这一现象。在长上下文推理(https://huggingface.co/papers?q=long-context%20reasoning)任务(大海捞针(https://huggingface.co/papers?q=Needle-in-a-Haystack)与BABILong(https://huggingface.co/papers?q=BABILong))中,SWA实现了显著性能提升(比线性注意力(https://huggingface.co/papers?q=linear%20attention)高2至10倍)。SWA无需后训练、速度极快且内存占用低,因此是极其经济可靠的解决方案。为降低推理内存成本,我们强烈建议采用SWA替代线性模型后训练方案。线性注意力(https://huggingface.co/papers?q=Linear%20attention)模型虽展现一定潜力,但可能需要从头训练或大量后训练才能达到SWA的基本水平。

查看arXiv页面(https://arxiv.org/abs/2608.28444)查看PDF(https://arxiv.org/pdf/2608.28444)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.28444)

在智能体中获取本论文:

hf papers read 2608\.28444

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

暂无模型链接本文

在模型README.md中引用 arxiv.org/abs/2608.28444 以从本页建立链接。

引用本文的数据集0

暂无数据集链接本文

在数据集README.md中引用 arxiv.org/abs/2608.28444 以从本页建立链接。

引用本文的Spaces0

暂无Space链接本文

在Space README.md中引用 arxiv.org/abs/2608.28444 以从本页建立链接。

包含本文的合集1

相似文章

在推理阶段为预训练大语言模型应用滑动窗口注意力 [P]

Reddit r/MachineLearning

本项目为 Hugging Face 预训练大语言模型实现了一个可复用的滑动窗口注意力推理层,利用带 attention sinks 的受限 KV 缓存,显著降低显存占用并加快解码速度。在 Qwen2.5-7B 上的测试表明,16K 上下文下显存从约 923 MB 降至约 3.5 MB,不过依赖远距离上下文的任务可能会出现性能下降。

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

@seclink: https://x.com/seclink/status/2072187033263784397

X AI KOLs Timeline

Hybrid Sliding Window Attention (Hybrid SWA) 是一种在长文本语言模型中平衡计算效率与全局长距离依赖的混合注意力机制,通过交替使用局部SWA层和全局注意力层,显著压缩KV Cache同时保持推理能力。文章详细介绍了其设计原理、在Gemma、Qwen等模型中的应用,以及vLLM和HuggingFace等开源项目中的最佳实践。