无需训练的滑动窗口适配中NLL引导的全注意力层选择

arXiv cs.CL 论文

摘要

提出了一种无需训练的NLL引导方法,用于在混合注意力模型中选择保留全注意力的层,在长上下文任务中,使用1/4全注意力层即可达到与1/2周期性基线相当的准确率。

arXiv:2606.27791v1 公告类型:新 摘要:混合注意力模型在层间混合使用全注意力和滑动窗口注意力,为高效的长上下文推理提供了一种有前景的方法,但关键问题——\emph{哪些层}应该保留全注意力——仍未解决。现有方法要么使用固定周期性模式,要么使用基于注意力的启发式方法,这些方法可能无法捕捉对下游准确性至关重要的因素。我们提出了一种无需训练的NLL引导层选择方法,该方法通过计算当某层使用滑动窗口注意力而非全注意力时答案标记的负对数似然退化量,直接衡量每层的重要性。在LongMemEval上使用Qwen3-4B,我们的方法仅使用1/4的全注意力层就达到了64.6%的准确率,与使用1/2全注意力的周期性基线(65.0%)相当,同时将计算预算减半。NLL引导选择比SWAA报告的周期性1/4全注意力基线高出10.4个百分点,比匹配的LightTransfer风格基线高出26.4个百分点。去混杂分析表明,该信号与长程注意力需求一致,而非通用层敏感性。该方法只需约15分钟的一次性校准,推进了长上下文LLM部署的效率-准确率帕累托前沿。
查看原文
查看缓存全文

缓存时间: 2026/06/29 05:24

# NLL引导的全注意力层选择用于免训练滑动窗口适配
来源:https://arxiv.org/html/2606.27791
FARS, 唐琼222同等贡献;人类作者按字母顺序排列。, 胡湘坤222同等贡献;人类作者按字母顺序排列。, 刘向阳222同等贡献;人类作者按字母顺序排列。, 陈一然222同等贡献;人类作者按字母顺序排列。, 邵云帆222同等贡献;人类作者按字母顺序排列。 Analemma fars@analemma\.ai

###### 摘要

混合全注意力和滑动窗口注意力的混合注意力模型在高效长上下文推理方面提供了一种有前景的方法,但关键问题在于**哪些层**应保留全注意力仍未解决。现有方法要么使用固定的周期性模式,要么使用基于注意力的启发式方法,这些方法可能无法捕捉对下游精度至关重要的因素。我们提出NLL引导的层选择,这是一种免训练方法,通过计算当某层使用滑动窗口注意力而非全注意力时,答案令牌上的负对数似然(NLL)下降来直接衡量每层的重要性。在LongMemEval上使用Qwen3-4B模型,我们的方法仅使用1/4的全注意力层就达到了64.6%的准确率,与1/2全注意力(FA)周期性基线(65.0%)相当,同时将计算预算减半。NLL引导的选择相比SWAA报告的周期性1/4-FA基线高出10.4个百分点,相比匹配的LightTransfer风格基线高出26.4个百分点。去混杂分析表明,该信号与长距离注意力需求一致,而非普通的层敏感性。该方法仅需要约~15分钟的一次性校准,推进了长上下文LLM部署的效率-精度帕累托前沿。

> 披露声明:本文由FARS(全自动化研究系统)111https://analemma.ai/fars/ 自主完成构思、文献综述、实验设计与执行、结果分析及稿件撰写。附带的代码已公开。222https://gitlab.com/fars-a/nll-guided-swaa-layer-selection 人类作者贡献了审阅和较小的编辑修订。他们已验证了所有引用参考文献的真实性,并确认所有报告的实验结果均源自实际的代码执行。读者应注意,本文的措辞和呈现方式主要由机器生成,可能不完全符合人类作者作品的标准。

## 1 引言

大型语言模型(LLM)越来越多地部署在长上下文任务上,例如检索增强生成、多文档问答以及具有扩展记忆的对话代理(Wang等,2024 (https://arxiv.org/html/2606.27791#bib.bib15))。然而,标准Transformer自注意力(Vaswani等,2017 (https://arxiv.org/html/2606.27791#bib.bib1))的平方复杂度使得处理长提示计算成本高昂,从而在模型能力和部署效率之间造成了根本性紧张。

几种方法应对了这一挑战。高效的注意力机制,如稀疏模式(Beltagy等,2020 (https://arxiv.org/html/2606.27791#bib.bib2);Zaheer等,2020 (https://arxiv.org/html/2606.27791#bib.bib3))和线性近似,降低了复杂度,但应用于使用全注意力预训练的模型时往往会降低质量。KV缓存压缩方法(Zhang等,2023 (https://arxiv.org/html/2606.27791#bib.bib6);Xiao等,2024 (https://arxiv.org/html/2606.27791#bib.bib10))减少了内存需求,但对预填充计算的影响有限。混合注意力方法提供了一个有前景的中间地带:SWAA(Yu等,2025 (https://arxiv.org/html/2606.27791#bib.bib12))证明,预训练的全注意力模型可以通过在预填充期间使用滑动窗口注意力(SWA),并结合全注意力解码和战略性层选择,以适应质量损失最小化。

一个关键问题仍然存在:**哪些层应保留全注意力?** 现有方法要么使用固定的周期性模式(忽略层特定角色),要么使用基于注意力的启发式方法,如LightTransfer(Zhang等,2025 (https://arxiv.org/html/2606.27791#bib.bib13)),该方法依赖间接信号,可能无法捕捉对下游精度至关重要的因素。层的选择极大地影响性能——在Qwen3-4B上,良好和不良的1/4-FA层选择之间的差距超过26个百分点。

我们提出**NLL引导的层选择**,这是一种原则性方法,直接衡量我们关心的问题:当我们限制某层的注意力时,其输出质量下降了多少?通过计算在不同注意力配置下答案令牌上的负对数似然(NLL),我们识别出那些真正需要全注意力以实现长距离信息流的层。我们的贡献是:

- • 我们引入了NLL引导的层选择,这是一种免训练方法,用于识别在混合滑动窗口模型中哪些层应保留全注意力。
- • 我们证明NLL引导的1/4-FA在LongMemEval上达到了64.6%的准确率,与1/2-FA周期性基线(65.0%)相当,同时将全注意力预算减半,并比SWAA报告的周期性1/4-FA基线高出10.4个百分点。
- • 我们通过长提示与短提示校准提供了去混杂证据,表明NLL信号对于长距离注意力需求是特定的(长提示与短提示排序之间的Spearman ρ=0.306),而非普遍的层敏感性。
- • 我们展示了该方法在部署中的实用性:在4块GPU上校准仅需约~15分钟,并在约~1,354次24k长度提示的推理请求后摊销。

## 2 相关工作

### 2.1 高效注意力机制

自注意力(Vaswani等,2017 (https://arxiv.org/html/2606.27791#bib.bib1))的平方复杂度激发了对高效替代方案的广泛研究。稀疏注意力模式,例如Longformer(Beltagy等,2020 (https://arxiv.org/html/2606.27791#bib.bib2))和BigBird(Zaheer等,2020 (https://arxiv.org/html/2606.27791#bib.bib3))中的模式,通过将注意力限制在局部窗口并结合全局令牌来降低复杂度。线性注意力变体用核函数近似softmax注意力,实现了线性复杂度,但常常以质量下降为代价。FlashAttention(Dao,2024 (https://arxiv.org/html/2606.27791#bib.bib4))和PagedAttention(Kwon等,2023 (https://arxiv.org/html/2606.27791#bib.bib5))通过内存感知计算提高实现效率,而不改变注意力机制本身。TCA-Attention(You等,2025 (https://arxiv.org/html/2606.27791#bib.bib18))校准头部特定的令牌稀疏预算,并在线选择信息性令牌。这些方法在所有层上统一或令牌/头部级别修改注意力计算,而我们的工作则根据测量到的重要性,有选择地将不同的注意力模式应用于不同层。

### 2.2 KV缓存压缩

对于自回归生成,KV缓存内存在长上下文长度下成为瓶颈。H2O(Zhang等,2023 (https://arxiv.org/html/2606.27791#bib.bib6))识别出获得不成比例注意力的“重击”令牌,并仅在缓存中保留这些令牌。SnapKV(Li等,2024 (https://arxiv.org/html/2606.27791#bib.bib7))通过聚类相似的键值对来压缩KV缓存。Quest(Tang等,2024 (https://arxiv.org/html/2606.27791#bib.bib8))引入了查询感知的稀疏性,动态选择每个查询相关的KV条目。MInference(Jiang等,2024 (https://arxiv.org/html/2606.27791#bib.bib9))通过动态稀疏注意力模式加速预填充。StreamingLLM(Xiao等,2024 (https://arxiv.org/html/2606.27791#bib.bib10))通过在滑动窗口旁维护注意力汇聚点来实现无限长生成。这些方法与我们的方法正交,并且可以与混合注意力结合以获得额外的效率提升。

### 2.3 混合注意力模型

最近的研究探索了在同一模型内混合全注意力和局部注意力。Gemma 2(Team等,2024 (https://arxiv.org/html/2606.27791#bib.bib11))以预训练期间确定的固定模式在局部滑动窗口和全局注意力层之间交替。SWAA(Yu等,2025 (https://arxiv.org/html/2606.27791#bib.bib12))证明,预训练的全注意力模型可以在推理时无需重新训练而适应使用滑动窗口注意力,采用周期性层选择模式。LightTransfer(Zhang等,2025 (https://arxiv.org/html/2606.27791#bib.bib13))提出了基于注意力的启发式方法(“懒惰比率”)来选择哪些层应保留全注意力。然而,这些方法要么使用忽略层特定角色的固定模式,要么依赖可能无法捕捉对下游精度至关重要的因素的间接信号。我们的NLL引导方法直接衡量每个层对注意力限制的敏感性,提供了一个原则性的选择标准。

### 2.4 混合模型的知识蒸馏

Li等(2025 (https://arxiv.org/html/2606.27791#bib.bib14))提出了KL引导的层选择,用于将全注意力模型蒸馏到混合架构中,使用教师和学生输出之间的KL散度来识别关键层。虽然在概念上相关,但他们的方法需要训练一个学生模型,而我们的方法完全是免训练的,并且可以通过一次性校准过程应用于任何预训练Transformer。

## 3 方法

我们提出NLL引导的层选择,用于免训练滑动窗口注意力适配。我们的方法通过直接衡量对答案预测质量的影响,来识别哪些层在预填充期间最受益于全注意力。图1 (https://arxiv.org/html/2606.27791#S3.F1)展示了整体框架。

参考图注图1:用于SWAA的NLL引导全注意力层选择概述。该方法使用答案令牌上的教师强制NLL来评分每层对滑动窗口注意力的敏感性,然后在推理时为具有最高下降的前 k 个层选择全注意力。

### 3.1 问题公式化

考虑一个具有 L 层的Transformer,部署了滑动窗口注意力适配(SWAA)(Yu等,2025 (https://arxiv.org/html/2606.27791#bib.bib12))。在预填充期间,每一层可以使用全注意力(FA)或滑动窗口注意力(SWA)。给定一个预算 k,表示在预填充期间可能使用全注意力的层数,我们寻求选择满足 |S|=k 的集合 S ⊆ {0,...,L−1},以最大化下游任务准确率。遵循SWAA,我们假设启用了全注意力解码,这意味着所有层在生成期间都使用全注意力,无论其预填充配置如何。

### 3.2 NLL引导的层评分

我们的关键洞察是,每层全注意力的重要性可以通过它提高模型预测答案令牌的能力来衡量。对于一个由提示 x_{1:m} 和答案 y_{1:n} 组成的输入,我们将每层的分数定义为在预填充期间该层使用全注意力而非SWA时,答案令牌上负对数似然(NLL)的降低。

形式上,令 L_ans(·) 表示在给定注意力配置下答案令牌的平均NLL。对于每层 ℓ,我们计算:

Δ_ℓ = L_ans(SWA at layer ℓ) − L_ans(FA at layer ℓ),    (1)

其中所有其他层在预填充期间使用SWA。较大的 Δ_ℓ 表明层 ℓ 更受益于全注意力,以实现从提示到答案的长距离信息流。

这种评分使用教师强制,只需要前向传递而无需生成。评分期间的注意力配置与推理匹配:SWA仅应用于提示令牌,而答案令牌始终关注完整上下文(模拟全注意力解码)。

### 3.3 层选择

给定在校准集上平均的每层分数 {Δ_ℓ}_{ℓ=0}^{L−1},我们按 Δ_ℓ 选择前 k 个层以形成全注意力集 S。这种贪婪选择简单有效;我们发现选定的层自然地分布在早期、中期和晚期深度,无需显式分层约束。

### 3.4 校准与推理

校准过程需要一小组长上下文示例(我们使用64个示例,提示令牌长度为16k–32k)。对于每个示例,我们执行 L+1 次前向传递:一次基线传递(所有层使用SWA),加上每层一次传递(将该层切换为FA)。对于36层模型,整个校准时间约为15分钟(使用4块GPU),无需梯度计算。

一旦校准完成,选定的层集 S 将在所有后续推理中固定。在部署期间,S 中的层在预填充期间使用全注意力,而其他层使用SWA。所有层在解码期间使用全注意力,遵循SWAA协议。这种一次性校准成本迅速摊销:在24k提示长度下,盈亏平衡点大约为1,354次推理请求。实现细节见附录A (https://arxiv.org/html/2606.27791#A1)。

## 4 实验

### 4.1 实验设置

我们在Qwen3-4B-Thinking-2507333https://huggingface.co/Qwen/Qwen3-4B-Thinking-2507(Yang等,2025 (https://arxiv.org/html/2606.27791#bib.bib17))——一个36层模型上评估NLL引导的层选择,使用LongMemEval基准(Wu等,2025 (https://arxiv.org/html/2606.27791#bib.bib16))。LongMemEval通过500个样本测试长期对话记忆,涵盖六个任务类型:知识更新、多会话、单会话助手、单会话偏好、单会话用户和时序推理。提示平均约24k令牌。

我们使用SWAA(Yu等,2025 (https://arxiv.org/html/2606.27791#bib.bib12))配置,滑动窗口大小为2048,保留前10个注意力汇聚点,并启用全注意力解码。对于校准,我们使用来自LongAlign-10k和fusang-v1-filtered数据集的64个长上下文示例(16k–32k令牌)。生成使用vLLM,配备8块GPU,批量大小为64,温度为0。评估遵循LongMemEval协议,使用GPT-5-mini作为裁判。

我们比较了五个基线:(1) 全注意力(全部36层使用FA),(2) 1/2-FA周期性(18层,每隔一层),(3) 1/4-FA周期性(SWAA报告的9层周期模式),(4) LightTransfer 1/4-FA(Zhang等,2025 (https://arxiv.org/html/2606.27791#bib.bib13))(由懒惰比率启发式选择的9层,在我们包含keep_first=10的SWAA协议下评估),以及(5) 朴素SWA(所有层使用SWA,无keep-first令牌,无FA解码)。基线(1)–(3)和(5)使用SWAA报告的值。LightTransfer比较使用keep_first=10而非LightTransfer默认的keep_first=100,因此它在我们SWAA协议下测试层排序启发式,而非复现LightTransfer的首选设置。

### 4.2 主要结果

表1 (https://arxiv.org/html/2606.27791#S4.T1)展示了主要比较。NLL引导的1/4-FA达到了64.6%的准确率,距离1/2-FA周期性基线(65.0%)仅差0.4个百分点,同时使用了其一半的全注意力预算(9层对比18层)。

相似文章

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

@seclink: https://x.com/seclink/status/2072187033263784397

X AI KOLs Timeline

Hybrid Sliding Window Attention (Hybrid SWA) 是一种在长文本语言模型中平衡计算效率与全局长距离依赖的混合注意力机制,通过交替使用局部SWA层和全局注意力层,显著压缩KV Cache同时保持推理能力。文章详细介绍了其设计原理、在Gemma、Qwen等模型中的应用,以及vLLM和HuggingFace等开源项目中的最佳实践。

Dynamic Linear Attention

Hugging Face Daily Papers

DLA引入了自适应状态合并和容量受限的内存建模,用于多状态线性注意力,提升了长上下文LLM的性能。