SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力
摘要
SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。
查看缓存全文
缓存时间: 2026/06/05 02:15
# SparDA:面向高效长上下文 LLM 推理的稀疏解耦注意力机制 来源:https://arxiv.org/abs/2606.04511 查看 PDF (https://arxiv.org/pdf/2606.04511) > **摘要:** 稀疏注意力机制可降低长上下文 LLM 推理的计算量与内存带宽需求。然而,目前仍面临两大关键挑战:(1)KV 缓存容量仍随序列长度线性增长,而将其卸载至 CPU 内存会引入 PCIe 传输瓶颈;(2)稀疏选择步骤本身仍具有 $O(T^2)$ 复杂度,在长上下文场景下可能主导注意力的整体开销。为此,我们提出 SparDA——一种解耦稀疏注意力架构,在 Query、Key 和 Value 之外,为每层引入第四个投影头,称为 Forecast(预测头)。Forecast 负责预测下一层所需的 KV 块,从而实现前瞻式选择,将 CPU 到 GPU 的预取操作与当前层的执行过程相互重叠。由于 Forecast 与注意力查询解耦,我们的 GQA 实现中每个 GQA 组仅需一个 Forecast 头,相较于原始多头选择器显著降低了选择开销。SparDA 新增参数量不足 0.5%,且仅通过匹配原始选择器的注意力分布来训练 Forecast 投影层。在两个经过稀疏预训练的 8B 模型上,SparDA 在精度上持平甚至略有提升,prefill 阶段最高实现 1.25 倍加速,decode 阶段最高实现 1.7 倍加速,均优于稀疏注意力卸载基线。通过支持在单张 GPU 上使用更大的可行批次大小,SparDA 的 decode 吞吐量最高可达非卸载稀疏基线的 5.3 倍。源代码已开放于 [此链接](https://github.com/NVlabs/SparDA)。 ## 提交历史 提交者:Yaosheng Fu \[[查看邮箱](https://arxiv.org/show-email/481e6733/2606.04511)\] **\[v1\]** 2026 年 6 月 3 日(周三)06:42:05 UTC(328 KB)
相似文章
CoSA: 通过代理-内核协同设计的稀疏注意力加速长上下文推理
CoSA 提出了一种无需训练的稀疏注意力方法,该方法协同设计了内核感知代理和有序跳过内核,以加速长上下文推理,实现了高达 4.93 倍的注意力加速和 2.53 倍的端到端 TTFT 降低,且性能下降可忽略不计。
Dustin: 草稿增强的稀疏验证用于高效长上下文生成与推测解码
Dustin提出了一种用于推测解码的稀疏验证框架,利用草稿模型信号和稀疏注意力头评分克服KV缓存验证瓶颈,在长上下文任务中自注意力加速达27.85倍,端到端解码加速达9.17倍,且精度损失可忽略不计。
整体之稀疏一瞥:无需训练的自推测解码
本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。
利用指数衰减记忆增强注意力提升查询感知的KV稀疏性
本文探讨了RAT+中的指数衰减记忆模块如何提升长上下文语言模型的查询感知稀疏推理方法,在针尖干草垛任务中,跨多种稀疏预算展示了一致的准确率提升。
SpecLA:面向线性注意力模型的高效推测解码
SpecLA 提出了一种专为有状态线性注意力模型设计的推测解码运行时,在搭载 GDN-1.3B 目标模型的 NVIDIA H100 上,相比自回归解码实现了最高 1.70 倍的端到端加速。