SAS:通过端到端优化上下文排序实现简单注意力稀疏化
摘要
SAS 引入了一种门控稀疏注意力机制,该机制通过语言建模损失端到端优化上下文排序,在紧凑注意力预算下提升推理和长上下文任务的性能。
查看缓存全文
缓存时间: 2026/09/14 02:33
论文页面 - SAS:通过端到端优化上下文排序实现简单注意力稀疏化
来源:https://huggingface.co/papers/2609.13141
摘要
SAS 通过端到端训练选择器来改进稀疏注意力,利用注意力 softmax 内的连续门控机制与语言建模损失相结合,在紧凑预算下实现了更优的上下文排序。
后训练注意力稀疏化(https://huggingface.co/papers?q=attention%20sparsification)通过为每个查询选择一小部分上下文单元(令牌或块),减少了预训练 Transformer 模型二次方累积的注意力计算成本。现有的可训练方法通常使用轻量级选择器对上下文单元进行评分,随后进行硬性 Top-K 选择(https://huggingface.co/papers?q=Top-K%20selection),这会阻断语言建模损失的梯度回传。因此,这些方法通常需要逐层蒸馏密集注意力分布。尽管这鼓励选择器按照原始模型中的密集注意力权重对上下文单元进行排序,但该排序并未直接对齐于其在固定注意力预算(即每个查询可关注的上下文单元数量)下对预测的影响,可能导致有限的预算被浪费在较不有用的单元上。为解决这一失调问题,我们提出了简单注意力稀疏化(https://huggingface.co/papers?q=Attention%20Sparsification)(SAS),这是一种门控稀疏注意力(https://huggingface.co/papers?q=gated%20sparse%20attention)机制,能通过语言建模损失端到端地优化上下文排序。其核心思想是在训练过程中将选择器的连续分数注入注意力 logits(https://huggingface.co/papers?q=attention%20logits),允许损失通过标准反向传播来更新选择器。我们明确了几个对这一简单设计在实践中有效运作至关重要的选择:将门控置于注意力 softmax 内部并以对数形式表示,使用归一化的 softmax 门控(https://huggingface.co/papers?q=softmax%20gates)来校准历史上下文与始终保留的当前块之间的关系,并保留连续的选择器分数,以便模型学习相对优先级而非仅进行硬选择。为支持长序列训练,我们实现了一个高效的 Triton 内核(https://huggingface.co/papers?q=Triton%20kernel),将 SAS 集成到类似 FlashAttention(https://huggingface.co/papers?q=FlashAttention)的计算中。在推理、长上下文理解(https://huggingface.co/papers?q=long-context%20understanding)和智能体任务中,SAS 在不同注意力预算下始终优于可训练的稀疏注意力基线,在紧凑预算下尤其能带来大幅提升,证明了其在下游任务中更有效的上下文排序能力。
查看 arXiv 页面 (https://arxiv.org/abs/2609.13141) 查看 PDF (https://arxiv.org/pdf/2609.13141) GitHub3 (https://github.com/Tencent-Hunyuan/Simple-Attention-Sparsification) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.13141)
在您的智能体中获取此论文:
hf papers read 2609\.13141
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2609.13141 以从本页面关联它。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.13141 以从本页面关联它。
引用此论文的 Space0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2609.13141 以从本页面关联它。
包含此论文的收藏夹0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面关联它。
相似文章
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。
通过Gist Tokens的简化稀疏注意力
本文介绍了简化稀疏注意力(SSA),一种在持续预训练中使用Gist令牌的方法,能够在推理时无需架构更改即可实现高效的分块选择,取得了高压缩比,并在LongBench和检索增强生成等长上下文任务上优于基线。
CoSA: 通过代理-内核协同设计的稀疏注意力加速长上下文推理
CoSA 提出了一种无需训练的稀疏注意力方法,该方法协同设计了内核感知代理和有序跳过内核,以加速长上下文推理,实现了高达 4.93 倍的注意力加速和 2.53 倍的端到端 TTFT 降低,且性能下降可忽略不计。
Elastic Threshold Attention:用于长上下文解码的学习上下文稀疏性
Elastic Threshold Attention (ETA) 是一种可训练的稀疏注意力架构,它通过使用从查询表示中预测的动态阈值,在不降低质量的情况下提高长上下文解码速度。
Subquadratic AI 推出 SubQ-1.1-Small,一款采用 Smart Sparse Attention 的新模型
Subquadratic AI 推出 SubQ-1.1-Small,该模型利用 Smart Sparse Attention 在长达 1200 万 token 的上下文中实现近乎完美的长上下文检索,注意力计算量减少高达 1000 倍。它兼顾了长上下文优化与强大的通用推理能力,在 NIAH 和 RULER 等基准测试中优于基线模型。