SAS:通过端到端优化上下文排序实现简单注意力稀疏化

Hugging Face Daily Papers 论文

摘要

SAS 引入了一种门控稀疏注意力机制,该机制通过语言建模损失端到端优化上下文排序,在紧凑注意力预算下提升推理和长上下文任务的性能。

训练后注意力稀疏化通过为每个查询选择一小部分上下文单元(令牌或块),减少了预训练Transformer的二次累积注意力成本。现有的可训练方法通常使用轻量级选择器为上下文单元评分,随后进行硬Top-K选择,这阻断了语言建模损失的梯度。因此,这些方法通常蒸馏逐层密集注意力分布。尽管这鼓励了选择器根据原始模型中的密集注意力权重对上下文单元进行排序,但该排序并未直接与它们在固定注意力预算(即每个查询的已注意上下文单元数量)下对预测的影响对齐,可能会将有限预算浪费在不太有用的单元上。为了解决这种错位,我们提出了简单注意力稀疏化(SAS),这是一种门控稀疏注意力机制,通过语言建模损失端到端优化上下文排序。关键思想是在训练过程中将选择器的连续分数注入注意力logits,允许损失通过标准反向传播更新选择器。我们确定了几个对这一简单设计在实践中有效至关重要的选择:将门控置于对数形式的注意力softmax内部,使用归一化softmax门控来校准历史上下文与始终保留的当前块,并保留连续选择器分数,使模型学习相对优先级而非仅进行硬选择。为支持长序列训练,我们实现了一个内存高效的Triton内核,将SAS集成到FlashAttention风格的计算中。在推理、长上下文理解和代理任务中,SAS在各种注意力预算下始终优于可训练稀疏注意力基线,尤其是在紧凑预算下获得显著提升,表明其为下游任务提供了更有效的上下文排序。
查看原文
查看缓存全文

缓存时间: 2026/09/14 02:33

论文页面 - SAS:通过端到端优化上下文排序实现简单注意力稀疏化

来源:https://huggingface.co/papers/2609.13141

摘要

SAS 通过端到端训练选择器来改进稀疏注意力,利用注意力 softmax 内的连续门控机制与语言建模损失相结合,在紧凑预算下实现了更优的上下文排序。

后训练注意力稀疏化(https://huggingface.co/papers?q=attention%20sparsification)通过为每个查询选择一小部分上下文单元(令牌或块),减少了预训练 Transformer 模型二次方累积的注意力计算成本。现有的可训练方法通常使用轻量级选择器对上下文单元进行评分,随后进行硬性 Top-K 选择(https://huggingface.co/papers?q=Top-K%20selection),这会阻断语言建模损失的梯度回传。因此,这些方法通常需要逐层蒸馏密集注意力分布。尽管这鼓励选择器按照原始模型中的密集注意力权重对上下文单元进行排序,但该排序并未直接对齐于其在固定注意力预算(即每个查询可关注的上下文单元数量)下对预测的影响,可能导致有限的预算被浪费在较不有用的单元上。为解决这一失调问题,我们提出了简单注意力稀疏化(https://huggingface.co/papers?q=Attention%20Sparsification)(SAS),这是一种门控稀疏注意力(https://huggingface.co/papers?q=gated%20sparse%20attention)机制,能通过语言建模损失端到端地优化上下文排序。其核心思想是在训练过程中将选择器的连续分数注入注意力 logits(https://huggingface.co/papers?q=attention%20logits),允许损失通过标准反向传播来更新选择器。我们明确了几个对这一简单设计在实践中有效运作至关重要的选择:将门控置于注意力 softmax 内部并以对数形式表示,使用归一化的 softmax 门控(https://huggingface.co/papers?q=softmax%20gates)来校准历史上下文与始终保留的当前块之间的关系,并保留连续的选择器分数,以便模型学习相对优先级而非仅进行硬选择。为支持长序列训练,我们实现了一个高效的 Triton 内核(https://huggingface.co/papers?q=Triton%20kernel),将 SAS 集成到类似 FlashAttention(https://huggingface.co/papers?q=FlashAttention)的计算中。在推理、长上下文理解(https://huggingface.co/papers?q=long-context%20understanding)和智能体任务中,SAS 在不同注意力预算下始终优于可训练的稀疏注意力基线,在紧凑预算下尤其能带来大幅提升,证明了其在下游任务中更有效的上下文排序能力。

查看 arXiv 页面 (https://arxiv.org/abs/2609.13141) 查看 PDF (https://arxiv.org/pdf/2609.13141) GitHub3 (https://github.com/Tencent-Hunyuan/Simple-Attention-Sparsification) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.13141)

在您的智能体中获取此论文:

hf papers read 2609\.13141

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2609.13141 以从本页面关联它。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.13141 以从本页面关联它。

引用此论文的 Space0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2609.13141 以从本页面关联它。

包含此论文的收藏夹0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从本页面关联它。

相似文章

通过Gist Tokens的简化稀疏注意力

Hugging Face Daily Papers

本文介绍了简化稀疏注意力(SSA),一种在持续预训练中使用Gist令牌的方法,能够在推理时无需架构更改即可实现高效的分块选择,取得了高压缩比,并在LongBench和检索增强生成等长上下文任务上优于基线。