MISA:用于长上下文大语言模型推理的索引器混合稀疏注意力机制

Hugging Face Daily Papers 论文

摘要

本文介绍了 MISA,这是一种将混合专家(MoE)方法应用于稀疏注意力机制中索引器头部的技术,在保持性能的同时显著降低了长上下文大语言模型推理的计算成本。

DeepSeek 稀疏注意力(DSA)通过引入一种学习到的逐词索引器,为细粒度推理时稀疏注意力设定了新的基准。该索引器对每个前缀词进行评分,并选出最相关的词供主注意力机制使用。为了保持表达能力,索引器使用了大量查询头(例如,DeepSeek-V3.2 上为 64 个),这些头共享相同的选定词集合;这种多头设计正是导致索引器在长上下文下成为计算瓶颈的主要原因。我们提出了 MISA(混合索引器稀疏注意力),作为 DSA 索引器的直接替代品,将其索引器头视为一个混合专家池。一个轻量级路由器利用廉价的块级统计信息,为每个查询选择一个仅包含少量活动头的子集,仅由这些头执行高成本的逐词评分。这既保留了原始索引器池的多样性,又将每个查询的成本从使用所有头对每个前缀词进行评分,降低为仅使用少量路由后的头进行评分,再加上在一个较小的聚合键集上计算的微不足道的路由器开销。我们进一步引入了 MISA 的分层变体,利用路由阶段保留一个较大的候选集,然后通过原始 DSA 索引器对其进行重新排序,从而几乎精确地恢复最终选定的词。在使用仅 8 个活动头且无需额外训练的情况下,MISA 在 DeepSeek-V3.2 和 GLM-5 的 LongBench 基准测试中表现与密集型 DSA 索引器相当,同时分别减少了八倍和四倍的索引器头数量,且平均表现优于 HISA。此外,它在高达 128K 词上下文中依然保持了完全良好的“大海捞针”热力图表现,并在每一层恢复了超过 92% 由 DSA 索引器选定的词。我们的 TileLang 内核在单张 NVIDIA H200 GPU 上比 DSA 原始索引器内核实现了约 3.82 倍的加速。
查看原文
查看缓存全文

缓存时间: 2026/05/11 02:43

论文页面 - MISA:用于长上下文 LLM 推理的索引器混合稀疏注意力

来源:https://huggingface.co/papers/2605.07363

摘要

MISA 用路由的混合专家方法替换了稀疏注意力中密集的逐 Token 索引,在降低计算成本的同时保持性能,并能有效地处理长上下文。

DeepSeek 稀疏注意力(https://huggingface.co/papers?q=Sparse%20Attention)(DSA) 通过引入一个学习到的逐 Token 索引器(https://huggingface.co/papers?q=token-wise%20indexer)来设定细粒度推理时稀疏注意力(https://huggingface.co/papers?q=sparse%20attention)的最前沿标准,该索引器对每个前缀 Token 进行评分,并选择最相关的 Token 用于主注意力计算。为了保持表达力,索引器使用了大量查询头(https://huggingface.co/papers?q=query%20heads)(例如,在 DeepSeek-V3.2 上为 64 个),这些头共享相同的选定 Token 集合;正是这种多头设计使得索引器成为长上下文下的主要计算瓶颈。我们提出了 MISA(Mixture of Indexer 稀疏注意力(https://huggingface.co/papers?q=Sparse%20Attention)),作为 DSA 索引器的直接替代品,它将索引器头视为一个混合专家(https://huggingface.co/papers?q=mixture-of-experts)池。一个轻量级路由器(https://huggingface.co/papers?q=router)利用廉价的块级统计信息(https://huggingface.co/papers?q=block-level%20statistics)来挑选仅包含少数活跃头的查询相关子集,只有这些头才会执行繁重的 Token 级评分。这保留了原始索引器池的多样性,同时将每个查询的成本从使用每个头对所有前缀 Token 进行评分降低为仅使用少数几个路由头进行评分,再加上一个在少量聚合键上计算的可忽略不计的路由器(https://huggingface.co/papers?q=router)项。我们进一步引入了 MISA 的分层变体(https://huggingface.co/papers?q=hierarchical%20variant),利用路由传递保留一个扩大的候选集,然后使用原始 DSA 索引器对其进行重新排序,以几乎精确地恢复最终选定的 Token。仅使用八个活跃头且无需额外训练,MISA 在 LongBench 上针对 DeepSeek-V3.2 和 GLM-5 的表现与密集 DSA 索引器持平,同时分别仅使用八分之一和四分之一的索引器头数量,并且平均优于 HISA。它还在高达 128K Token 的上下文中完全保持了“大海捞针”(https://huggingface.co/papers?q=Needle-in-a-Haystack)热力图的绿色状态,并恢复了 DSA 索引器每层所选定 Token 的 92% 以上。我们的 TileLang 内核(https://huggingface.co/papers?q=TileLang%20kernel)在单个 NVIDIA H200 GPU 上相比 DSA 的原始索引器内核实现了约 3.82 倍的加速。

查看 arXiv 页面 (https://arxiv.org/abs/2605.07363) 查看 PDF (https://arxiv.org/pdf/2605.07363) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.07363)

在您的智能体中获取此论文:

hf papers read 2605\.07363

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.07363 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.07363 以从此页面链接它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.07363 以从此页面链接它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

MiniMax 稀疏注意力

Hugging Face Daily Papers

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。

准确高效的LLM智能体长期记忆

arXiv cs.AI

MOSAIC是一个结构化、具备冲突感知能力的LLM智能体长期记忆框架,它采用实体类型化图存储、哈希加速检索和主动冲突检测,在长对话问答和事实冲突检测任务上实现了高准确率和高效率。

推理时上下文稀疏性:幻象还是机遇?

arXiv cs.AI

本文认为,极端的上下文稀疏性是LLM推理的一个有原则且可行的基础,展示了当前模型能够容忍高达100倍的稀疏性而无质量损失,并且稀疏解码内核可以在现有硬件上将处理速度提升10倍。