MISA:用于长上下文大语言模型推理的索引器混合稀疏注意力机制
摘要
本文介绍了 MISA,这是一种将混合专家(MoE)方法应用于稀疏注意力机制中索引器头部的技术,在保持性能的同时显著降低了长上下文大语言模型推理的计算成本。
查看缓存全文
缓存时间: 2026/05/11 02:43
论文页面 - MISA:用于长上下文 LLM 推理的索引器混合稀疏注意力
来源:https://huggingface.co/papers/2605.07363
摘要
MISA 用路由的混合专家方法替换了稀疏注意力中密集的逐 Token 索引,在降低计算成本的同时保持性能,并能有效地处理长上下文。
DeepSeek 稀疏注意力(https://huggingface.co/papers?q=Sparse%20Attention)(DSA) 通过引入一个学习到的逐 Token 索引器(https://huggingface.co/papers?q=token-wise%20indexer)来设定细粒度推理时稀疏注意力(https://huggingface.co/papers?q=sparse%20attention)的最前沿标准,该索引器对每个前缀 Token 进行评分,并选择最相关的 Token 用于主注意力计算。为了保持表达力,索引器使用了大量查询头(https://huggingface.co/papers?q=query%20heads)(例如,在 DeepSeek-V3.2 上为 64 个),这些头共享相同的选定 Token 集合;正是这种多头设计使得索引器成为长上下文下的主要计算瓶颈。我们提出了 MISA(Mixture of Indexer 稀疏注意力(https://huggingface.co/papers?q=Sparse%20Attention)),作为 DSA 索引器的直接替代品,它将索引器头视为一个混合专家(https://huggingface.co/papers?q=mixture-of-experts)池。一个轻量级路由器(https://huggingface.co/papers?q=router)利用廉价的块级统计信息(https://huggingface.co/papers?q=block-level%20statistics)来挑选仅包含少数活跃头的查询相关子集,只有这些头才会执行繁重的 Token 级评分。这保留了原始索引器池的多样性,同时将每个查询的成本从使用每个头对所有前缀 Token 进行评分降低为仅使用少数几个路由头进行评分,再加上一个在少量聚合键上计算的可忽略不计的路由器(https://huggingface.co/papers?q=router)项。我们进一步引入了 MISA 的分层变体(https://huggingface.co/papers?q=hierarchical%20variant),利用路由传递保留一个扩大的候选集,然后使用原始 DSA 索引器对其进行重新排序,以几乎精确地恢复最终选定的 Token。仅使用八个活跃头且无需额外训练,MISA 在 LongBench 上针对 DeepSeek-V3.2 和 GLM-5 的表现与密集 DSA 索引器持平,同时分别仅使用八分之一和四分之一的索引器头数量,并且平均优于 HISA。它还在高达 128K Token 的上下文中完全保持了“大海捞针”(https://huggingface.co/papers?q=Needle-in-a-Haystack)热力图的绿色状态,并恢复了 DSA 索引器每层所选定 Token 的 92% 以上。我们的 TileLang 内核(https://huggingface.co/papers?q=TileLang%20kernel)在单个 NVIDIA H200 GPU 上相比 DSA 的原始索引器内核实现了约 3.82 倍的加速。
查看 arXiv 页面 (https://arxiv.org/abs/2605.07363) 查看 PDF (https://arxiv.org/pdf/2605.07363) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.07363)
在您的智能体中获取此论文:
hf papers read 2605\.07363
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.07363 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.07363 以从此页面链接它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.07363 以从此页面链接它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
分层稀疏注意力机制的正确实现:迈向无限上下文建模
提出HiLS注意力机制,一种基于块的稀疏注意力方法,通过语言模型损失端到端学习块选择,性能可与全注意力媲美,同时支持超长上下文外推和更快的推理速度。
MiniMax 稀疏注意力
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。
RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构
RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。
准确高效的LLM智能体长期记忆
MOSAIC是一个结构化、具备冲突感知能力的LLM智能体长期记忆框架,它采用实体类型化图存储、哈希加速检索和主动冲突检测,在长对话问答和事实冲突检测任务上实现了高准确率和高效率。
推理时上下文稀疏性:幻象还是机遇?
本文认为,极端的上下文稀疏性是LLM推理的一个有原则且可行的基础,展示了当前模型能够容忍高达100倍的稀疏性而无质量损失,并且稀疏解码内核可以在现有硬件上将处理速度提升10倍。