@rohanpaul_ai:新阿里与南京大学论文声称百万token预填充速度可提升9.36倍(与FlashAttention-2相比)……
摘要
来自阿里巴巴和南京大学的新论文介绍了RTPurbo,这是一种通过仅在必要处选择性应用完整注意力机制(无需重新训练模型)将百万token预填充速度相比FlashAttention-2提升最多9.36倍的方法。
查看缓存全文
缓存时间: 2026/05/25 04:43
阿里巴巴与南京大学新论文声称,百万token预填充速度可提升9.36倍(对比FlashAttention-2),仅需轻量适配。
研究显示,标准大语言模型通过使注意力机制变得选择性稀疏,可以更快地处理极长上下文。
问题在于,当输入扩展到数十万甚至百万token时,完整注意力机制的计算成本变得极为高昂,因为模型需要不断将大量token与其他token进行两两比较。
论文的核心观点是:一个经过训练的完整注意力模型,其内部已经隐含了稀疏结构,因此无需重建模型或从头训练。
RTPurbo利用这一结构,找出真正需要远距离token的少数注意力头,而让其他头主要关注邻近文本。
对于这些“检索头“,它使用一个仅有16维的token查找器来预测哪些旧token值得关注,然后仅对选定的集合执行真实的注意力计算。
作者在长上下文基准测试和推理任务上进行了测试,RTPurbo在保持接近完整注意力精度的同时,在百万token场景下实现了最高9.36倍的预填充加速,解码速度也提升了约2倍。
RTPurbo的工程原则是:仅在必要之处保留昂贵的长期上下文访问,其余部分则通过更小的搜索空间进行路由。
其中的巧妙之处在于这个16维的索引器。
它并不替代模型真正的注意力计算,而是像一个廉价的侦察兵,在完整表示被用于选定集合之前,先找出可能有用的token。
RTPurbo并不能证明每个模型都能安全地以这种方式进行稀疏化。
但它有力地证明了长上下文推理中的浪费现象比表面上看起来更有结构性。
论文链接 – arxiv.org/abs/2605.16928v1
论文标题:“Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps”
相似文章
@rohanpaul_ai: 相当惊人,MiniMax Sparse Attention 在100万token时将注意力计算量减少28.4倍,预填充速度提升14.2倍,以及…
MiniMax Sparse Attention (MSA) 通过增加一个路由分支,选择性选择键值块进行注意力计算,在100万token时实现了注意力计算量最高减少28.4倍,在H800 GPU上实现了14.2倍更快的预填充和7.6倍更快的解码,同时匹配全注意力基准性能。
@rohanpaul_ai: 这篇论文通过让每个token只使用它需要的查询头,使长上下文注意力更便宜、更快。Rea…
该论文引入了Grouped Query Experts,通过在分组查询注意力基础上将每个token路由到少数几个查询头专家,改进了长上下文注意力,在匹配准确率的同时实现了1.7-1.8倍的预填充速度提升。
全注意力回归:在百步训练内将全注意力转化为稀疏注意力
RTPurbo 仅需数百步训练即可将全注意力大语言模型转化为稀疏模型,实现接近无损的准确率,并在预填充阶段最高提速 9.36 倍,解码阶段最高提速 2.01 倍。
Flash-MSA: 利用稀疏注意力内核加速百万token训练
介绍Flash-MSA,首个针对MiniMax稀疏注意力在Hopper和Blackwell GPU上的高性能开源训练内核,实现高效的百万token训练。
DualKV: 针对大规模生成和长上下文的共享提示Flash Attention,用于高效RL训练
介绍DualKV,一种FlashAttention内核变体,可消除RL后训练(GRPO/DAPO)中冗余的提示词元计算,在30B MoE模型上实现高达3.82倍的加速。