@rohanpaul_ai:新阿里与南京大学论文声称百万token预填充速度可提升9.36倍(与FlashAttention-2相比)……

X AI KOLs Timeline 论文

摘要

来自阿里巴巴和南京大学的新论文介绍了RTPurbo,这是一种通过仅在必要处选择性应用完整注意力机制(无需重新训练模型)将百万token预填充速度相比FlashAttention-2提升最多9.36倍的方法。

新阿里与南京大学论文声称,仅需轻量级适配,百万token预填充即可比FlashAttention-2提速9.36倍 研究表明,标准大型语言模型可以通过使注意力选择性稀疏化,以更快的速度处理极长上下文。 问题在于,当输入扩展到数十万甚至100万token时,完整注意力的计算代价极高,因为模型需要大量地两两比较token。 论文指出,经过训练的完整注意力模型已经隐含了稀疏结构,因此无需重新构建模型或从头训练。 RTPurbo利用这一结构:识别出少数真正需要远距离token的注意力头,而让其他头主要聚焦于邻近文本。 对于这些检索头,它使用一个16维的token查找器来推测哪些历史token重要,然后仅对选定的集合执行真实注意力计算。 作者在长上下文基准测试和推理任务上进行了测试,RTPurbo在保持接近完整注意力精度的同时,实现了在100万token时预填充速度提升高达9.36倍,解码速度提升约2倍。 RTPurbo的工程原则:仅在关键之处保留昂贵的远距离上下文访问,其余部分通过更小的搜索空间进行路由。 巧妙之处在于那个16维索引器。 它并不替换模型的真实注意力计算,而是像一个廉价的侦察兵:在真实表示被应用于选定集合之前,先找出可能有用的token。 RTPurbo并不证明所有模型都能安全地以这种方式稀疏化。 但它强有力地表明,长上下文推理中的浪费比表面上看起来更具结构性。 ---- 论文链接 – arxiv.org/abs/2605.16928v1 论文标题:《完整注意力反击:在百步训练内将完整注意力转移到稀疏注意力》
查看原文
查看缓存全文

缓存时间: 2026/05/25 04:43

阿里巴巴与南京大学新论文声称,百万token预填充速度可提升9.36倍(对比FlashAttention-2),仅需轻量适配。

研究显示,标准大语言模型通过使注意力机制变得选择性稀疏,可以更快地处理极长上下文。

问题在于,当输入扩展到数十万甚至百万token时,完整注意力机制的计算成本变得极为高昂,因为模型需要不断将大量token与其他token进行两两比较。

论文的核心观点是:一个经过训练的完整注意力模型,其内部已经隐含了稀疏结构,因此无需重建模型或从头训练。

RTPurbo利用这一结构,找出真正需要远距离token的少数注意力头,而让其他头主要关注邻近文本。

对于这些“检索头“,它使用一个仅有16维的token查找器来预测哪些旧token值得关注,然后仅对选定的集合执行真实的注意力计算。

作者在长上下文基准测试和推理任务上进行了测试,RTPurbo在保持接近完整注意力精度的同时,在百万token场景下实现了最高9.36倍的预填充加速,解码速度也提升了约2倍。

RTPurbo的工程原则是:仅在必要之处保留昂贵的长期上下文访问,其余部分则通过更小的搜索空间进行路由。

其中的巧妙之处在于这个16维的索引器。

它并不替代模型真正的注意力计算,而是像一个廉价的侦察兵,在完整表示被用于选定集合之前,先找出可能有用的token。

RTPurbo并不能证明每个模型都能安全地以这种方式进行稀疏化。

但它有力地证明了长上下文推理中的浪费现象比表面上看起来更有结构性。


论文链接 – arxiv.org/abs/2605.16928v1

论文标题:“Full Attention Strikes Back: Transferring Full Attention into Sparse within Hundred Training Steps”

相似文章