FlashPrefill V2:面向长上下文LLM服务的块稀疏预填充注意力

Hugging Face Daily Papers 论文

摘要

FlashPrefill V2通过均值校正的稀疏注意力和优化的GPU算子改善了长上下文LLM服务,相比FlashAttention-2和稠密基线提供了显著的加速。

长上下文建模是大型语言模型的关键能力,但注意力的二次复杂性仍然是一个关键瓶颈,尤其是在计算密集的预填充阶段。我们之前的工作FlashPrefill通过瞬时模式发现和基于最大值的动态阈值缓解了这一成本;然而,它仍然是一个算法原型,距离生产部署还有差距。本文中,我们介绍了FlashPrefill V2,它从三个方面将FlashPrefill从原型演进到实用的长上下文服务。首先,我们引入了均值校正项,有效抑制了近似误差,即使在极端稀疏性水平下也能保持性能退化可管理。其次,我们重新设计了稀疏注意力算子,采用PackGQA内存访问、warp特化和pingpong流水线,完全对齐最新的FlashAttention-3/4实现,并支持FP8推理以满足实际量化需求。第三,FlashPrefill V2原生支持分页KV缓存和连续批处理,允许作为注意力后端集成到现代推理框架中,如SGLang。在广泛部署的推理加速器NVIDIA H20 GPU上进行的广泛评估表明,FlashPrefill V2在128K上下文长度下,FP8和BF16精度下分别比FlashAttention-2提供高达47.26倍和27.19倍的加速,并且在FP8下,相比FA3/4对齐的稠密基线仍实现30.49倍的加速。
查看原文
查看缓存全文

缓存时间: 2026/08/21 08:09

论文页面 - FlashPrefill V2:用于长上下文大语言模型服务的块稀疏预填充注意力

来源:https://huggingface.co/papers/2608.19758

摘要

FlashPrefill V2 通过均值校正稀疏注意力、优化的 GPU 算子以及框架集成,提升了长上下文服务效率,相较于密集注意力基线实现了显著加速。

长上下文建模(https://huggingface.co/papers?q=Long-context%20modeling)是大语言模型的关键能力,但注意力机制的二次复杂度仍是关键瓶颈,尤其在计算密集的预填充阶段。我们先前的工作 FlashPrefill 通过即时模式发现和基于最大值的动态阈值降低了这一成本;然而,它仍是一个算法原型,距离生产部署尚远。本文我们提出 FlashPrefill V2(https://huggingface.co/papers?q=FlashPrefill%20V2),将 FlashPrefill 从原型推向实用的长上下文服务,主要从三个维度进行演进。首先,我们引入均值校正(mean correction)项,有效抑制近似误差,即使在极端稀疏度下也能将性能下降控制在可管理范围内。其次,我们重新设计了稀疏注意力(sparse attention)算子,采用 PackGQA 内存访问、线程束专业化(warp specialization)和乒乓流水线(pingpong pipelining),完全对齐最新的 FlashAttention-3/4(https://huggingface.co/papers?q=FlashAttention-3%2F4)实现,并支持 FP8 推理(https://huggingface.co/papers?q=FP8%20inference)以满足实际量化需求。第三,FlashPrefill V2(https://huggingface.co/papers?q=FlashPrefill%20V2)原生支持分页 KV 缓存(paged KV cache)和连续批处理(continuous batching),可作为注意力后端集成到现代推理框架(如 SGLang)中。在 NVIDIA H20 GPU(目前最广泛部署的推理加速器之一)上的广泛评估表明,FlashPrefill V2 在 128K 上下文长度下,FP8 和 BF16 精度分别实现了最高 47.26 倍和 27.19 倍的加速(相较于 FlashAttention-2);在 FP8 精度下,与 FA3/4 对齐的密集基线相比,仍实现了 30.49 倍的加速。

查看 arXiv 页面 (https://arxiv.org/abs/2608.19758) 查看 PDF (https://arxiv.org/pdf/2608.19758) GitHub1 (https://github.com/qhfan/FlashPrefillv2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.19758)

获取此论文于您的智能体中:

hf papers read 2608\.19758

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.19758 以从本页链接到该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.19758 以从本页链接到该数据集。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.19758 以从本页链接到该 Space。

包含此论文的合集 1

相似文章

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。