FlashPrefill V2:面向长上下文LLM服务的块稀疏预填充注意力
摘要
FlashPrefill V2通过均值校正的稀疏注意力和优化的GPU算子改善了长上下文LLM服务,相比FlashAttention-2和稠密基线提供了显著的加速。
查看缓存全文
缓存时间: 2026/08/21 08:09
论文页面 - FlashPrefill V2:用于长上下文大语言模型服务的块稀疏预填充注意力
来源:https://huggingface.co/papers/2608.19758
摘要
FlashPrefill V2 通过均值校正稀疏注意力、优化的 GPU 算子以及框架集成,提升了长上下文服务效率,相较于密集注意力基线实现了显著加速。
长上下文建模(https://huggingface.co/papers?q=Long-context%20modeling)是大语言模型的关键能力,但注意力机制的二次复杂度仍是关键瓶颈,尤其在计算密集的预填充阶段。我们先前的工作 FlashPrefill 通过即时模式发现和基于最大值的动态阈值降低了这一成本;然而,它仍是一个算法原型,距离生产部署尚远。本文我们提出 FlashPrefill V2(https://huggingface.co/papers?q=FlashPrefill%20V2),将 FlashPrefill 从原型推向实用的长上下文服务,主要从三个维度进行演进。首先,我们引入均值校正(mean correction)项,有效抑制近似误差,即使在极端稀疏度下也能将性能下降控制在可管理范围内。其次,我们重新设计了稀疏注意力(sparse attention)算子,采用 PackGQA 内存访问、线程束专业化(warp specialization)和乒乓流水线(pingpong pipelining),完全对齐最新的 FlashAttention-3/4(https://huggingface.co/papers?q=FlashAttention-3%2F4)实现,并支持 FP8 推理(https://huggingface.co/papers?q=FP8%20inference)以满足实际量化需求。第三,FlashPrefill V2(https://huggingface.co/papers?q=FlashPrefill%20V2)原生支持分页 KV 缓存(paged KV cache)和连续批处理(continuous batching),可作为注意力后端集成到现代推理框架(如 SGLang)中。在 NVIDIA H20 GPU(目前最广泛部署的推理加速器之一)上的广泛评估表明,FlashPrefill V2 在 128K 上下文长度下,FP8 和 BF16 精度分别实现了最高 47.26 倍和 27.19 倍的加速(相较于 FlashAttention-2);在 FP8 精度下,与 FA3/4 对齐的密集基线相比,仍实现了 30.49 倍的加速。
查看 arXiv 页面 (https://arxiv.org/abs/2608.19758) 查看 PDF (https://arxiv.org/pdf/2608.19758) GitHub1 (https://github.com/qhfan/FlashPrefillv2) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.19758)
获取此论文于您的智能体中:
hf papers read 2608\.19758
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.19758 以从本页链接到该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.19758 以从本页链接到该数据集。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.19758 以从本页链接到该 Space。
包含此论文的合集 1
相似文章
UniPrefill:基于块级动态稀疏化的通用长上下文预填充加速
UniPrefill 是一项在研究论文中提出的新型预填充加速框架,通过块级动态稀疏化实现大语言模型(LLMs)的通用长上下文处理。该框架与 vLLM 集成,可在多种模型架构中将首次 Token 生成时间(TTFT)加速最高达 2.1 倍。
超越 Flash:利用注意力稀疏性实现高效长上下文解码
介绍了 Faster Flash Decoding (FFD),这是一个无需训练的硬件-算法协同设计框架,通过利用注意力稀疏性加速 LLMs 中的长上下文解码,实现了高达 11.6 倍的加速,并可扩展至 256K 上下文长度。
FlashMemory-DeepSeek-V4:通过前瞻稀疏注意力实现闪电索引超长上下文
提出在DeepSeek-V4上结合神经记忆索引器的前瞻稀疏注意力,将GPU内存使用降至全上下文基线的约13.5%,同时保持或略微提升准确率。
CompactAttention: 通过块合并KV选择加速分块预填充
CompactAttention引入块合并KV选择机制,加速长上下文LLM的分块预填充,在LLaMA-3.1-8B模型128K上下文下实现最高2.72倍注意力加速,同时保持与稠密注意力相近的精度。
SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力
SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。