面向B300的全新FP4注意力内核,速度相比FA4提升最高达1.69倍
摘要
FastVideo团队发布了面向B300的全新FP4注意力内核,速度相比FlashAttention 4提升最高达1.69倍。
查看缓存全文
缓存时间: 2026/07/14 04:24
(1/6) FastVideo 团队激动地发布一组针对 B300 的全新 FP4 注意力内核,相比 FA4 实现了最高 1.69 倍的加速!
(2/6) 在 B300 上,MUFU(exp2)吞吐量翻倍,对于 BF16 来说 softmax 不再是瓶颈,但对于 FP4 它仍是瓶颈。我们利用新的 http://tcgen05.ld.red 指令,在从 TMEM 加载到寄存器时计算行最大值,取代了缓慢的 CUDA 核心指令,从而缓解瓶颈,为 FP4/FP8 PV 带来 8%/12% 的性能提升。
(3/6) 我们还花了时间修复 RTX 5090 内核在因果模式下的精度(https://github.com/hao-ai-lab/FastVideo/pull/1506…,基于 SageAttention 3),从而在 SM120 上实现端到端 FP4 LLM 推理!
(4/6) 目前,我们正积极致力于针对更大规模扩散模型(如 Wan2.1-14B 和 NVIDIA Cosmos)的 QAD(量化感知蒸馏)。
(5/6) Attn-QAT 论文:https://arxiv.org/abs/2603.00040
Attn-QAT 博客:https://haoailab.com/blogs/attn-qat/
B300 内核:https://github.com/hao-ai-lab/flash-attention-fp4/blob/fp4_B300/flash_attn/cute/flash_fwd_sm100_fp4.py…
FastWan-QAD 博客:https://haoailab.com/blogs/fastwan-qad/…
(6/6) 我们感谢整个 FastVideo 团队以及 @NVIDIAAI 对 FastVideo 项目的赞助!
@EdenTan20 本周将参加 ICML – 如果有兴趣,欢迎交流!
地点:7.9 上午 10:30 海报展示 HALL A #2800
Attention-FFN 分离能否在最新的机架级 GPU 系统中胜出?
我们构建了 FastAFD,一个用于 GB200 NVL72 的开源 AFD 运行时:72 块 Blackwell GPU 位于同一个 NVLink 域内。
它使每 GPU 解码吞吐量提升了 1.35–1.45 倍。
代码:https://github.com/hao-ai-lab/FastAFD…
博客:https://haoailab.com/blogs/fastafd/
相似文章
FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡
FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。
有人在他们的 V100 上使用 Flash Attention 2 (ai-bond) 吗?性能如何?
一位用户对 Flash Attention 2 的 V100 兼容端口进行了基准测试,报告称相比默认的 PyTorch 注意力机制,速度提升了 3 到 17 倍,内存减少了高达 94%。
@xenovacom:Opus 4.7 刚写了一个定制 WebGPU 内核,用融合 LinearAttention 算子把 Qwen3.5 推理速度提升最高 13 倍!智能内核…
Opus 4.7 自动生成定制 WebGPU 内核,通过融合 LinearAttention 将 Qwen3.5 推理加速最高 13 倍,现已随 Transformers.js v4.2.0 发布。
@AaronWeiHuang:我们最新博客探讨了FP4如何从压缩工具演变为训练和推理的实用基础方案,涵盖……
NVIDIA的博客详细介绍了FP4(配合NVFP4格式和Blackwell硬件)如何从一种压缩技巧演变为训练和推理的实用基础方案,涵盖LLM和扩散模型,并实现了接近16位的精度。
LongLive-2.0:用于长视频生成的NVFP4并行基础设施
LongLive-2.0 引入了一种基于NVFP4的并行基础设施,用于长视频生成,在训练上实现了高达2.15倍的加速,推理上实现了1.84倍的加速,5B模型达到了45.7 FPS。