面向B300的全新FP4注意力内核,速度相比FA4提升最高达1.69倍

Reddit r/LocalLLaMA 工具

摘要

FastVideo团队发布了面向B300的全新FP4注意力内核,速度相比FlashAttention 4提升最高达1.69倍。

(1/6) FastVideo团队激动地发布了面向B300的全新FP4注意力内核,速度相比FA4提升最高达1.69倍!https://t.co/5JDxt1R8k3
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:24

(1/6) FastVideo 团队激动地发布一组针对 B300 的全新 FP4 注意力内核,相比 FA4 实现了最高 1.69 倍的加速!

(2/6) 在 B300 上,MUFU(exp2)吞吐量翻倍,对于 BF16 来说 softmax 不再是瓶颈,但对于 FP4 它仍是瓶颈。我们利用新的 http://tcgen05.ld.red 指令,在从 TMEM 加载到寄存器时计算行最大值,取代了缓慢的 CUDA 核心指令,从而缓解瓶颈,为 FP4/FP8 PV 带来 8%/12% 的性能提升。

(3/6) 我们还花了时间修复 RTX 5090 内核在因果模式下的精度(https://github.com/hao-ai-lab/FastVideo/pull/1506…,基于 SageAttention 3),从而在 SM120 上实现端到端 FP4 LLM 推理!

(4/6) 目前,我们正积极致力于针对更大规模扩散模型(如 Wan2.1-14B 和 NVIDIA Cosmos)的 QAD(量化感知蒸馏)。

(5/6) Attn-QAT 论文:https://arxiv.org/abs/2603.00040
Attn-QAT 博客:https://haoailab.com/blogs/attn-qat/
B300 内核:https://github.com/hao-ai-lab/flash-attention-fp4/blob/fp4_B300/flash_attn/cute/flash_fwd_sm100_fp4.py…
FastWan-QAD 博客:https://haoailab.com/blogs/fastwan-qad/…

(6/6) 我们感谢整个 FastVideo 团队以及 @NVIDIAAI 对 FastVideo 项目的赞助!

@EdenTan20 本周将参加 ICML – 如果有兴趣,欢迎交流!

地点:7.9 上午 10:30 海报展示 HALL A #2800

Attention-FFN 分离能否在最新的机架级 GPU 系统中胜出?
我们构建了 FastAFD,一个用于 GB200 NVL72 的开源 AFD 运行时:72 块 Blackwell GPU 位于同一个 NVLink 域内。
它使每 GPU 解码吞吐量提升了 1.35–1.45 倍。
代码:https://github.com/hao-ai-lab/FastAFD…
博客:https://haoailab.com/blogs/fastafd/

相似文章

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。