@PyTorch:在大型语言模型和推荐系统中,归一化层常因硬件分块要求独特而导致内存瓶颈…

X AI KOLs Following 论文

摘要

Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。

在大型语言模型和推荐系统中,归一化层常因独特的硬件分块要求而导致内存瓶颈。为了解决这一问题,Meta 一直在研究将归一化操作直接与 GEMM 和注意力核融合的技术。通过将 CUDA Core 的归一化计算与 Tensor Core 执行流水线重叠,可以解锁显著的加速效果。 引入了多种新颖的想法和技术来应对归一化融合的关键障碍:分块差异。这些技术包括 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention。在真实 RecSys 流量和 NVIDIA B200 硬件上的测试表明,这些技术可以将多达 90% 的归一化延迟隐藏在 GEMM 核之后。对于包含 pre-norm、post-norm 和残差连接的完整注意力块,这可以带来高达 35% 的延迟降低。 这一里程碑展示了将算法洞见与底层硬件优化相结合的潜力。我们正朝着一个“免费归一化”的世界迈进,开发者无需牺牲性能即可获得完整的建模能力。 阅读完整博客,链接见评论。
查看原文
查看缓存全文

缓存时间: 2026/07/10 20:14

归一化层在大语言模型和推荐系统中常因独特的硬件分块需求而引入内存密集型瓶颈。为此,Meta一直在研究将归一化操作直接融合到GEMM和Attention内核中的技术。通过将CUDA核心的归一化计算与Tensor Core执行流水线重叠,可以显著加速。

为了应对归一化融合的关键障碍——分块差异,多项新颖理念和技术被提出,包括Lazy Pre-Norm、Multi-CTA Norm Fusion和FlashNormAttention。在实际的RecSys流量和NVIDIA B200硬件上的测试显示,这些技术可将最多90%的归一化延迟隐藏在GEMM内核之后,从而将包含pre-norm、post-norm和残差连接的完整Attention块的延迟降低多达35%。

这一里程碑展示了算法洞察与底层硬件优化相结合的可能性。我们正接近一个“免费归一化”的世界,开发者可以在不牺牲性能的前提下获得完整的建模能力。

阅读完整博客,链接在评论区。

相似文章

@PyTorch: https://bit.ly/4yawNqB..*

X AI KOLs Timeline

这篇来自PyTorch的博客文章介绍了针对LayerNorm和RMSNorm等归一化操作的新型内核融合技术,通过减少内存IO开销实现了显著的加速。这些技术包括Lazy Pre-Norm和Multi-CTA Norm Fusion,在与GEMM融合时可隐藏高达90%的归一化延迟,而FlashNormAttention算法可实现高达35%的内核加速。