@PyTorch:在大型语言模型和推荐系统中,归一化层常因硬件分块要求独特而导致内存瓶颈…
摘要
Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。
查看缓存全文
缓存时间: 2026/07/10 20:14
归一化层在大语言模型和推荐系统中常因独特的硬件分块需求而引入内存密集型瓶颈。为此,Meta一直在研究将归一化操作直接融合到GEMM和Attention内核中的技术。通过将CUDA核心的归一化计算与Tensor Core执行流水线重叠,可以显著加速。
为了应对归一化融合的关键障碍——分块差异,多项新颖理念和技术被提出,包括Lazy Pre-Norm、Multi-CTA Norm Fusion和FlashNormAttention。在实际的RecSys流量和NVIDIA B200硬件上的测试显示,这些技术可将最多90%的归一化延迟隐藏在GEMM内核之后,从而将包含pre-norm、post-norm和残差连接的完整Attention块的延迟降低多达35%。
这一里程碑展示了算法洞察与底层硬件优化相结合的可能性。我们正接近一个“免费归一化”的世界,开发者可以在不牺牲性能的前提下获得完整的建模能力。
阅读完整博客,链接在评论区。
相似文章
@PyTorch: https://bit.ly/4yawNqB..*
这篇来自PyTorch的博客文章介绍了针对LayerNorm和RMSNorm等归一化操作的新型内核融合技术,通过减少内存IO开销实现了显著的加速。这些技术包括Lazy Pre-Norm和Multi-CTA Norm Fusion,在与GEMM融合时可隐藏高达90%的归一化延迟,而FlashNormAttention算法可实现高达35%的内核加速。
@PyTorch: PyTorch 成员 Meta 刚刚开源了一个 GPU 内核,使注意力在 NVIDIA Blackwell 上加速 2.3 倍。TLX Block Atte…
Meta 开源了 TLX Block Attention,这是一个 warp 特化的 Triton 内核,在 NVIDIA Blackwell GPU 上为块对角自注意力实现了 2.3 倍的加速,与旋转嵌入融合时加速可达 3.5 倍。
@PyTorch:PyTorch原生的NeMo AutoModel在@nvidia的端到端工作流中处理transformer预训练,用于构建交易…
NVIDIA的博客文章描述了一个端到端的工作流,使用PyTorch原生的NeMo AutoModel预训练一个交易基础模型。该工作流使用GPU加速的数据处理和分词、仅解码器模型预训练以及嵌入提取,在IBM TabFormer数据集上将欺诈分类性能提升了超过40%。
Meta-Tool:小语言模型的高效少样本工具适配
独立研究表明,在 3B Llama 的工具使用中,227M 参数的超网络相比精心设计的少样本提示毫无增益,仅用 1/10 延迟即可达到 GPT-5 性能的 79.7%。
内存墙变得昂贵:KV缓存是你应该停止崇拜softmax注意力的原因
文章讨论DDR5内存价格上涨如何标志着AI领域更广泛的内存瓶颈,特别是LLM中softmax注意力的KV缓存,并强调了旨在减少内存使用的后Transformer架构,如线性注意力和状态空间模型。