标签
在AMD Zen 3上对FP32矩阵乘法优化的系统性探索,使用AVX2/FMA内联指令实现了85.30 GFLOPS(理论峰值的63.5%),超越了朴素实现56.5倍,并达到了优化库的性能水平。
这篇来自PyTorch的博客文章介绍了针对LayerNorm和RMSNorm等归一化操作的新型内核融合技术,通过减少内存IO开销实现了显著的加速。这些技术包括Lazy Pre-Norm和Multi-CTA Norm Fusion,在与GEMM融合时可隐藏高达90%的归一化延迟,而FlashNormAttention算法可实现高达35%的内核加速。
Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。
SpenseGPT 提出了一种实用的一次性剪枝方法,用于大语言模型,可在推理过程中同时支持稀疏和密集的 GEMM,提升效率。
宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。
RT-Lynx提出利用激活稀疏性而非权重稀疏性来加速扩散模型,在线性层上实现了高达1.55倍的加速,同时保持生成质量,并被ICML 2026接收。
介绍CODA,一种GPU内核抽象,将Transformer操作表达为GEMM加尾声程序以减少数据移动,覆盖Transformer块中几乎所有非注意力计算。
CODA 引入了一种 GPU 内核抽象,将 transformer 计算重写为 GEMM-plus-epilogue 程序,减少内存受限操作,提高训练效率。