gemm

标签

Cards List
#gemm

85.3 GFlops:在单个AMD Zen 3核心上优化FP32矩阵乘法

Hacker News Top · 2026-07-17 缓存

在AMD Zen 3上对FP32矩阵乘法优化的系统性探索,使用AVX2/FMA内联指令实现了85.30 GFLOPS(理论峰值的63.5%),超越了朴素实现56.5倍,并达到了优化库的性能水平。

0 人收藏 0 人点赞
#gemm

@PyTorch: https://bit.ly/4yawNqB..*

X AI KOLs Timeline · 2026-07-10 缓存

这篇来自PyTorch的博客文章介绍了针对LayerNorm和RMSNorm等归一化操作的新型内核融合技术,通过减少内存IO开销实现了显著的加速。这些技术包括Lazy Pre-Norm和Multi-CTA Norm Fusion,在与GEMM融合时可隐藏高达90%的归一化延迟,而FlashNormAttention算法可实现高达35%的内核加速。

0 人收藏 0 人点赞
#gemm

@PyTorch:在大型语言模型和推荐系统中,归一化层常因硬件分块要求独特而导致内存瓶颈…

X AI KOLs Following · 2026-07-10 缓存

Meta 引入了诸如 Lazy Pre-Norm、Multi-CTA Norm Fusion 和 FlashNormAttention 等技术,将归一化操作与 GEMM 和注意力核融合,在 NVIDIA B200 硬件上隐藏多达 90% 的归一化延迟,并在注意力块中实现高达 35% 的延迟降低。

0 人收藏 0 人点赞
#gemm

@_akhaliq: SpenseGPT 实用的一次性剪枝方法,支持大语言模型推理中的稀疏和密集 GEMM

X AI KOLs Following · 2026-06-12 缓存

SpenseGPT 提出了一种实用的一次性剪枝方法,用于大语言模型,可在推理过程中同时支持稀疏和密集的 GEMM,提升效率。

0 人收藏 0 人点赞
#gemm

@ariG23498: 现在是性能分析时间!在第2部分中,我们涵盖:> 追踪线性层 > 讨论 mul + add 与 linear 的对比 > gemm epilogues (我最…

X AI KOLs Timeline · 2026-06-11 缓存

宣布性能分析教程的第2部分,涵盖线性层追踪、gemm epilogues、MLP追踪以及torch compile与Liger内核的对比,并附有完整内容的链接。

0 人收藏 0 人点赞
#gemm

RT-Lynx:以正确方式将GEMM稀疏性应用于扩散模型

Hugging Face Daily Papers · 2026-05-26 缓存

RT-Lynx提出利用激活稀疏性而非权重稀疏性来加速扩散模型,在线性层上实现了高达1.55倍的加速,同时保持生成质量,并被ICML 2026接收。

0 人收藏 0 人点赞
#gemm

CODA: 将Transformer块重写为GEMM-尾声程序

Hacker News Top · 2026-05-22 缓存

介绍CODA,一种GPU内核抽象,将Transformer操作表达为GEMM加尾声程序以减少数据移动,覆盖Transformer块中几乎所有非注意力计算。

0 人收藏 0 人点赞
#gemm

最后,衷心感谢这个了不起的团队:@jcz42, Arjun, Driss, @tensorcore, @yoonrkim 和 @tri_dao!PDF: https://a…

X AI KOLs Following · 2026-05-21 缓存

CODA 引入了一种 GPU 内核抽象,将 transformer 计算重写为 GEMM-plus-epilogue 程序,减少内存受限操作,提高训练效率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈