@shreyansh_26: 当 M 和 N 很小而 K 很大时,如何让矩阵乘法变快?(MoE routers、small-batch decode。)Decompose-K: …
摘要
一种加速矩阵乘法的技术,适用于 M 和 N 较小而 K 较大的情况(如 MoE routers 和 small-batch decoding),通过分解 K 并并行运行部分 GEMM,然后将 epilogue 折叠到归约存储中。该方法使用自定义 Triton 内核,在大多数形状上击败了 PyTorch Inductor。
查看缓存全文
缓存时间: 2026/06/23 16:12
当 M 和 N 极小、K 极大时,如何让矩阵乘法(matmul)变快?(MoE 路由器、小批量解码。)
分解 K:将 K 拆分,并行运行 S 个部分 GEMM,求和,并将后处理折叠到归约存储中。
新博文:从 torch.compile → 自定义算子自动调优 → 一个手写 Triton 内核,在 26/28 种形状上击败 Inductor。
基于 @pz_ai1 和 Elias Ellison 在 PyTorch Conf 的演讲。
相似文章
@shreyansh_26: https://x.com/shreyansh_26/status/2069125463860302212
本文介绍了Decompose-K技术,用于加速瘦高大K矩阵乘法,通过将K维度分割成块,执行批量矩阵乘法,并求和部分结果。还提供了PyTorch实现和基准测试,显示对于形状不佳的矩阵乘法,相比标准torch.compile有显著加速。
@techNmak: 运行大型MoE模型最聪明的方式并不是增加更多GPU,而是不再把每个专家都视为值得占用GPU资源……
KTransformers 是一个优化大型混合专家模型推理和微调的框架,它通过将活跃的专家动态放置在 GPU 上,其余专家保留在 CPU 内存中,使得像 DeepSeek-V3 这样的大型模型能够在有限的消费级 GPU 内存上运行。
MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)
Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。
Mixture-of-Kittens:我们为NVL72s提供的开源MoE巨型内核(25分钟阅读)
Cursor正在开源Mixture-of-Kittens(MoK),这是一个用于NVL72s的生产级MoE训练巨型内核,它融合了通信与计算,为其Composer模型带来了1.41倍的端到端训练吞吐量提升。
@cursor_ai:我们正在开源 Mixture-of-Kittens (MoK),这是我们为 NVL72 打造的 MoE 训练巨型内核。它融合了所有 Mixture-of-Experts 的…
Cursor 正在开源 Mixture-of-Kittens (MoK),这是一个针对 NVIDIA NVL72 的融合式 MoE 训练巨型内核,其运行速度比最强的公开基线快达 2.37 倍。