triton-kernel

标签

Cards List
#triton-kernel

@shreyansh_26: 当 M 和 N 很小而 K 很大时,如何让矩阵乘法变快?(MoE routers、small-batch decode。)Decompose-K: …

X AI KOLs Timeline ↗ · 2026-06-22 缓存

一种加速矩阵乘法的技术,适用于 M 和 N 较小而 K 较大的情况(如 MoE routers 和 small-batch decoding),通过分解 K 并并行运行部分 GEMM,然后将 epilogue 折叠到归约存储中。该方法使用自定义 Triton 内核,在大多数形状上击败了 PyTorch Inductor。

0 人收藏 0 人点赞
#triton-kernel

Flash-GMM:一种用于可扩展软聚类的内存高效内核

Hugging Face Daily Papers ↗ · 2026-06-09 缓存

Flash-GMM 引入了一个用于高斯混合模型的融合Triton内核,实现了20倍加速,并能在单个GPU上训练比之前大100倍的数据集,使软聚类成为近似最近邻搜索中k-means的可行替代方案。

0 人收藏 0 人点赞
#triton-kernel

学习跳跃块:自我发现的超度量路由用于硬件加速稀疏注意力

Reddit r/artificial ↗ · 2026-05-30

本文介绍了动态超度量注意力(Dynamic Ultrametric Attention),这是一个框架,其中Transformer在训练期间学习每头块稀疏路由拓扑,然后在推理时将这些拓扑卸载到自定义的Triton块稀疏内核上,与密集注意力相比,实现了高达28倍的加速和98.4%的内存减少。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈