autotuning

标签

Cards List
#autotuning

@PyTorch:@huggingface Kernels 项目现已支持 Helion。本文介绍如何构建、自动调优和交付……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

Hugging Face Kernels 项目现已支持 Helion,这是一个用于编写高性能机器学习内核的高级 DSL,使用户能够无缝地构建、自动调优和交付内核。

0 人收藏 0 人点赞
#autotuning

@shreyansh_26: 当 M 和 N 很小而 K 很大时,如何让矩阵乘法变快?(MoE routers、small-batch decode。)Decompose-K: …

X AI KOLs Timeline ↗ · 2026-06-22 缓存

一种加速矩阵乘法的技术,适用于 M 和 N 较小而 K 较大的情况(如 MoE routers 和 small-batch decoding),通过分解 K 并并行运行部分 GEMM,然后将 epilogue 折叠到归约存储中。该方法使用自定义 Triton 内核,在大多数形状上击败了 PyTorch Inductor。

0 人收藏 0 人点赞
#autotuning

@PyTorch: 自动调优是Helion的支柱,Helion是PyTorch用于性能可移植ML内核的DSL。目前Helion搜索利用…

X AI KOLs Following ↗ · 2026-06-18 缓存

本文探讨了使用LLM引导的自动调优来加速PyTorch的Helion DSL中的内核配置搜索,取代了较慢的Likelihood-Free Bayesian Optimization方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈