@ariG23498: 当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From …”中听说内核融合时,我着迷了。

X AI KOLs Timeline 新闻

摘要

作者分享了对内核融合的兴奋之情,并演示了使用HuggingFace的kernels项目对GeGLU FFN融合的Liger内核进行性能分析,指出这个分析结果非常漂亮。

当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From First Principles”(是的,我是这篇博客的忠实粉丝)中听说内核融合时,我着迷了。 我在内核编程方面还是个新手,所以自己无法构建融合内核。幸运的是,来自@huggingface的`kernels`项目帮了大忙。我可以从Hub上的数百个内核中选择并对其进行分析。 在这篇博客中,我们使用了GeGLU FFN融合的Liger内核,分析结果非常漂亮。
查看原文
查看缓存全文

缓存时间: 2026/06/16 23:43

我第一次从@cHHillee的博客文章《Making Deep Learning Go Brrrr From First Principles》中听说内核融合时,感到非常着迷(是的,我是这篇文章的超级粉丝)。

我仍然是内核编程的新手,所以无法自己构建融合内核。@huggingface 的 kernels 项目救了我。我可以从Hub上的数百个内核中进行选择并对其进行分析。

在博客中,我们使用了 GeGLU FFN 融合 Liger 内核,其分析结果非常漂亮。

相似文章

🤗 Kernels: 重大更新

Hugging Face Blog

Hugging Face 为其 Kernels 项目引入了重大更新,包括 Hub 上的新仓库类型、通过可信发布者和内核签名改进的安全性、改版的 CLI、扩展的框架/后端支持,以及为智能内核开发奠定基础。

一个可定制的编译器,用于为AI模型生成高效的融合GPU内核 [P]

Reddit r/MachineLearning

作者介绍了一款用 Python 编写、高度可定制且易于修改的 ML 编译器。该编译器通过多级 IR 流水线将 LLMs 转换为优化的 CUDA 内核,在特定操作上实现了与 PyTorch 相当甚至更优的性能。文章详细阐述了该编译器的优化过程、降级规则以及用于生成高效融合 GPU 内核的 CLI 用法。