@ariG23498: 当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From …”中听说内核融合时,我着迷了。
摘要
作者分享了对内核融合的兴奋之情,并演示了使用HuggingFace的kernels项目对GeGLU FFN融合的Liger内核进行性能分析,指出这个分析结果非常漂亮。
查看缓存全文
缓存时间: 2026/06/16 23:43
我第一次从@cHHillee的博客文章《Making Deep Learning Go Brrrr From First Principles》中听说内核融合时,感到非常着迷(是的,我是这篇文章的超级粉丝)。
我仍然是内核编程的新手,所以无法自己构建融合内核。@huggingface 的 kernels 项目救了我。我可以从Hub上的数百个内核中进行选择并对其进行分析。
在博客中,我们使用了 GeGLU FFN 融合 Liger 内核,其分析结果非常漂亮。
相似文章
@ariG23498: 我一直很钦佩 @stevhliu 的工作。我认为他的技术文章是最好的之一。在最新的……
一个系列帖文介绍了 Hugging Face 的 transformers 库如何高效加载模型,涵盖 meta device、safetensors、CUDA 缓存等内容。
@RisingSayak: Hugging Face 的内核项目正在成长!我们希望它成为内核开发者和内核用户的首选之地…
Hugging Face 的内核项目正在扩展,并寻求贡献者参与自主内核开发,为模型提供真正的优化价值。
🤗 Kernels: 重大更新
Hugging Face 为其 Kernels 项目引入了重大更新,包括 Hub 上的新仓库类型、通过可信发布者和内核签名改进的安全性、改版的 CLI、扩展的框架/后端支持,以及为智能内核开发奠定基础。
@googlegemma:“代理内核优化是端侧推理的未来” @xenovacom 使用 Fable 5 编写内核,将……
Xenova 使用 Fable 5 编写优化内核,在 M4 上的 WebGPU 中为 Gemma 4 实现了每秒 255 个 token 的速度,展示了用于端侧推理的代理内核优化。
一个可定制的编译器,用于为AI模型生成高效的融合GPU内核 [P]
作者介绍了一款用 Python 编写、高度可定制且易于修改的 ML 编译器。该编译器通过多级 IR 流水线将 LLMs 转换为优化的 CUDA 内核,在特定操作上实现了与 PyTorch 相当甚至更优的性能。文章详细阐述了该编译器的优化过程、降级规则以及用于生成高效融合 GPU 内核的 CLI 用法。