@charles_irl:巨内核文献摘要
摘要
由用户 @charles_irl 分享的一条总结巨内核学术文献的社交媒体帖子。
巨内核文献摘要
相似文章
@Akashi203: 我开源了 AutoMegaKernel —— 将任意 HuggingFace 模型编译成一个持久的单一兆核,batch-1 解码带宽受限……
AutoMegaKernel 是一个开源代理框架,能将任意 HuggingFace 模型编译成一个持久的单一兆核(megakernel),将整个前向传播融合到一次 GPU 启动中,从而减少开销。在 L4 和 L40S 等推理级 GPU 上,它相比使用 CUDA Graph 的 cuBLAS 实现了最高 1.33 倍的加速,同时保证调度没有死锁和竞争条件。
🤗 Kernels: 重大更新
Hugging Face 为其 Kernels 项目引入了重大更新,包括 Hub 上的新仓库类型、通过可信发布者和内核签名改进的安全性、改版的 CLI、扩展的框架/后端支持,以及为智能内核开发奠定基础。
或许我们该重新审视微内核
本文认为,现代硬件(特别是IOMMU)通过消除上下文切换的开销,使微内核再次变得可行,并建议重新审视微内核设计以提高安全性和可靠性。
@ariG23498: 当我第一次从@cHHillee的博客文章“Making Deep Learning Go Brrrr From …”中听说内核融合时,我着迷了。
作者分享了对内核融合的兴奋之情,并演示了使用HuggingFace的kernels项目对GeGLU FFN融合的Liger内核进行性能分析,指出这个分析结果非常漂亮。
@TheAhmadOsman: 你想了解这些AI内核是如何工作的吗?从这里开始
@TheAhmadOsman 发布的一条推文,指向一个学习AI内核工作原理的资源。