@aryanvs_: 在外行人看来,这也许只是噪音。但这里蕴藏着数月来编写编译器的努力,最好的部分…

X AI KOLs Timeline 工具

摘要

一位开发者分享了数月来构建一个编译器的成果,该编译器在A100 GPU上的矩阵乘法性能超越了cuBLAS,并附带了可视化效果。

在外行人看来,这也许只是噪音。但这里蕴藏着数月来编写编译器的努力。 编写编译器最棒的地方在于,你可以超越cublas,并享受制作酷炫的可视化效果,这些效果隐藏着同样的技巧 😍 a100 matmul: https://t.co/lhyyOHtPJX
查看原文
查看缓存全文

缓存时间: 2026/06/29 00:21

在外行人看来,这可能只是噪声。但其中蕴藏着数月来编写编译器的努力。

编写编译器的最大乐趣在于,你能够超越 cublas 的性能,同时还能做出炫酷的可视化,展示隐藏在其中的相同技巧 😍

a100 matmul: https://t.co/lhyyOHtPJX

相似文章

一个可定制的编译器,用于为AI模型生成高效的融合GPU内核 [P]

Reddit r/MachineLearning

作者介绍了一款用 Python 编写、高度可定制且易于修改的 ML 编译器。该编译器通过多级 IR 流水线将 LLMs 转换为优化的 CUDA 内核,在特定操作上实现了与 PyTorch 相当甚至更优的性能。文章详细阐述了该编译器的优化过程、降级规则以及用于生成高效融合 GPU 内核的 CLI 用法。