@aryanvs_: 在外行人看来,这也许只是噪音。但这里蕴藏着数月来编写编译器的努力,最好的部分…
摘要
一位开发者分享了数月来构建一个编译器的成果,该编译器在A100 GPU上的矩阵乘法性能超越了cuBLAS,并附带了可视化效果。
查看缓存全文
缓存时间: 2026/06/29 00:21
在外行人看来,这可能只是噪声。但其中蕴藏着数月来编写编译器的努力。
编写编译器的最大乐趣在于,你能够超越 cublas 的性能,同时还能做出炫酷的可视化,展示隐藏在其中的相同技巧 😍
a100 matmul: https://t.co/lhyyOHtPJX
相似文章
@akshay_pachaar: https://x.com/akshay_pachaar/status/2087928032904523980
一条科普帖,讲解GPU的工作原理,重点在于主导LLM服务性能的内存-计算不对称性,并说明量化、投机解码和连续批处理等技术如何从这一根本约束出发。
@charles_irl: https://x.com/charles_irl/status/2071606346844442871
本文通过一个简单的向量加法示例,详细介绍了CUDA内核从源代码到硬件执行的编译和启动全过程,并阐述了nvcc、PTX、SASS及ioctls的作用。
@sumitdotml: 2026年第25周:C语言中CPU张量核心基础(加法/乘法、归约、步长、2D矩阵乘法等),阅读Arcee的一些内容
作者分享了用C语言构建纯CPU张量库的进展,涵盖了加法/乘法、归约、步长和2D矩阵乘法等基础知识,以及从阅读Arcee关于基础模型的技术博客中获得的见解。
一个可定制的编译器,用于为AI模型生成高效的融合GPU内核 [P]
作者介绍了一款用 Python 编写、高度可定制且易于修改的 ML 编译器。该编译器通过多级 IR 流水线将 LLMs 转换为优化的 CUDA 内核,在特定操作上实现了与 PyTorch 相当甚至更优的性能。文章详细阐述了该编译器的优化过程、降级规则以及用于生成高效融合 GPU 内核的 CLI 用法。
@vikhyatk: 厌倦了手动调优GPU内核,所以我们构建了一个编译器。Photon 2.0 将 Moondream、Qwen 3.5 和 Gemma 4 编译成……
Photon 2.0 是一个新的推理引擎和编译器,可将 Moondream、Qwen 3.5 和 Gemma 4 等模型编译为巨型内核,声称在物理AI工作负载上比 vLLM 和 SGLang 的吞吐量高达 2.3 倍。