@Hikari_07_jp: 大家来看这篇文章!Jetha Chan是我理想中的工程师。他对SM100(数据…
摘要
Jetha Chan对SM100数据中心GPU的Attention核进行了反汇编,发现并修复了低效之处,从而显著提升了性能。
大家来看这篇文章!Jetha Chan是我理想中的工程师。他对SM100(数据中心GPU)的Attention核进行了反汇编,发现并修复了低效之处。结果令人惊叹,但更让我印象深刻的是他的方法。这篇文章对我来说真是一座宝库。谢谢你,Jetha Chan。
相似文章
@ekzhang1:我看着像这个家伙一样写真正的GPU内核的人 :)
AI模型Claude被用于使用pyptx DSL编写FlashAttention前向内核,在NVIDIA B200硬件上实现了与手工调优的FlashAttention-4近乎相同的性能。
@damnang2:本文完全向所有人开放。在这篇文章中,我介绍了两件事。第一,面向没有技术背景的读者…
一篇文章向非技术读者解释NVIDIA机架名称的结构,然后分析SemiAnalysis的最新帖子,以澄清关于中平面良率的含义。
@h100envy: 构建了NVIDIA TensorRT-LLM内核的CMU博士用68分钟讲解快速注意力——比1200美元的GPU课程更胜一筹
一位开发了NVIDIA现用于TensorRT-LLM的内核的CMU博士讲解了快速注意力,内容涵盖融合CUDA内核、FlashInfer、Triton和分页KV注意力,使同一GPU每秒能处理更多token。
@hamzaelshafie: 新深度博客文章:《剖析ThunderKittens:高性能AI内核的紧凑型DSL解剖》这篇帖子……
一篇详细分析ThunderKittens的博客文章,ThunderKittens是用于高性能AI内核的紧凑型DSL。文章包括从底向上的抽象分析,以及一个实现非因果注意力预填充内核的基准测试,该内核比FlashAttention-2快约1.55倍,与FlashAttention-3性能相当。
@AMD: 从系统启动到调优,AMD 与 @OpenAI 的工程师们正在分享见解,以进一步提升性能。深入合作幕后…
AMD 与 OpenAI 的工程师合作分享性能优化方面的见解,并邀请 OpenAI 计算策略副总裁 Sachin Katti 进行幕后解读。