标签
本文探讨了将计算着色器集成到p5.js中,以通过分层学习简化GPU编程教学,解决计算机图形学中的教育挑战。
NVIDIA 推出 CUDA Rust,提供两种途径(SIMT 和 Tile),用于原生用 Rust 编写 GPU 内核,从而提升 AI 系统的性能和开发体验。
一篇社交媒体帖子,突出了Cerebras CTO关于GPU编程和AI硬件架构的演讲,并指出尽管内容信息量大,但观看次数很少。
本文详细介绍了 GPU 内存写入的过程,追踪了 STG.E 指令在 RTX 4090 上通过各种硬件组件如负载/存储单元、合并器和 L1 缓存的执行路径。
Pngine是一个用于WebGPU的声明式格式与运行时,它使用S表达式来简化WebGPU配置的声明与验证,支持跨平台共享,并能导出为HTML或嵌入运行时的PNG等格式。
William Brandon(Anthropic 性能工程师)的 GPU 编程基础讲座摘要,强调理解 GPU 硬件的流式多处理器(SM)结构是预测性能的关键,而非仅从线程块/线程的软件抽象出发。
一篇更新的CUDA编程初学者友好教程,涵盖如何编写简单的内核在GPU上对数组进行加法运算。
@TheAhmadOsman 发布的一条推文,指向一个学习AI内核工作原理的资源。
Modular 宣布了 Mojo 101 第二周的内容,这是一个为期四周的免费直播课程,由打造 Mojo 的工程师亲自授课,介绍如何用 Mojo 编程,即将到来的课程将涵盖值所有权和元编程。
本文详细介绍了当CUDA内核被编译并在NVIDIA GPU上执行时发生的情况,涵盖了编译为PTX和SASS的过程,以及底层硬件的交互。
Modular正在举办一场名为Mojo 101的讲座,内容涵盖从语法到GPU编程,旨在教授Mojo语言。
《CUDA手册》是一本全面指导使用CUDA进行GPU编程的书籍,现已在线提供,支持带广告的免费阅读或通过会员无广告阅读。该书涵盖架构、API和算法,并附带开源代码。
Claude Fable 使用 pyptx DSL 为 NVIDIA B200 编写了一个 FlashAttention 前向内核,其性能与手动调优的 CUTLASS 内核接近,展示了 AI 代理在编译器和 DSL 设计中的潜力。
Manning Books 推荐 Elliot Arledge 的《CUDA for Deep Learning》,这本书教授使用CUDA进行GPU级编程,以优化深度学习模型性能,折扣持续到周日。
一条详细总结《大规模并行处理器编程》一书的推文串,重点介绍CUDA和GPU编程概念、优化技术以及并行模式。
强烈推荐,由Ben Spector讲授的4.5小时GPU编程课程,深入介绍CUDA和ThunderKittens,提供内核优化的幕后视角。
一位开发了NVIDIA现用于TensorRT-LLM的内核的CMU博士讲解了快速注意力,内容涵盖融合CUDA内核、FlashInfer、Triton和分页KV注意力,使同一GPU每秒能处理更多token。
Meta的一位PyTorch核心工程师展示了一个快速的CUDA内核优化循环,其性能优于昂贵的训练营,获胜代码通过KernelBot竞赛合并到了PyTorch中。