@levidiamode: Day 138/365 of GPU Programming 今年我最喜欢的讲座之一是斯坦福大学的CS336第7讲关于GPU…
摘要
一位学习者分享了对斯坦福大学CS336第7讲关于GPU并行性的热情,该讲座涵盖了基本操作,并将其连接到多GPU设置以及张量并行、数据并行和流水线并行等技术。
查看缓存全文
缓存时间: 2026/05/22 17:56
GPU 编程的第 138/365 天
今年我最喜欢的课程之一是斯坦福大学 CS336 的第 7 讲,主题是 GPU 并行。该讲座的第一部分从基本原理出发,系统讲解了广播、散射、收集、规约、全收集和全交换等基本操作,并直观地展示了这些操作如何与多 GPU 配置相关联。
随后在第二部分,讲师将这些原理与张量并行、数据并行和流水线并行联系起来。我特别喜欢这堂课的教学方法,因为它直接切入实践细节,并提供了代码示例,让你直观地看到这些概念在代码库中是如何呈现的。
levi (@levidiamode): GPU 编程的第 137/365 天
我有一阵子没做复习总结了。这几天我翻看笔记,重读几篇论文,仍在努力消化理解。
过去一周对于形成初步理解确实很有帮助。
相似文章
@levidiamode: 183/365 GPU编程 - 由@bfspector (TK合作作者, 斯坦福博士生)讲授的4.5小时CUDA + ThunderKittens课程…
强烈推荐,由Ben Spector讲授的4.5小时GPU编程课程,深入介绍CUDA和ThunderKittens,提供内核优化的幕后视角。
@levidiamode: GPU编程第157/365天:另一个对我非常有帮助的FlashAttention4资源是@charles_irl的演讲…
一个每日GPU编程帖子重点介绍了Charles_irl的演讲,该演讲在论文发布前逆向工程了FlashAttention4代码,并赞扬了Modal团队对代码的深入剖析和对前向传播的合理推断。
@Hesamation: 斯坦福大学发布了最新的并行编程、GPU和CUDA课程。24小时,19节课。这是最热门的...
斯坦福大学发布了一门关于并行编程、GPU和CUDA的免费课程,包含24小时的视频内容和19节课,涵盖GPU架构、CUDA以及性能优化。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
@levidiamode: GPU编程第158/365天——我觉得我大致理解了FlashAttention 2、3和4前向传播的高级区别…
作者记录了学习GPU编程的进展,重点在于理解FlashAttention 2、3和4前向传播的高级区别,并列出了需要进一步探索的几个底层概念。