@nrehiew_: 这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算预期的计算/…
摘要
这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。
这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算训练步骤中预期的计算/通信时长。
例如,在Blackwell NVL72上采用1T Dsv3风格MoE,可以预期什么样的理论MFU?最大的瓶颈是什么?https://t.co/l1WZIVh3oe
查看缓存全文
缓存时间: 2026/07/16 00:01
这太棒了!一个有趣的后续问题是,给定任意的拓扑结构和架构,计算训练步骤中预期的计算/通信时长是多少?
假设在Blackwell NVL72上运行一个1T参数的Dsv3风格MoE模型,理论上能达到什么样的MFU?最大的瓶颈是什么?https://t.co/l1WZIVh3oe
Aleksa Gordić (水平问题) (@gordic_aleksa): 全新的深度博客文章来了:“深入TPU与GPU集群:集体通信的解剖”。
如果你想深入理解扩展MoE和密集Transformer训练/推理背后的核心原语,就需要深入到FSDP、专家并行、数据并行的下一层。
相似文章
@akshay_pachaar: https://x.com/akshay_pachaar/status/2087928032904523980
一条科普帖,讲解GPU的工作原理,重点在于主导LLM服务性能的内存-计算不对称性,并说明量化、投机解码和连续批处理等技术如何从这一根本约束出发。
@vivekgalatage: 了解TPU的系统架构非常有趣。 https://henryhmko.github.io/posts/tpu/tpu.html…
深入探讨谷歌TPU架构,解释脉动阵列、流水线和提前编译的设计理念,这些设计带来了高吞吐量和能效。
@SzymonOzog_: 周六阅读:“What happens when you run a CUDA kernel”——非常酷的博客文章,详细介绍了CPU与GPU通信的细节…
推荐一篇博客文章的推文,该文章解释了启动CUDA内核时所需的CPU-GPU通信细节。
@jerryjliu0: 我从博客/系统卡中观察到一件有趣的事情:在相当一部分报告的基准测试中(大约20-30%……
观察到与xhigh相比,Claude Opus 5的max thinking在大约20-30%的基准测试中导致性能下降,这与增加测试时计算量可提升性能的预期相反。
@jino_rohit: https://x.com/jino_rohit/status/2067620031517860243
解释多GPU系统的通信模型,涵盖延迟与带宽之间的权衡,并比较MST和Ring算法在广播等集合操作中的应用。