@nrehiew_: 这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算预期的计算/…

X AI KOLs Timeline 新闻

摘要

这是一条对一篇关于TPU/GPU集群中集体通信的博客文章的推文回复,建议进行后续工作,计算在Blackwell NVL72上对1T MoE模型的预期计算/通信时长,并估算理论MFU和瓶颈。

这太棒了!一个有趣的后续是,给定任意拓扑和架构,计算训练步骤中预期的计算/通信时长。 例如,在Blackwell NVL72上采用1T Dsv3风格MoE,可以预期什么样的理论MFU?最大的瓶颈是什么?https://t.co/l1WZIVh3oe
查看原文
查看缓存全文

缓存时间: 2026/07/16 00:01

这太棒了!一个有趣的后续问题是,给定任意的拓扑结构和架构,计算训练步骤中预期的计算/通信时长是多少?

假设在Blackwell NVL72上运行一个1T参数的Dsv3风格MoE模型,理论上能达到什么样的MFU?最大的瓶颈是什么?https://t.co/l1WZIVh3oe

Aleksa Gordić (水平问题) (@gordic_aleksa): 全新的深度博客文章来了:“深入TPU与GPU集群:集体通信的解剖”。

如果你想深入理解扩展MoE和密集Transformer训练/推理背后的核心原语,就需要深入到FSDP、专家并行、数据并行的下一层。

相似文章