标签
本文解释了为什么在LLM中,用 top-2 MoE 替换稠密前馈层,尽管减少了每个令牌的FLOPs,但由于多GPU环境中的通信开销,可能会增加推理延迟。
一篇新的深入博客文章解释了多GPU的集体通信,涵盖广播和归约等原语,并帮助初学者理解如何扩展实验。