EasyBalance:分布式MoE推理中的跨层负载均衡

arXiv cs.LG 论文

摘要

本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。

arXiv:2608.07964v1 公告类型:新 摘要:负载均衡已成为专家并行分布式推理混合专家(MoE)模型中的一个关键问题。由于路由分布通常在专家之间呈偏斜状态,承载较轻负载专家的设备在专家计算期间必须空闲等待最重的专家,从而导致效率低下。现有的负载均衡方法主要依赖于层内的专家复制或迁移,这引入了额外开销并限制了其灵活性和可扩展性。为解决此问题,我们提出了EasyBalance,一种跨层负载均衡策略,该策略无需修改专家-设备映射,可实现即时适应性且几乎不产生额外开销。我们的关键见解是:(1)其他层的专家可被视为当前层的天然冗余;(2)跨层MoE工作负载可以联合执行以缓解各自的不均衡。基于这些观察,EasyBalance在每个MoE步骤贪婪地调度一部分跨层工作负载运行,并将剩余工作负载延迟到未来的均衡机会,从而有效利用跨层不均衡缓解。跨模型、任务和配置的大量实验表明,EasyBalance持续加速分布式MoE推理,将GPU空闲时间大多减少40%以上。代码可在 https://github.com/yize-wu/EasyInfra 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:08

# EasyBalance:分布式MoE推理中的跨层负载均衡

来源:https://arxiv.org/html/2608.07964

###### 摘要

负载均衡已成为专家并行(expert-parallel)分布式混合专家(MoE)模型推理中的一个关键问题。由于路由分布通常在各专家间呈现偏斜,承载负载较轻专家的设备必须空闲等待最重负载专家完成计算,从而导致效率低下。现有的负载均衡方法主要依赖每层内的专家复制或迁移,这会引入额外开销并限制其灵活性和可扩展性。为解决此问题,我们提出EasyBalance,一种跨层负载均衡策略,它无需修改专家-设备映射,能够即时适应且几乎不引入额外开销。我们的关键洞察是:(1)其他层的专家可被视为当前层的天然“冗余”专家,(2)跨层MoE工作负载可以联合执行以缓解各自的负载不均衡。基于这些观察,EasyBalance贪婪地调度一部分跨层工作负载在每一步MoE计算中执行,并将剩余工作负载延迟到未来的均衡机会,从而有效利用跨层不均衡缓解机制。跨模型、

相似文章

多层级MoE缓存

Reddit r/LocalLLaMA

讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。

$\phi$-平衡:面向混合专家训练

arXiv cs.LG

本文提出φ-平衡,一种面向混合专家模型中负载平衡的理论框架,直接针对总体层面专家平衡,利用凸对偶和镜像下降,实现更稳定的专家利用率,并在推理和代码生成基准上超越先前方法。

Director: 通过在线主动专家放置加速分布式MoE服务

arXiv cs.LG

本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。