EasyBalance:分布式MoE推理中的跨层负载均衡
摘要
本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。
arXiv:2608.07964v1 公告类型:新
摘要:负载均衡已成为专家并行分布式推理混合专家(MoE)模型中的一个关键问题。由于路由分布通常在专家之间呈偏斜状态,承载较轻负载专家的设备在专家计算期间必须空闲等待最重的专家,从而导致效率低下。现有的负载均衡方法主要依赖于层内的专家复制或迁移,这引入了额外开销并限制了其灵活性和可扩展性。为解决此问题,我们提出了EasyBalance,一种跨层负载均衡策略,该策略无需修改专家-设备映射,可实现即时适应性且几乎不产生额外开销。我们的关键见解是:(1)其他层的专家可被视为当前层的天然冗余;(2)跨层MoE工作负载可以联合执行以缓解各自的不均衡。基于这些观察,EasyBalance在每个MoE步骤贪婪地调度一部分跨层工作负载运行,并将剩余工作负载延迟到未来的均衡机会,从而有效利用跨层不均衡缓解。跨模型、任务和配置的大量实验表明,EasyBalance持续加速分布式MoE推理,将GPU空闲时间大多减少40%以上。代码可在 https://github.com/yize-wu/EasyInfra 获取。
查看缓存全文
缓存时间: 2026/08/11 08:08
# EasyBalance:分布式MoE推理中的跨层负载均衡 来源:https://arxiv.org/html/2608.07964 ###### 摘要 负载均衡已成为专家并行(expert-parallel)分布式混合专家(MoE)模型推理中的一个关键问题。由于路由分布通常在各专家间呈现偏斜,承载负载较轻专家的设备必须空闲等待最重负载专家完成计算,从而导致效率低下。现有的负载均衡方法主要依赖每层内的专家复制或迁移,这会引入额外开销并限制其灵活性和可扩展性。为解决此问题,我们提出EasyBalance,一种跨层负载均衡策略,它无需修改专家-设备映射,能够即时适应且几乎不引入额外开销。我们的关键洞察是:(1)其他层的专家可被视为当前层的天然“冗余”专家,(2)跨层MoE工作负载可以联合执行以缓解各自的负载不均衡。基于这些观察,EasyBalance贪婪地调度一部分跨层工作负载在每一步MoE计算中执行,并将剩余工作负载延迟到未来的均衡机会,从而有效利用跨层不均衡缓解机制。跨模型、
相似文章
多层级MoE缓存
讨论MoE模型的多层级缓存策略,通过将频繁激活的专家保留在GPU上来提升推理速度,参考了PowerInfer和llama.cpp分支等现有实现。
$\phi$-平衡:面向混合专家训练
本文提出φ-平衡,一种面向混合专家模型中负载平衡的理论框架,直接针对总体层面专家平衡,利用凸对偶和镜像下降,实现更稳定的专家利用率,并在推理和代码生成基准上超越先前方法。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
Director: 通过在线主动专家放置加速分布式MoE服务
本文介绍了Director,一个分布式MoE服务系统,通过预测驱动的在线主动专家放置来最小化端到端延迟。它采用轻量级预测器和基于松弛法的优化器,对Mistral、DeepSeek和Qwen等模型可实现高达55%的延迟降低。
内部松弛,全局均衡:面向视觉-语言混合专家模型的几何引导负载均衡方法
本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。