内部松弛,全局均衡:面向视觉-语言混合专家模型的几何引导负载均衡方法
摘要
本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。
查看缓存全文
缓存时间: 2026/08/04 09:38
论文页面 - 内部放松,跨域平衡:面向视觉-语言混合专家模型的多模态几何引导负载均衡
来源:https://huggingface.co/papers/2608.00574 这项工作的起点是若干路由现象,我们认为它们可能不止对 ReBA 本身有用。
首先,混合均衡可能掩盖了大规模模态特有的不均衡。 标准的 token 级辅助损失只观测组合后的图像–文本负载。因此,图像和文本可能各自发展出强烈且相互对立的专家偏好,在某种训练组合比例下恰好相互抵消。路由器在特定的图像–文本比例下看似均衡,但当图像分辨率、图像数量、动态分块或提示长度发生变化时,这种抵消就会被打破。
其次,对组合比例变化的敏感性由图像–文本负载差距所控制。 当条件图像和文本路由分布固定时,专家负载随图像 token 占比变化的曲线恰好是二次的。两种模态分布之间的差距越大,曲线越陡峭,低负载区域越窄。这说明仅仅平衡某一种训练组合比例是不够的;模态特定的分布本身也必须被拉近到均衡状态。
第三,路由器输入的几何结构揭示了两种自然的路由边界。 图像和文本 token 占据路由器输入的不同区域,这使得模态特定的路由捷径易于学习。在视觉模态内部,同一图像的块形成了强相关的路由集团,而不同图像之间则保持可度量的分离。这表明视觉的自然均衡单位是图像,而非单个的块 token。
这些观察引出了 ReBA —— 内部放松,跨域平衡:
- 使用独立的模态目标来平衡图像和文本;
- 对每张图像内部的强相关路由决策进行平均;
- 在批次内均衡等权重的图像路由分布。
在四个分割视觉-语言混合专家(MoE)骨干网络上,ReBA 在保持平均任务精度相当的同时,持续降低了专家负载不均衡,并在图像分辨率、动态分块以及图像–文本组合比例变化下提升了鲁棒性。
💻 代码:https://github.com/ZiangWu-77/ReBA
我们尤其感兴趣的是,类似的模态和实例边界是否也会出现在其他原生多模态 MoE 中,以及这些路由现象如何能为未来的路由器目标提供指导。
相似文章
$\phi$-平衡:面向混合专家训练
本文提出φ-平衡,一种面向混合专家模型中负载平衡的理论框架,直接针对总体层面专家平衡,利用凸对偶和镜像下降,实现更稳定的专家利用率,并在推理和代码生成基准上超越先前方法。
EasyBalance:分布式MoE推理中的跨层负载均衡
本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。
DecoupleMix: 解耦比率搜索与凸优化分配用于可扩展的VLM数据配方
DecoupleMix引入了一个系统框架,通过解耦类间和类内比率搜索来优化视觉语言模型的预训练数据混合,使用凸优化来提升可扩展性和性能,超越启发式基线。
用于视觉-语言数据集蒸馏的Rank-Aware Hyperbolic Alignment
本文提出Rank-Aware Hyperbolic Alignment (RAHA),一种用于视觉-语言数据集蒸馏的方法,利用双曲几何和对齐容量控制,将大规模图像-文本数据集高效压缩为高质量的合成对。
通过标签空间重塑平衡多模态学习
介绍了平衡多模态标签重塑(BMLR),该方法通过重塑标签空间来平衡跨模态的映射难度,从而解决多模态学习中的模态不平衡问题,并在多种架构上提升性能。