内部松弛,全局均衡:面向视觉-语言混合专家模型的几何引导负载均衡方法

Hugging Face Daily Papers 论文

摘要

本文提出 ReBA(Relax Within, Balance Across),一种面向视觉-语言混合专家模型的几何引导负载均衡方法。该方法通过分别平衡图像和文本标记,并对相关的视觉标记进行分组,来解决特定模态的路由不平衡问题,从而提升在不同分辨率和组合变化下的鲁棒性。

视觉-语言 MoE 批次中包含不同数量的图像和文本标记。图像分辨率、图像数量、图像切块和提示长度都会改变这种标记组成。我们将标准的标记级 Switch 辅助损失称为 Std-Aux。Std-Aux 仅对混合负载进行均衡,因此在某种混合比例下,图像和文本的较大负载误差可能会相互抵消。在我们的主模型上,同一个训练好的路由器在不同图像分辨率下的负载不平衡变化超过五倍。我们固定图像和文本的负载分布,推导出随标记混合比例变化的精确负载曲线。图像与文本负载之间的差距决定了模型对标记混合比例的敏感度。物理预处理也可能改变条件分布。固定分布规律不包含这类变化。为了设计解决方案,我们检查了路由器的输入结构。图像和文本占据不同的区域,而视觉标记则按源图像强烈聚集。模态边界促使我们分别设置图像和文本的损失项。图像边界促使我们对每张图像使用一个等权重路由实例。ReBA(即 Relax Within, Balance Across)实现了这两种选择。在四种拆分主干网络上,ReBA 在所有已报告的基准输入上均降低了负载,同时保持了与 Std-Aux 相当的平均任务准确率。ReBA 还降低了测试范围内的平均负载,以及在分辨率和切块变化下的最差物理负载。代码可在 https://github.com/ZiangWu-77/ReBA 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/04 09:38

论文页面 - 内部放松,跨域平衡:面向视觉-语言混合专家模型的多模态几何引导负载均衡

来源:https://huggingface.co/papers/2608.00574 这项工作的起点是若干路由现象,我们认为它们可能不止对 ReBA 本身有用。

首先,混合均衡可能掩盖了大规模模态特有的不均衡。 标准的 token 级辅助损失只观测组合后的图像–文本负载。因此,图像和文本可能各自发展出强烈且相互对立的专家偏好,在某种训练组合比例下恰好相互抵消。路由器在特定的图像–文本比例下看似均衡,但当图像分辨率、图像数量、动态分块或提示长度发生变化时,这种抵消就会被打破。

其次,对组合比例变化的敏感性由图像–文本负载差距所控制。 当条件图像和文本路由分布固定时,专家负载随图像 token 占比变化的曲线恰好是二次的。两种模态分布之间的差距越大,曲线越陡峭,低负载区域越窄。这说明仅仅平衡某一种训练组合比例是不够的;模态特定的分布本身也必须被拉近到均衡状态。

第三,路由器输入的几何结构揭示了两种自然的路由边界。 图像和文本 token 占据路由器输入的不同区域,这使得模态特定的路由捷径易于学习。在视觉模态内部,同一图像的块形成了强相关的路由集团,而不同图像之间则保持可度量的分离。这表明视觉的自然均衡单位是图像,而非单个的块 token。

这些观察引出了 ReBA —— 内部放松,跨域平衡:

  • 使用独立的模态目标来平衡图像和文本;
  • 对每张图像内部的强相关路由决策进行平均;
  • 在批次内均衡等权重的图像路由分布。

在四个分割视觉-语言混合专家(MoE)骨干网络上,ReBA 在保持平均任务精度相当的同时,持续降低了专家负载不均衡,并在图像分辨率、动态分块以及图像–文本组合比例变化下提升了鲁棒性。

💻 代码:https://github.com/ZiangWu-77/ReBA

我们尤其感兴趣的是,类似的模态和实例边界是否也会出现在其他原生多模态 MoE 中,以及这些路由现象如何能为未来的路由器目标提供指导。

相似文章

$\phi$-平衡:面向混合专家训练

arXiv cs.LG

本文提出φ-平衡,一种面向混合专家模型中负载平衡的理论框架,直接针对总体层面专家平衡,利用凸对偶和镜像下降,实现更稳定的专家利用率,并在推理和代码生成基准上超越先前方法。

EasyBalance:分布式MoE推理中的跨层负载均衡

arXiv cs.LG

本文提出了EasyBalance,一种用于分布式混合专家(MoE)推理的跨层负载均衡策略。该策略在不修改专家-设备映射的情况下,调度并联合执行来自不同层的工作负载,以减少GPU空闲时间。实验表明,该策略可将空闲时间减少40%以上。

通过标签空间重塑平衡多模态学习

arXiv cs.LG

介绍了平衡多模态标签重塑(BMLR),该方法通过重塑标签空间来平衡跨模态的映射难度,从而解决多模态学习中的模态不平衡问题,并在多种架构上提升性能。