突破均匀性陷阱:通过SplitMoE扩展视频扩散模型

Hugging Face Daily Papers 论文

摘要

提出了SplitMoE,一种分裂角色稀疏架构,旨在打破Mixture-of-Experts (MoE)中的均匀性,以扩展视频扩散模型,提高收敛速度和视频生成质量。

Mixture-of-Experts (MoE),由大型语言模型推广而来,是一种扩展视觉生成模型的有前景范式。然而,传统的基于token的MoE在同质专家池中独立路由token,并将专家使用正则化为均匀性,这与视频数据的时空冗余和语义长尾特性匹配不佳。我们发现现有的视觉MoE陷入了均匀性陷阱:语义组织不足的路由,加上均匀的专家使用正则化,将连贯图像块分散到不同专家中,导致路由碎片化和结构失真。为此,我们提出SplitMoE,一种分裂角色稀疏架构,旨在打破均匀性的束缚。为适应固有的语义不平衡,我们显式地将专家池分为语义专家和通用专家,其中语义专家捕获高级语义抽象,通用专家保留残差视觉信息和灵活的生成能力。借助原型引导路由和推拉正则化,SplitMoE使token能根据语义属性自然聚类,而非任意平衡约束。大量结果表明,在等效激活参数预算下,SplitMoE在收敛速度、路由一致性和视频生成质量方面优于传统的负载均衡MoE,在标准基准测试中表现更优。通过揭示一种涌现的由粗到细的去噪逻辑,SplitMoE为社区提供了一种模态感知的扩展路径,为构建大规模视频世界模型提供关键参考。
查看原文
查看缓存全文

缓存时间: 2026/09/30 08:19

论文页面 - 突破均匀性陷阱:通过SplitMoE扩展视频扩散模型

来源:https://huggingface.co/papers/2609.38140
发布于9月29日

·

由https://huggingface.co/YUXU915提交

Yu Xu (https://huggingface.co/YUXU915)于9月30日

摘要

混合专家模型(MoE)因大型语言模型的推广而流行,是扩展视觉生成模型的一种有前景的范式。然而,传统的token级MoE在同构专家池中独立路由token,并正则化专家使用以趋向均匀性,这使其难以适配具有时空冗余性和语义长尾分布的视频数据。我们发现现有视觉MoE陷入了“均匀性陷阱“:语义组织不足的路由机制,加上均匀的专家使用正则化,将连贯的图像块分散到不同专家中,导致路由碎片化和结构失真。为解决这一问题,我们提出SplitMoE——一种打破均匀性束缚的角色分离稀疏架构。为适应固有的语义不平衡,我们明确将专家池划分为语义专家和通用专家,其中语义专家捕捉高层语义抽象,通用专家保留残差视觉信息与灵活生成能力。借助原型引导路由与拉推正则化,SplitMoE使token能依据语义属性自然聚类,而非受限于任意平衡约束。大量实验表明,在相同激活参数预算下,SplitMoE在收敛速度、路由连贯性和视频生成质量上均优于传统负载平衡MoE,各项标准基准测试均表现优异。通过揭示涌现的由粗到细去噪逻辑,SplitMoE为社区提供了一种模态感知的扩展路径,为构建大规模视频世界模型提供了关键参考。

查看arXiv页面 (https://arxiv.org/abs/2609.38140)查看PDF (https://arxiv.org/pdf/2609.38140)项目页面 (https://yuci-gpt.github.io/SplitMoE/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.38140)

通过智能体获取此论文:
hf papers read 2609\.38140

没有最新CLI?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型链接本文
在模型README.md中引用arxiv.org/abs/2609.38140以从此页面建立链接

引用本文的数据集 0

暂无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2609.38140以从此页面建立链接

引用本文的空间应用 0

暂无空间应用链接本文
在空间应用README.md中引用arxiv.org/abs/2609.38140以从此页面建立链接

包含本文的收藏夹 0

暂无收藏夹收录本文
将本文添加至收藏夹 (https://huggingface.co/new-collection)以从此页面建立链接

相似文章

Flex-Forcing:迈向统一的自回归与双向视频扩散模型

Hugging Face Daily Papers

介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。

聚焦关键:扩散MoE中利用显著性的精准路由

Hugging Face Daily Papers

SharpMoE是一个后训练框架,通过使用干净的潜在特征识别显著令牌和轨迹路由损失来精确分配计算资源,改进扩散混合专家模型中的路由,实现了最先进的视觉生成。