突破均匀性陷阱:通过SplitMoE扩展视频扩散模型
摘要
提出了SplitMoE,一种分裂角色稀疏架构,旨在打破Mixture-of-Experts (MoE)中的均匀性,以扩展视频扩散模型,提高收敛速度和视频生成质量。
查看缓存全文
缓存时间: 2026/09/30 08:19
论文页面 - 突破均匀性陷阱:通过SplitMoE扩展视频扩散模型
来源:https://huggingface.co/papers/2609.38140
发布于9月29日
·
由https://huggingface.co/YUXU915提交
Yu Xu (https://huggingface.co/YUXU915)于9月30日
摘要
混合专家模型(MoE)因大型语言模型的推广而流行,是扩展视觉生成模型的一种有前景的范式。然而,传统的token级MoE在同构专家池中独立路由token,并正则化专家使用以趋向均匀性,这使其难以适配具有时空冗余性和语义长尾分布的视频数据。我们发现现有视觉MoE陷入了“均匀性陷阱“:语义组织不足的路由机制,加上均匀的专家使用正则化,将连贯的图像块分散到不同专家中,导致路由碎片化和结构失真。为解决这一问题,我们提出SplitMoE——一种打破均匀性束缚的角色分离稀疏架构。为适应固有的语义不平衡,我们明确将专家池划分为语义专家和通用专家,其中语义专家捕捉高层语义抽象,通用专家保留残差视觉信息与灵活生成能力。借助原型引导路由与拉推正则化,SplitMoE使token能依据语义属性自然聚类,而非受限于任意平衡约束。大量实验表明,在相同激活参数预算下,SplitMoE在收敛速度、路由连贯性和视频生成质量上均优于传统负载平衡MoE,各项标准基准测试均表现优异。通过揭示涌现的由粗到细去噪逻辑,SplitMoE为社区提供了一种模态感知的扩展路径,为构建大规模视频世界模型提供了关键参考。
查看arXiv页面 (https://arxiv.org/abs/2609.38140)查看PDF (https://arxiv.org/pdf/2609.38140)项目页面 (https://yuci-gpt.github.io/SplitMoE/)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.38140)
通过智能体获取此论文:
hf papers read 2609\.38140
没有最新CLI?运行:curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型链接本文
在模型README.md中引用arxiv.org/abs/2609.38140以从此页面建立链接
引用本文的数据集 0
暂无数据集链接本文
在数据集README.md中引用arxiv.org/abs/2609.38140以从此页面建立链接
引用本文的空间应用 0
暂无空间应用链接本文
在空间应用README.md中引用arxiv.org/abs/2609.38140以从此页面建立链接
包含本文的收藏夹 0
暂无收藏夹收录本文
将本文添加至收藏夹 (https://huggingface.co/new-collection)以从此页面建立链接
相似文章
Dynamic-in-Few-Step: 统一动态计算与少步蒸馏的高效视频生成
本文提出了一种针对视频扩散模型的后训练加速框架,将动态结构稀疏化与少步蒸馏相结合,在保持生成质量的同时实现了显著加速。
Flex-Forcing:迈向统一的自回归与双向视频扩散模型
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
MoE-ViE:高效图像与视频理解的混合专家视觉编码器
本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。
聚焦关键:扩散MoE中利用显著性的精准路由
SharpMoE是一个后训练框架,通过使用干净的潜在特征识别显著令牌和轨迹路由损失来精确分配计算资源,改进扩散混合专家模型中的路由,实现了最先进的视觉生成。
MoTE: 多任务视频理解中的任务专家混合
MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。