MoE-ViE:高效图像与视频理解的混合专家视觉编码器
摘要
本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。
查看缓存全文
缓存时间: 2026/08/19 11:58
论文页面 - MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器
来源:https://huggingface.co/papers/2608.17402 作者:
,
,
,
,
,
,
,
,
,
,
摘要
采用细粒度拓扑、无辅助损失平衡机制及专用内核的混合专家视觉编码器,能够实现高效扩展,并在图像与视频任务上超越了更大的稠密模型。
视觉编码器(https://huggingface.co/papers?q=Vision%20encoder)是视觉语言模型的关键组件,有效扩展其容量能提升性能。然而,稠密扩展会增加计算成本和推理延迟(https://huggingface.co/papers?q=inference%20latency)。混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)架构(MoE(https://huggingface.co/papers?q=MoE))提供了一个引人注目的替代方案,已在大语言模型中实现了高效扩展,但针对CLIP(https://huggingface.co/papers?q=CLIP)风格视觉编码器(https://huggingface.co/papers?q=vision%20encoder)的MoE(https://huggingface.co/papers?q=MoE)设计空间在技术前沿(State-of-the-Art,SOTA)水平上仍有待探索。本文系统性地研究了用于视觉编码器(https://huggingface.co/papers?q=vision%20encoder)扩展的MoE(https://huggingface.co/papers?q=MoE)设计,发现细粒度MoE(https://huggingface.co/papers?q=fine-grained%20MoE)拓扑结构相比稠密模型和标准MoE(https://huggingface.co/papers?q=MoE)对应物均能带来显著增益。我们进一步提出了一种无辅助损失平衡(https://huggingface.co/papers?q=auxiliary-loss-free%20balancing)变体以提升专家利用率(https://huggingface.co/papers?q=expert%20utilization),并设计了专用的MoE内核(https://huggingface.co/papers?q=MoE%20kernel)以缓解推理延迟(https://huggingface.co/papers?q=inference%20latency)开销。为在保持图像知识的同时增强视频处理能力,我们引入了帧级蒸馏(https://huggingface.co/papers?q=frame-level%20distillation)并结合了一种新颖的冻结机制(https://huggingface.co/papers?q=freezing%20mechanism)。我们预训练了一系列混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)视觉编码器(https://huggingface.co/papers?q=Vision%20Encoder)(MoE-ViE(https://huggingface.co/papers?q=MoE-ViE)),涵盖多种规模,所有模型均持续优于其稠密对应模型。我们最大的模型在达到与规模大其1.7倍的SOTA编码器相当的零样本性能时,仅需后者76%的延迟。当与大语言模型对齐时,MoE-ViE(https://huggingface.co/papers?q=MoE-ViE)在图像和视频基准测试中超越了所有比较的编码器,包括那些激活参数多达5倍的模型。代码开源于:https://github.com/facebookresearch/moe_vie(https://huggingface.co/papers?q=moe_vie)。
查看arXiv页面(https://arxiv.org/abs/2608.17402)查看PDF(https://arxiv.org/pdf/2608.17402)GitHub0(https://github.com/facebookresearch/moe_vie)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.17402)
获取此论文到您的智能体:
hf papers read 2608.17402
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型3
facebook/MoEViE-H14-448 零样本图像分类• 约11小时前更新 • 9 • 2(https://huggingface.co/facebook/MoEViE-H14-448)
facebook/MoEViE-L16-384 零样本图像分类• 约11小时前更新 • 7 • 2(https://huggingface.co/facebook/MoEViE-L16-384)
facebook/MoEViE-B16-224 零样本图像分类• 约11小时前更新 • 8 • 1(https://huggingface.co/facebook/MoEViE-B16-224)
引用此论文的数据集0
没有链接此论文的数据集
在数据集README.md中引用arxiv.org/abs/2608.17402以从本页链接它。
引用此论文的Spac空间0
没有链接此论文的Space空间
在Space空间README.md中引用arxiv.org/abs/2608.17402以从本页链接它。
包含此论文的集合0
没有包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)以从本页链接它。
相似文章
PuzzleMoE:通过稀疏专家合并和位打包推理实现大型混合专家模型的高效压缩
PuzzleMoE 提出了一种成对双掩码专家合并算法和位级打包技术,用于压缩大型混合专家模型,在保持性能的同时减少存储并加速推理。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
MobileMoE:扩展端侧混合专家模型
MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。
面向具身智能的Mixture-of-Experts视频预训练扩展
LingBot-Video提出了一个基于DiT的视频预训练框架,采用Mixture-of-Experts架构、专用数据增强和多维奖励系统,用于具身智能应用。