MoE-ViE:高效图像与视频理解的混合专家视觉编码器

Hugging Face Daily Papers 论文

摘要

本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。

视觉编码器是视觉-语言模型的关键组件,有效扩展其能力能提升性能。然而,密集扩展会增加计算成本和推理延迟。混合专家架构提供了一个引人注目的替代方案,已在大语言模型中实现了高效扩展,但针对CLIP风格视觉编码器的混合专家设计空间在最先进水平上仍待探索。在这项工作中,我们系统研究了视觉编码器扩展的混合专家设计,发现细粒度混合专家拓扑在密集和标准混合专家对应物中均产生了显著增益。我们进一步提出了一种无辅助损失平衡变体以优化专家利用,并设计了一个专门的混合专家内核来缓解推理延迟开销。为增强视频能力同时保留图像知识,我们引入了帧级蒸馏与一种新型冻结机制。我们预训练了一系列混合专家视觉编码器,覆盖多种规模,均一致超越其密集对应物。我们最大的模型在零样本性能上匹配了规模为其1.7倍的SOTA编码器,同时仅使用其76%的延迟。当与大语言模型对齐时,MoE-ViE在图像和视频基准测试中超越所有比较的编码器,包括那些激活参数多达5倍的模型。代码可在https://github.com/facebookresearch/moe_vie获取。
查看原文
查看缓存全文

缓存时间: 2026/08/19 11:58

论文页面 - MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器

来源:https://huggingface.co/papers/2608.17402 作者:

,

,

,

,

,

,

,

,

,

,

摘要

采用细粒度拓扑、无辅助损失平衡机制及专用内核的混合专家视觉编码器,能够实现高效扩展,并在图像与视频任务上超越了更大的稠密模型。

视觉编码器(https://huggingface.co/papers?q=Vision%20encoder)是视觉语言模型的关键组件,有效扩展其容量能提升性能。然而,稠密扩展会增加计算成本和推理延迟(https://huggingface.co/papers?q=inference%20latency)。混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)架构(MoE(https://huggingface.co/papers?q=MoE))提供了一个引人注目的替代方案,已在大语言模型中实现了高效扩展,但针对CLIP(https://huggingface.co/papers?q=CLIP)风格视觉编码器(https://huggingface.co/papers?q=vision%20encoder)的MoE(https://huggingface.co/papers?q=MoE)设计空间在技术前沿(State-of-the-Art,SOTA)水平上仍有待探索。本文系统性地研究了用于视觉编码器(https://huggingface.co/papers?q=vision%20encoder)扩展的MoE(https://huggingface.co/papers?q=MoE)设计,发现细粒度MoE(https://huggingface.co/papers?q=fine-grained%20MoE)拓扑结构相比稠密模型和标准MoE(https://huggingface.co/papers?q=MoE)对应物均能带来显著增益。我们进一步提出了一种无辅助损失平衡(https://huggingface.co/papers?q=auxiliary-loss-free%20balancing)变体以提升专家利用率(https://huggingface.co/papers?q=expert%20utilization),并设计了专用的MoE内核(https://huggingface.co/papers?q=MoE%20kernel)以缓解推理延迟(https://huggingface.co/papers?q=inference%20latency)开销。为在保持图像知识的同时增强视频处理能力,我们引入了帧级蒸馏(https://huggingface.co/papers?q=frame-level%20distillation)并结合了一种新颖的冻结机制(https://huggingface.co/papers?q=freezing%20mechanism)。我们预训练了一系列混合专家(https://huggingface.co/papers?q=Mixture-of-Experts)视觉编码器(https://huggingface.co/papers?q=Vision%20Encoder)(MoE-ViE(https://huggingface.co/papers?q=MoE-ViE)),涵盖多种规模,所有模型均持续优于其稠密对应模型。我们最大的模型在达到与规模大其1.7倍的SOTA编码器相当的零样本性能时,仅需后者76%的延迟。当与大语言模型对齐时,MoE-ViE(https://huggingface.co/papers?q=MoE-ViE)在图像和视频基准测试中超越了所有比较的编码器,包括那些激活参数多达5倍的模型。代码开源于:https://github.com/facebookresearch/moe_vie(https://huggingface.co/papers?q=moe_vie)。

查看arXiv页面(https://arxiv.org/abs/2608.17402)查看PDF(https://arxiv.org/pdf/2608.17402)GitHub0(https://github.com/facebookresearch/moe_vie)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.17402)

获取此论文到您的智能体:

hf papers read 2608.17402

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型3

facebook/MoEViE-H14-448 零样本图像分类• 约11小时前更新 • 9 • 2(https://huggingface.co/facebook/MoEViE-H14-448)

facebook/MoEViE-L16-384 零样本图像分类• 约11小时前更新 • 7 • 2(https://huggingface.co/facebook/MoEViE-L16-384)

facebook/MoEViE-B16-224 零样本图像分类• 约11小时前更新 • 8 • 1(https://huggingface.co/facebook/MoEViE-B16-224)

引用此论文的数据集0

没有链接此论文的数据集

在数据集README.md中引用arxiv.org/abs/2608.17402以从本页链接它。

引用此论文的Spac空间0

没有链接此论文的Space空间

在Space空间README.md中引用arxiv.org/abs/2608.17402以从本页链接它。

包含此论文的集合0

没有包含此论文的集合

将此论文添加到集合(https://huggingface.co/new-collection)以从本页链接它。

相似文章

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers

本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。

MobileMoE:扩展端侧混合专家模型

Hugging Face Daily Papers

MobileMoE 引入了高效的端侧混合专家语言模型,参数规模低于十亿,在性能和效率上均优于密集基线模型和现有的 MoE 模型。这些模型在开源数据集上训练,并在商用智能手机上展现出显著的加速效果。