MoTE: 多任务视频理解中的任务专家混合
摘要
MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。
查看缓存全文
缓存时间: 2026/08/26 15:17
论文页面 - MoTE:用于多任务视频理解的任务专家混合模型
来源:https://huggingface.co/papers/2608.24763
摘要
MoTE 用基于样本级任务标签路由的任务特定专家,替代了密集解码器前馈网络,通过稀疏、可解释的计算提升了多任务视频语言理解的准确性。
过程性视频语言(https://huggingface.co/papers?q=Procedural%20video-language)模型必须从相同的视觉证据中解决异构任务,包括动作识别、预测和流程预测。密集 Transformer 解码器(https://huggingface.co/papers?q=Dense%20transformer%20decoders)在不同任务间共享相同的前馈网络(https://huggingface.co/papers?q=feed-forward%20networks),这可能导致任务行为纠缠并使受控的能力扩展变得困难。稀疏混合专家(Mixture-of-Experts, https://huggingface.co/papers?q=Mixture-of-Experts)解码器提供了条件计算,但基于 token 的学习路由与基于任务的过程性目标并不自然契合。我们提出 MoTE(任务专家混合模型, https://huggingface.co/papers?q=MoTE),一种将大型语言模型的前馈网络(https://huggingface.co/papers?q=feed-forward%20networks)转化为任务特定专家(https://huggingface.co/papers?q=task-specific%20experts)的解码器架构,同时保持多模态主干网络(https://huggingface.co/papers?q=multimodal%20backbone)共享。每个样本遵循一个样本级任务路由,因此活跃的任务专家计算量与存储的任务专家数量无关。我们将此设计实例化为 VideoLLM-MoTE(https://huggingface.co/papers?q=VideoLLM-MoTE),并在五个 COIN 基准测试上使用显式任务路由进行评估。这个五专家模型每个样本激活约 20 亿 LLM 参数,平均 top-1 准确率高于近期的 VideoLLM 基线模型。在相同的专家拓扑结构下,它优于密集的全专家激活和学习稀疏路由控制。这些结果表明,任务结构化路由为多任务视频语言学习提供了一种可解释且计算高效的解码器替代方案。
查看 arXiv 页面 (https://arxiv.org/abs/2608.24763)查看 PDF (https://arxiv.org/pdf/2608.24763)项目主页 (https://pyxploiter.github.io/videollm-mote)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.24763)
在您的代理中获取此论文:
hf papers read 2608\.24763
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.24763,即可从此页面链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.24763,即可从此页面链接到它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.24763,即可从此页面链接到它。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)即可从此页面链接到它。
相似文章
MoE-ViE:高效图像与视频理解的混合专家视觉编码器
本文介绍了MoE-ViE,一种混合专家视觉编码器,能够高效扩展以支持图像和视频理解,并以更低的推理延迟超越更大的密集模型。
先共享,再路由剩余:一种面向Token自适应MoE计算的统一框架
本文提出UniF-MoE,一种用于Token自适应混合专家计算的统一框架,该框架首先共享专家间的可复用计算,然后路由剩余的残余需求,从而在DomainBed和GLUE基准上提升性能,同时减少激活计算量、延迟和内存占用。
MTP 在 MoE 中的重要性
本文可能讨论了多任务提示(MTP)在混合专家模型(MoE)中的应用,探讨了 MTP 如何提高 MoE 架构的性能或效率。
Transformer 中的专家混合模型 (MoEs)
Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。
Mix-MoE:通过混合专家混合提升大语言模型的多语言机器翻译
Mix-MoE提出了一种混合专家混合框架,通过专门的专家组和傅里叶变换增强的路由机制来缓解多语言机器翻译中的参数干扰,相比基线方法取得了显著改进。