MoTE: 多任务视频理解中的任务专家混合

Hugging Face Daily Papers 论文

摘要

MoTE 在多任务视频理解中引入了任务特定的专家路由,以替代密集的解码器前馈网络,通过可解释的稀疏计算提高了准确性和效率。

过程性视频语言模型必须从相同的视觉证据中解决异构任务,包括动作识别、预测和过程预测。密集的Transformer解码器在不同任务间共享相同的前馈网络,这可能会纠缠任务行为,并使受控的能力扩展变得困难。稀疏的专家混合(MoE)解码器提供了条件计算,但基于token的学习路由并未与任务级的过程性目标自然对齐。我们提出了MoTE(任务专家混合),这是一种解码器架构,将大型语言模型的前馈网络转换为任务特定的专家,同时保持多模态骨干网络共享。每个样本遵循一个样本级的任务路由,因此活跃的任务专家计算与存储的任务专家数量无关。我们将此设计实例化为VideoLLM-MoTE,并使用显式任务路由在五个COIN基准上进行评估。五专家模型每个样本激活约20亿LLM参数,并实现了比最近的VideoLLM基线更高的平均top-1准确率。在相同的专家拓扑下,它优于密集的全专家激活和学习的稀疏路由控制。这些结果表明,任务结构化路由为多任务视频语言学习提供了一种可解释且计算高效的解码器替代方案。
查看原文
查看缓存全文

缓存时间: 2026/08/26 15:17

论文页面 - MoTE:用于多任务视频理解的任务专家混合模型

来源:https://huggingface.co/papers/2608.24763

摘要

MoTE 用基于样本级任务标签路由的任务特定专家,替代了密集解码器前馈网络,通过稀疏、可解释的计算提升了多任务视频语言理解的准确性。

过程性视频语言(https://huggingface.co/papers?q=Procedural%20video-language)模型必须从相同的视觉证据中解决异构任务,包括动作识别、预测和流程预测。密集 Transformer 解码器(https://huggingface.co/papers?q=Dense%20transformer%20decoders)在不同任务间共享相同的前馈网络(https://huggingface.co/papers?q=feed-forward%20networks),这可能导致任务行为纠缠并使受控的能力扩展变得困难。稀疏混合专家(Mixture-of-Experts, https://huggingface.co/papers?q=Mixture-of-Experts)解码器提供了条件计算,但基于 token 的学习路由与基于任务的过程性目标并不自然契合。我们提出 MoTE(任务专家混合模型, https://huggingface.co/papers?q=MoTE),一种将大型语言模型的前馈网络(https://huggingface.co/papers?q=feed-forward%20networks)转化为任务特定专家(https://huggingface.co/papers?q=task-specific%20experts)的解码器架构,同时保持多模态主干网络(https://huggingface.co/papers?q=multimodal%20backbone)共享。每个样本遵循一个样本级任务路由,因此活跃的任务专家计算量与存储的任务专家数量无关。我们将此设计实例化为 VideoLLM-MoTE(https://huggingface.co/papers?q=VideoLLM-MoTE),并在五个 COIN 基准测试上使用显式任务路由进行评估。这个五专家模型每个样本激活约 20 亿 LLM 参数,平均 top-1 准确率高于近期的 VideoLLM 基线模型。在相同的专家拓扑结构下,它优于密集的全专家激活和学习稀疏路由控制。这些结果表明,任务结构化路由为多任务视频语言学习提供了一种可解释且计算高效的解码器替代方案。

查看 arXiv 页面 (https://arxiv.org/abs/2608.24763)查看 PDF (https://arxiv.org/pdf/2608.24763)项目主页 (https://pyxploiter.github.io/videollm-mote)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.24763)

在您的代理中获取此论文:

hf papers read 2608\.24763

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.24763,即可从此页面链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.24763,即可从此页面链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.24763,即可从此页面链接到它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)即可从此页面链接到它。

相似文章

MTP 在 MoE 中的重要性

Reddit r/LocalLLaMA

本文可能讨论了多任务提示(MTP)在混合专家模型(MoE)中的应用,探讨了 MTP 如何提高 MoE 架构的性能或效率。

Transformer 中的专家混合模型 (MoEs)

Hugging Face Blog

Hugging Face 的博客文章,介绍 Transformer 中的专家混合模型 (MoEs) 架构,涵盖从密集模型到稀疏模型的转变、权重加载优化、专家并行计算以及基于 MoE 的语言模型训练技术。