VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending 论文

摘要

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

近期视频理解领域的进展涵盖了动作、长视频和流式交互,推动该领域向实际应用迈进。尽管取得了这些进展,当前的开源模型在多个方面仍存在局限。它们通常难以泛化到多种视频类型,因此仅在特定领域有效。高计算需求进一步限制了其效率和可扩展性。此外,大多数模型仅部分开源,训练代码、策略或数据集等关键组件不可用,这阻碍了可复现性并减缓了社区驱动的发展。 为解决这些问题,我们提出了VideoChat3,一个完全开源、高效且通用的以视频为中心的MLLM。VideoChat3通过两种互补设计推进视频理解。在效率方面,我们引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,这实现了高效的时空表示,并降低了训练和推理过程中处理视频输入的成本。在效果方面,我们开发了一个可扩展的视频数据合成管道,策划了三个多样化、高质量的训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K和VideoChat3-OL617K,覆盖通用、长视频和流式视频场景,提升了模型在各个领域的泛化能力。 通过整合这些设计,VideoChat3在广泛泛化与计算效率之间实现了罕见的平衡。在通用、长视频和流式基准测试上的实验表明,VideoChat3仅凭4B参数和更高的效率就超越了参数数量相同或更大的先前开源模型。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:38

论文页面 - VideoChat3:完全开源的高效通用视频多模态大模型

来源:https://huggingface.co/papers/2607.14935 发表于 7月16日

#2 今日论文 (https://huggingface.co/papers/date/2026-07-17) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

近期视频理解领域的进展已涵盖运动、长视频和流式交互,推动该领域向实际应用迈进。尽管有这些进步,当前开源模型在多个方面仍然受限。它们往往难以在不同视频类型间泛化,仅能在特定领域有效;高计算需求进一步制约了其效率与可扩展性;此外,大多数模型仅部分开源,诸如训练代码、策略或数据集等关键组件缺失,阻碍了可复现性和社区驱动的发展。为解决这些问题,我们提出了VideoChat3——一个完全开源、高效且通用的视频中心多模态大模型。VideoChat3通过两种互补设计推进视频理解。在效率方面,我们引入了膨胀3D视觉Transformer(I3D-ViT)和面向流式视频感知的自适应帧分辨率,可高效实现时空表示,并降低训练和推理过程中处理视频输入的成本。在效果方面,我们开发了一条可扩展的视频数据合成流水线,策划了三个多样化、高质量的训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K和VideoChat3-OL617K,覆盖通用、长视频和流式视频场景,提升了模型在多个领域的泛化能力。通过整合这些设计,VideoChat3实现了广泛泛化与计算效率之间罕见的平衡。在通用、长视频和流式基准上的实验表明,仅凭4B参数,VideoChat3即可超越此前参数量相同或更大的开源模型,并具备更高的效率。

查看 arXiv 页面 (https://arxiv.org/abs/2607.14935)查看 PDF (https://arxiv.org/pdf/2607.14935)项目页面 (https://mcg-nju.github.io/VideoChat3)GitHub108 (https://github.com/MCG-NJU/VideoChat3)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14935)

在您的代理中获取此论文:

hf papers read 2607\.14935

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 2

MCG-NJU/VideoChat3-4B 视频-文本到文本• 4B• 更新于3天前 • 342 • 13 (https://huggingface.co/MCG-NJU/VideoChat3-4B)

MCG-NJU/I3D-ViT 图像特征提取• 0.4B• 更新于3天前 • 62 • 8 (https://huggingface.co/MCG-NJU/I3D-ViT)

引用此论文的数据集 3

MCG-NJU/VideoChat3-LV116k 查看器• 更新于约21小时前 • 8.07k • 7.59k • 10 (https://huggingface.co/datasets/MCG-NJU/VideoChat3-LV116k)

MCG-NJU/VideoChat3-Academic2M 查看器• 更新于约21小时前 • 19.2k • 1.98k • 14 (https://huggingface.co/datasets/MCG-NJU/VideoChat3-Academic2M)

MCG-NJU/VideoChat3-OL617k 预览• 更新于3天前 • 280 • 8 (https://huggingface.co/datasets/MCG-NJU/VideoChat3-OL617k)

引用此论文的 Space 0

暂无引用此论文的 Space

请在 Space 的 README.md 中引用 arxiv.org/abs/2607.14935,以便从该页面链接。

包含此论文的合集 6

浏览包含此论文的 6 个合集 (https://huggingface.co/collections?paper=2607.14935)

相似文章

LoomVideo:统一多模态输入的视频生成与编辑

Hugging Face Daily Papers

LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。

Mage-VL:一种高效的编解码原生流式多模态基础模型

Hugging Face Daily Papers

Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。