VideoChat3: 完全开源的高效且通用的视频理解MLLM
摘要
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。
查看缓存全文
缓存时间: 2026/07/20 09:38
论文页面 - VideoChat3:完全开源的高效通用视频多模态大模型
来源:https://huggingface.co/papers/2607.14935 发表于 7月16日
#2 今日论文 (https://huggingface.co/papers/date/2026-07-17) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
近期视频理解领域的进展已涵盖运动、长视频和流式交互,推动该领域向实际应用迈进。尽管有这些进步,当前开源模型在多个方面仍然受限。它们往往难以在不同视频类型间泛化,仅能在特定领域有效;高计算需求进一步制约了其效率与可扩展性;此外,大多数模型仅部分开源,诸如训练代码、策略或数据集等关键组件缺失,阻碍了可复现性和社区驱动的发展。为解决这些问题,我们提出了VideoChat3——一个完全开源、高效且通用的视频中心多模态大模型。VideoChat3通过两种互补设计推进视频理解。在效率方面,我们引入了膨胀3D视觉Transformer(I3D-ViT)和面向流式视频感知的自适应帧分辨率,可高效实现时空表示,并降低训练和推理过程中处理视频输入的成本。在效果方面,我们开发了一条可扩展的视频数据合成流水线,策划了三个多样化、高质量的训练数据集:VideoChat3-Academic2M、VideoChat3-LV116K和VideoChat3-OL617K,覆盖通用、长视频和流式视频场景,提升了模型在多个领域的泛化能力。通过整合这些设计,VideoChat3实现了广泛泛化与计算效率之间罕见的平衡。在通用、长视频和流式基准上的实验表明,仅凭4B参数,VideoChat3即可超越此前参数量相同或更大的开源模型,并具备更高的效率。
查看 arXiv 页面 (https://arxiv.org/abs/2607.14935)查看 PDF (https://arxiv.org/pdf/2607.14935)项目页面 (https://mcg-nju.github.io/VideoChat3)GitHub108 (https://github.com/MCG-NJU/VideoChat3)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14935)
在您的代理中获取此论文:
hf papers read 2607\.14935
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 2
MCG-NJU/VideoChat3-4B 视频-文本到文本• 4B• 更新于3天前 • 342 • 13 (https://huggingface.co/MCG-NJU/VideoChat3-4B)
MCG-NJU/I3D-ViT 图像特征提取• 0.4B• 更新于3天前 • 62 • 8 (https://huggingface.co/MCG-NJU/I3D-ViT)
引用此论文的数据集 3
MCG-NJU/VideoChat3-LV116k 查看器• 更新于约21小时前 • 8.07k • 7.59k • 10 (https://huggingface.co/datasets/MCG-NJU/VideoChat3-LV116k)
MCG-NJU/VideoChat3-Academic2M 查看器• 更新于约21小时前 • 19.2k • 1.98k • 14 (https://huggingface.co/datasets/MCG-NJU/VideoChat3-Academic2M)
MCG-NJU/VideoChat3-OL617k 预览• 更新于3天前 • 280 • 8 (https://huggingface.co/datasets/MCG-NJU/VideoChat3-OL617k)
引用此论文的 Space 0
暂无引用此论文的 Space
请在 Space 的 README.md 中引用 arxiv.org/abs/2607.14935,以便从该页面链接。
包含此论文的合集 6
浏览包含此论文的 6 个合集 (https://huggingface.co/collections?paper=2607.14935)
相似文章
LoomVideo:统一多模态输入的视频生成与编辑
LoomVideo提出了一种5B参数的统一架构用于视频生成和编辑,通过新颖的条件机制和多模态对齐减少计算开销,实现了具有竞争力的性能和更快的推理速度。
Mage-VL:一种高效的编解码原生流式多模态基础模型
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
观看、记忆、推理:基于MLLMs的人类视角视频理解
一篇综述,以人类视角呈现对多模态大语言模型(MLLMs)进行视频理解的研究,围绕观看、记忆和推理能力组织,涵盖挑战、方法和应用。
InternVideo3: 使用多模态上下文推理将基础模型智能体化
InternVideo3 引入了多模态上下文推理(MCR)和高效注意力机制,以增强长时域多模态任务,在视频理解基准上取得了强劲的结果,并展示了视频智能体能力。
@_akhaliq: LingBot-Video 已在 Hugging Face 上发布——基于 MoE 的视频基础模型,专为具身智能打造,300亿参数,仅……
LingBot-Video,一个基于 MoE 的 300 亿参数视频基础模型,专为具身智能设计,已在 Hugging Face 上发布。推理时仅 30 亿参数激活,并额外使用 7 万小时具身数据增强。