video-mllm

标签

Cards List
#video-mllm

VideoChat3: 完全开源的高效且通用的视频理解MLLM

Papers with Code Trending · 2026-07-16 缓存

VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。

0 人收藏 0 人点赞
#video-mllm

RefereeBench:视频多模态大模型是否已准备好担任多项运动的裁判

arXiv cs.CL · 2026-04-20 缓存

RefereeBench 引入了首个大规模基准测试,包含 925 个精心策划的体育视频和 6,475 个问答对,用于评估视频多模态大模型是否能可靠地充当多项运动的裁判。对最先进模型的评估表明,现有多模态大模型表现不佳(准确率≤60%),尽管它们具有通用视频理解能力,但在规则应用和时间定位方面存在困难。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈