超大视频推理套件
摘要
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
查看缓存全文
缓存时间: 2026/05/26 12:36
论文页面 - A Very Big Video Reasoning Suite
来源:https://huggingface.co/papers/2602.20159 发布于 2月23日
#1 今日论文 (https://huggingface.co/papers/date/2026-02-24) 作者:
,
,
,
,
,
,
,
,
,
,
摘要
我们引入了一个大规模视频推理数据集与基准,用于研究超越视觉质量的视频智能能力,从而能够系统分析跨多样任务的时空推理与泛化能力。
视频模型的快速发展主要聚焦于视觉质量,而其推理能力尚未得到充分探索。视频推理 (https://huggingface.co/papers?q=Video%20reasoning) 将智能建立在时空一致的视觉环境中,超越了文本所能自然捕捉的内容,使人们对连续性、交互和因果等时空结构进行直观推理成为可能。然而,系统性地研究视频推理 (https://huggingface.co/papers?q=video%20reasoning) 及其缩放行为受限于缺乏大规模训练数据。为弥补这一空白,我们提出了超大规模视频推理 (https://huggingface.co/papers?q=Video%20Reasoning) (VBVR) 数据集,这是一个前所未有的超大规模资源,涵盖按照原则性分类法组织的200个精心策划的推理任务,以及超过一百万个视频片段,其规模比现有数据集大约三个数量级。我们还提出了 VBVR-Bench,一个可验证的评估框架,通过引入基于规则、与人类对齐的评分器,超越了基于模型的评判,实现了可重复、可解释的视频推理 (https://huggingface.co/papers?q=video%20reasoning) 能力诊断。借助 VBVR 套件,我们开展了首批大规模视频推理缩放研究之一,并观察到新兴泛化 (https://huggingface.co/papers?q=emergent%20generalization) 到未见推理任务的早期迹象。总之,VBVR 为可泛化视频推理 (https://huggingface.co/papers?q=video%20reasoning) 的下一阶段研究奠定了基础。数据、基准工具包和模型均已公开,访问地址为 https://video-reason.com/ 。
查看 arXiv 页面 (https://arxiv.org/abs/2602.20159) 查看 PDF (https://arxiv.org/pdf/2602.20159) 项目页面 (https://video-reason.com/) GitHub189自动 (https://github.com/Video-Reason/VBVR-EvalKit) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2602.20159)
在您的智能体中获取此论文:
hf papers read 2602.20159
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型10个
Video-Reason/VBVR-Wan2.2 图像到视频• 更新于 4月15日 • 223 • 129 (https://huggingface.co/Video-Reason/VBVR-Wan2.2)
Video-Reason/VBVR-LTX2.3-diffsynth 图像到视频• 更新于 4月14日 • 336 • 22 (https://huggingface.co/Video-Reason/VBVR-LTX2.3-diffsynth)
Video-Reason/VBVR-Wan2.1-diffsynth 图像到视频• 更新于 4月14日 • 37 • 6 (https://huggingface.co/Video-Reason/VBVR-Wan2.1-diffsynth)
Video-Reason/VBVR-Wan2.2-diffsynth 图像到视频• 更新于 4月14日 • 420 • 5 (https://huggingface.co/Video-Reason/VBVR-Wan2.2-diffsynth)
浏览引用本论文的10个模型 (https://huggingface.co/models?other=arxiv:2602.20159)
引用本论文的数据集4个
Video-Reason/VBVR-Dataset 查看器• 更新于 4月1日 • 1M • 2.96k • 54 (https://huggingface.co/datasets/Video-Reason/VBVR-Dataset)
Video-Reason/VBVR-Bench-Data 查看器• 更新于 4月1日 • 500 • 1.32k • 9 (https://huggingface.co/datasets/Video-Reason/VBVR-Bench-Data)
Video-Reason/video-mcp 查看器• 更新于 4月1日 • 3.91k • 863 • 2 (https://huggingface.co/datasets/Video-Reason/video-mcp)
abs794/VBVR-Bench-Data 查看器• 更新于 2月24日 • 500 • 427 (https://huggingface.co/datasets/abs794/VBVR-Bench-Data)
引用本论文的 Spaces 1个
包含本论文的收藏集18个
浏览包含本论文的18个收藏集 (https://huggingface.co/collections?paper=2602.20159)
相似文章
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。
Sci-VBench:评估科学领域中知识与推理密集型视频生成
介绍了Sci-VBench,这是一个用于评估跨科学领域知识和推理密集型视频生成的基准,发现视觉真实性尚未转化为可靠的科学和因果正确性。
OpenCoF:通过视频生成学习推理
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
OmniVideo-100K:一个通过结构化脚本和证据链进行音视频推理的数据集
OmniVideo-100K介绍了一个自动化的数据引擎,通过实体锚定脚本和线索引导的问答生成来提升音视频推理和时间一致性,在多个基准测试上实现了显著的性能提升。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。