超大视频推理套件

Papers with Code Trending 论文

摘要

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

视频模型的快速进步主要集中在视觉质量上,而它们的推理能力尚未得到充分探索。视频推理将智能置于超越文本自然捕捉能力的时空一致视觉环境中,从而能够对连续性、交互和因果等时空结构进行直观推理。然而,由于缺乏大规模训练数据,系统研究视频推理及其扩展行为受到阻碍。为了解决这一差距,我们引入了超大视频推理(VBVR)数据集,这是一个空前大规模的资源,涵盖200个遵循原则性分类法的精心设计的推理任务,以及超过一百万个视频片段,规模大约是现有数据集的三个数量级。我们还提出了VBVR-Bench,一个可验证的评估框架,它通过结合基于规则、与人类对齐的评分器,超越了基于模型的评判,实现了对视频推理能力的可重复和可解释的诊断。利用VBVR套件,我们进行了首批大规模视频推理扩展研究之一,并观察到了对未见推理任务进行涌现泛化的早期迹象。VBVR共同为可泛化视频推理的下一阶段研究奠定了基础。数据、基准工具包和模型可在 https://video-reason.com/ 公开获取。
查看原文
查看缓存全文

缓存时间: 2026/05/26 12:36

论文页面 - A Very Big Video Reasoning Suite

来源:https://huggingface.co/papers/2602.20159 发布于 2月23日

#1 今日论文 (https://huggingface.co/papers/date/2026-02-24) 作者:

,

,

,

,

,

,

,

,

,

,

摘要

我们引入了一个大规模视频推理数据集与基准,用于研究超越视觉质量的视频智能能力,从而能够系统分析跨多样任务的时空推理与泛化能力。

视频模型的快速发展主要聚焦于视觉质量,而其推理能力尚未得到充分探索。视频推理 (https://huggingface.co/papers?q=Video%20reasoning) 将智能建立在时空一致的视觉环境中,超越了文本所能自然捕捉的内容,使人们对连续性、交互和因果等时空结构进行直观推理成为可能。然而,系统性地研究视频推理 (https://huggingface.co/papers?q=video%20reasoning) 及其缩放行为受限于缺乏大规模训练数据。为弥补这一空白,我们提出了超大规模视频推理 (https://huggingface.co/papers?q=Video%20Reasoning) (VBVR) 数据集,这是一个前所未有的超大规模资源,涵盖按照原则性分类法组织的200个精心策划的推理任务,以及超过一百万个视频片段,其规模比现有数据集大约三个数量级。我们还提出了 VBVR-Bench,一个可验证的评估框架,通过引入基于规则、与人类对齐的评分器,超越了基于模型的评判,实现了可重复、可解释的视频推理 (https://huggingface.co/papers?q=video%20reasoning) 能力诊断。借助 VBVR 套件,我们开展了首批大规模视频推理缩放研究之一,并观察到新兴泛化 (https://huggingface.co/papers?q=emergent%20generalization) 到未见推理任务的早期迹象。总之,VBVR 为可泛化视频推理 (https://huggingface.co/papers?q=video%20reasoning) 的下一阶段研究奠定了基础。数据、基准工具包和模型均已公开,访问地址为 https://video-reason.com/ 。

查看 arXiv 页面 (https://arxiv.org/abs/2602.20159) 查看 PDF (https://arxiv.org/pdf/2602.20159) 项目页面 (https://video-reason.com/) GitHub189自动 (https://github.com/Video-Reason/VBVR-EvalKit) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2602.20159)

在您的智能体中获取此论文:

hf papers read 2602.20159

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型10个

Video-Reason/VBVR-Wan2.2 图像到视频• 更新于 4月15日 • 223 • 129 (https://huggingface.co/Video-Reason/VBVR-Wan2.2)

Video-Reason/VBVR-LTX2.3-diffsynth 图像到视频• 更新于 4月14日 • 336 • 22 (https://huggingface.co/Video-Reason/VBVR-LTX2.3-diffsynth)

Video-Reason/VBVR-Wan2.1-diffsynth 图像到视频• 更新于 4月14日 • 37 • 6 (https://huggingface.co/Video-Reason/VBVR-Wan2.1-diffsynth)

Video-Reason/VBVR-Wan2.2-diffsynth 图像到视频• 更新于 4月14日 • 420 • 5 (https://huggingface.co/Video-Reason/VBVR-Wan2.2-diffsynth)

浏览引用本论文的10个模型 (https://huggingface.co/models?other=arxiv:2602.20159)

引用本论文的数据集4个

Video-Reason/VBVR-Dataset 查看器• 更新于 4月1日 • 1M • 2.96k • 54 (https://huggingface.co/datasets/Video-Reason/VBVR-Dataset)

Video-Reason/VBVR-Bench-Data 查看器• 更新于 4月1日 • 500 • 1.32k • 9 (https://huggingface.co/datasets/Video-Reason/VBVR-Bench-Data)

Video-Reason/video-mcp 查看器• 更新于 4月1日 • 3.91k • 863 • 2 (https://huggingface.co/datasets/Video-Reason/video-mcp)

abs794/VBVR-Bench-Data 查看器• 更新于 2月24日 • 500 • 427 (https://huggingface.co/datasets/abs794/VBVR-Bench-Data)

引用本论文的 Spaces 1个

包含本论文的收藏集18个

浏览包含本论文的18个收藏集 (https://huggingface.co/collections?paper=2602.20159)

相似文章

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。

OpenCoF:通过视频生成学习推理

Hugging Face Daily Papers

OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。