SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers 论文

摘要

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。

真正的视频智能不仅仅需要识别可见内容:还需要推理事件为何发生,预测在不同条件下会如何变化,以及决定下一步该做什么。我们将这一从感知、因果推理、模拟到战略规划的递进过程称为战略视频智能(SVI)。目前没有现有的基准能够评估这一能力堆栈:野外视频缺乏可验证的因果和战略问题的真实标签,而合成环境则牺牲了真实多智能体系统的复杂性。为了弥合这一差距,我们引入了SVI-Bench,这是一个大规模基准,利用团队体育作为动态微世界,结合了真实世界多智能体交互的复杂性(10-22个智能体在对抗压力下做出协调决策)与明确规则和确定结果的可验证性。SVI-Bench包括约35K小时的转播视频、15M个标注动作、15K小时的专家解说、23K场比赛报告以及横跨篮球、足球和冰球的103K个结构化统计记录,所有这些都通过一个数据引擎构建,该引擎将原始比赛数据转换为密集的交叉引用语料库。我们将评估组织为9个任务,涵盖一个递进的四大支柱层次:动态场景理解、因果推理、战略模拟和代理综合。通过评估强大的多模态和代理基线,我们发现一个能力断崖:模型在感知任务上表现良好,在细粒度动作问答上达到约73%的准确率,但在每个后续认知水平上急剧下降。代理任务被证明是最难的:最强模型在需要自主收集和整合跨越1.8M个剪辑的语料库的证据时,仅达到5%的准确率。
查看原文
查看缓存全文

缓存时间: 2026/06/02 19:33

论文页面 - SVI-Bench:面向战略视频智能的动态微世界

来源:https://huggingface.co/papers/2605.31529

摘要

战略视频智能需要理解、因果推理和规划能力,而现有基准测试未能充分评估这些能力,导致在复杂认知任务中表现差距显著。

真正的视频智能不仅仅是识别可见内容:它需要推理事件发生的原因、预测不同条件下会发生什么变化,以及决定下一步该做什么。我们将这种从感知经因果推理和模拟到战略规划的进阶过程,称为战略视频智能(SVI)。现有基准测试均未评估这一能力栈:野外视频缺乏针对因果和战略问题的可验证真值,而合成环境则牺牲了真实多智能体系统的复杂性。为填补这一空白,我们引入了 SVI-Bench,这是一个大规模基准测试,利用团队运动作为动态微世界,将现实世界多智能体交互的复杂性(10-22 个智能体在对抗压力下做出协调决策)与明确规则和确定性结果的可验证性相结合。SVI-Bench 包含约 35,000 小时的广播视频、1,500 万个标注动作、15,000 小时的专家解说、23,000 份比赛报告以及涵盖篮球、足球和冰球的 103,000 条结构化统计记录,所有这些均通过一个数据引擎构建,该引擎将原始比赛数据转换为密集且交叉引用的语料库。我们将评估组织为 9 项任务,涵盖一个递进的四大支柱层级:动态场景理解、因果推理、战略模拟和智能体综合。对强大的多模态和智能体基线进行评估后,我们发现一个能力悬崖:模型在感知任务上表现尚可,在细粒度动作问答上达到约 73% 的准确率,但在每个后续认知层级上急剧下降。智能体任务最为困难:当需要自主收集并整合来自 180 万个剪辑的语料库证据时,最强模型仅能达到 5% 的准确率。

查看 arXiv 页面 (https://arxiv.org/abs/2605.31529) 查看 PDF (https://arxiv.org/pdf/2605.31529) 项目页面 (https://svi-bench.github.io/) GitHub0 (https://github.com/Texaser/SVI-Bench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.31529)

在你的智能体中获取这篇论文:

hf papers read 2605.31529

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 1

MVP-Group/svi-bench 更新于 1 天前 (https://huggingface.co/MVP-Group/svi-bench)

引用此论文的数据集 1

MVP-Group/SVI-Bench (https://huggingface.co/datasets/MVP-Group/SVI-Bench)

引用此论文的 Space 0

没有 Space 链接此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2605.31529 以从此页面链接。

包含此论文的收藏 0

没有包含此论文的收藏

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试

Papers with Code Trending

OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

WBench:面向交互式视频世界模型评估的综合多轮基准

Hugging Face Daily Papers

WBench是一个全面的多轮基准,用于评估交互式世界模型在五个维度上的表现,包含289个测试用例和1,058次交互轮次,提供自动子指标和诊断洞察。它揭示了没有单一模型能在所有维度上都表现优异。