BVB:通过在 Blender 中进行程序化重建来基准测试代理视频理解
摘要
论文介绍了 BVB,这是一个通过在 Blender 中进行程序化重建来基准测试代理视频理解的基准,评估模型在感知相似性和时空事实保留方面的表现。
查看缓存全文
缓存时间: 2026/09/15 02:39
论文页面 - BVB:基于Blender程序化重建的智能体视频理解基准测试
来源:https://huggingface.co/papers/2609.15478 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
一个要求智能体在Blender中通过程序化重建真实世界视频的基准测试表明,当前模型虽能实现较高的感知相似度,但在保持时空事实方面仍存在困难。
多模态智能体(https://huggingface.co/papers?q=Multimodal%20agents)能够通过编码在Blender等软件中创建复杂视频,无需依赖扩散模型(https://huggingface.co/papers?q=diffusion%20models)。然而,现有的视频理解基准测试主要通过问答形式评估模型。若智能体能真正理解视频,则可通过程序化方式重建它。我们提出了BVB(Blender-VideoBench),这是一个通过要求智能体将真实世界视频重建为动态Blender场景来测试此能力的基准。为确保公平比较,所有智能体通过轻量级接口Mini-BVB,在相同沙箱环境中、共享成本限制下进行重建编程。基准测试从动态摄像机视角渲染每次重建,并在两个轴上进行评估:(1) 双重VQA(https://huggingface.co/papers?q=Dual%20VQA)衡量重建保留了多少时空事实;(2) 潜在相似度(https://huggingface.co/papers?q=Latent%20Similarity)衡量重建与源视频在感知上的匹配程度。我们采用平方根均值作为综合评分,以促进均衡表现。我们评估了来自10个模型家族的51种配置,并分析了语义保留度、感知相似度、推理努力程度和成本。最佳模型达到了88.6的潜在相似度(https://huggingface.co/papers?q=Latent%20Similarity),但仅保留了53.7%的源视频正确时空答案。额外的推理能提升视觉相似度,但并未弥合事实准确性上的差距。在一项包含15名评审员和五种配置的盲测中,潜在相似度(https://huggingface.co/papers?q=Latent%20Similarity)与人类偏好高度相关。这些结果表明,程序化重建是测试智能体视频理解能力的一种可行方法,而语义保留仍是主要挑战。
查看arXiv页面 (https://arxiv.org/abs/2609.15478) 查看PDF (https://arxiv.org/pdf/2609.15478) 项目页面 (https://yoloytang.me/BVB) GitHub (https://github.com/yunlong10/BVB) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.15478)
在智能体中获取此论文:
hf papers read 2609.15478
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
无模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.15478,即可从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.15478,即可从此页面链接。
引用此论文的Spaces 0
无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.15478,即可从此页面链接。
包含此论文的收藏集 0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
VGI-BENCH: 探测视频生成模型中的视觉智能
VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。
通过通用关键帧提取桥接VideoQA与视频引导的代理任务
本文介绍了VG-GUIBench,一个用于评估基于MLLM的GUI代理遵循视频教程能力的基准,并提出了TASKER,一种关键帧提取方法,可提升VideoQA和视频引导的代理任务的性能。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
SVI-Bench:战略视频智能的动态微世界
介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。
VABench: 通过视觉演示、主动感知和度量控制来测量具身空间智能
VABench 引入了一个基准,通过测试模型在视觉演示和主动感知下观察、推理和行动的能力,来评估模型中的具身空间智能。它表明主动摄像头控制提高了任务成功率,但没有模型能完成长期任务。