BVB:通过在 Blender 中进行程序化重建来基准测试代理视频理解

Hugging Face Daily Papers 论文

摘要

论文介绍了 BVB,这是一个通过在 Blender 中进行程序化重建来基准测试代理视频理解的基准,评估模型在感知相似性和时空事实保留方面的表现。

多模态代理可以通过编码在软件如 Blender 中创建复杂视频,而不依赖扩散模型。然而,视频理解基准仍然主要通过问答来评估模型。如果代理真正理解视频,它可以程序化地重建它。我们介绍 BVB,Blender-VideoBench,这是一个通过要求代理将真实视频重建为动画 Blender 场景来测试这种能力的基准。为了确保公平比较,每个代理通过一个轻量级工具 Mini-BVB 在相同的沙盒中编程重建,并在共享的成本限制下进行。基准从其动画相机渲染每个重建,并在两个轴上进行评估:(1)Dual VQA 衡量重建保留了多少时空事实。(2)Latent Similarity 衡量重建在感知上与源视频的匹配程度。我们的总体分数,平方根平均数,倾向于平衡性能。我们评估了来自 10 个模型家族的 51 个配置,并分析了语义保留、感知相似性、推理努力和成本。最好的模型达到了 88.6 的 Latent Similarity,但只保留了 53.7% 的源正确时空答案。额外的推理提高了视觉相似性,但并未缩小事实准确性的差距。在一项包含 15 名评分者和 5 个配置的盲法研究中,Latent Similarity 与人类偏好密切相关。这些结果表明,程序化重建是代理视频理解的有效测试,而语义保留仍然是主要挑战。
查看原文
查看缓存全文

缓存时间: 2026/09/15 02:39

论文页面 - BVB:基于Blender程序化重建的智能体视频理解基准测试

来源:https://huggingface.co/papers/2609.15478 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

一个要求智能体在Blender中通过程序化重建真实世界视频的基准测试表明,当前模型虽能实现较高的感知相似度,但在保持时空事实方面仍存在困难。

多模态智能体(https://huggingface.co/papers?q=Multimodal%20agents)能够通过编码在Blender等软件中创建复杂视频,无需依赖扩散模型(https://huggingface.co/papers?q=diffusion%20models)。然而,现有的视频理解基准测试主要通过问答形式评估模型。若智能体能真正理解视频,则可通过程序化方式重建它。我们提出了BVB(Blender-VideoBench),这是一个通过要求智能体将真实世界视频重建为动态Blender场景来测试此能力的基准。为确保公平比较,所有智能体通过轻量级接口Mini-BVB,在相同沙箱环境中、共享成本限制下进行重建编程。基准测试从动态摄像机视角渲染每次重建,并在两个轴上进行评估:(1) 双重VQA(https://huggingface.co/papers?q=Dual%20VQA)衡量重建保留了多少时空事实;(2) 潜在相似度(https://huggingface.co/papers?q=Latent%20Similarity)衡量重建与源视频在感知上的匹配程度。我们采用平方根均值作为综合评分,以促进均衡表现。我们评估了来自10个模型家族的51种配置,并分析了语义保留度、感知相似度、推理努力程度和成本。最佳模型达到了88.6的潜在相似度(https://huggingface.co/papers?q=Latent%20Similarity),但仅保留了53.7%的源视频正确时空答案。额外的推理能提升视觉相似度,但并未弥合事实准确性上的差距。在一项包含15名评审员和五种配置的盲测中,潜在相似度(https://huggingface.co/papers?q=Latent%20Similarity)与人类偏好高度相关。这些结果表明,程序化重建是测试智能体视频理解能力的一种可行方法,而语义保留仍是主要挑战。

查看arXiv页面 (https://arxiv.org/abs/2609.15478) 查看PDF (https://arxiv.org/pdf/2609.15478) 项目页面 (https://yoloytang.me/BVB) GitHub (https://github.com/yunlong10/BVB) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.15478)

在智能体中获取此论文:

hf papers read 2609.15478

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.15478,即可从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.15478,即可从此页面链接。

引用此论文的Spaces 0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.15478,即可从此页面链接。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。