VGI-BENCH: 探测视频生成模型中的视觉智能

Hugging Face Daily Papers 论文

摘要

VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。

近期研究表明,视频生成模型能够通过生成帧展现某些形式的零样本视觉推理。然而,可靠的评估仍然具有挑战性:基准测试应采用与当前视频模型的视觉先验对齐的输入,要求有效的演变过程而非仅仅合理的最终状态,并校准任务难度以保持挑战性同时部分可行。为此,我们推出了 VGI-BENCH,包含27项任务和810个实例,通过任务领域和技能标签的二级分类法组织,用于细粒度评估视频生成模型的视觉推理能力。我们的评估表明,当前生成系统能够解决一部分基于视觉的推理任务,但远未达到可靠,即使是最强的模型 Seedance~2.0,在我们的评估标准下也仅达到51.0%。我们的分析进一步探讨了输出失败模式、输入条件敏感性、从合成微调的性能转移边界,以及从内部去噪视角揭示的有限自我纠正,其中后续步骤主要优化早期假设而非纠正推理错误。我们希望 VGI-BENCH 能有助于刺激下一代视频生成模型的发展。我们将发布我们的代码和数据。
查看原文
查看缓存全文

缓存时间: 2026/08/27 03:16

论文页面 - VGI-BENCH:探究视频生成模型中的视觉智能

来源:https://huggingface.co/papers/2608.19583 作者: (此处略去作者列表)

摘要

VGI-bench 通过27项任务评估视频生成模型中的视觉推理能力,揭示了其在生成过程中的有限可靠性与极少的自我纠正能力。

近期研究表明,视频生成模型(https://huggingface.co/papers?q=video%20generation%20models)能够通过生成的帧展现出某种形式的零样本视觉推理(https://huggingface.co/papers?q=zero-shot%20visual%20reasoning)能力。然而,可靠的评估仍具挑战:基准测试应采用与当前视频模型视觉先验对齐的输入,要求有效的演变过程而非仅关注合理的最终状态,并校准任务难度以保持其挑战性同时又具备一定的可行性。为此,我们推出了VGI-bench(https://huggingface.co/papers?q=VGI-bench),包含27项任务和810个实例,按照任务领域和技能标签的两级分类法组织,旨在对视频生成模型(https://huggingface.co/papers?q=video%20generation%20models)的视觉推理能力(https://huggingface.co/papers?q=visual%20reasoning%20capabilities)进行细粒度评估。我们的评估表明,当前生成系统能够解决一部分视觉基础的推理任务,但可靠性仍远未达到要求,即使是最强的模型Seedance~2.0,在我们的评估标准下也仅达到51.0%的准确率。我们的进一步分析探讨了输出失败模式(https://huggingface.co/papers?q=failure%20modes)、输入条件敏感性(https://huggingface.co/papers?q=input%20condition%20sensitivity)、合成微调(https://huggingface.co/papers?q=synthetic%20fine-tuning)的性能迁移边界,以及从内部去噪(https://huggingface.co/papers?q=denoising)角度揭示的有限自我纠正(https://huggingface.co/papers?q=self-correction)能力——即后续步骤主要是细化早期假设而非纠正推理错误。我们希望VGI-bench(https://huggingface.co/papers?q=VGI-bench)能助力推动下一代视频生成模型(https://huggingface.co/papers?q=video%20generation%20models)的发展。我们将开源我们的代码与数据。

查看 arXiv 页面 | 查看 PDF | 项目主页 | GitHub | 添加到收藏

在您的代理中获取此论文: hf papers read 2608.19583

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.19583,即可从此页面链接到该模型。

引用此论文的数据集1

hexuan21/VGI-Bench Viewer • 更新于1天前 • 7.03k • 49 (https://huggingface.co/datasets/hexuan21/VGI-Bench)

引用此论文的 Spaces0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.19583,即可从此页面链接到该 Space。

包含此论文的收藏0

无收藏包含此论文

将此论文添加到收藏(https://huggingface.co/new-collection)即可从此页面链接到该收藏。

相似文章

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。

@samsja19:很棒的基准

X AI KOLs Following

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。

Video-Oasis: 重新思考视频理解的评估

Hugging Face Daily Papers

Video-Oasis 揭示,现有视频基准测试中 55% 可以在没有视觉输入的情况下解决,暴露了当前视频理解模型的显著能力差距。最先进的模型在剩余的视频原生挑战上仅略高于随机猜测。