Sci-VBench:评估科学领域中知识与推理密集型视频生成

Hugging Face Daily Papers 论文

摘要

介绍了Sci-VBench,这是一个用于评估跨科学领域知识和推理密集型视频生成的基准,发现视觉真实性尚未转化为可靠的科学和因果正确性。

我们推出了Sci-VBench,这是一个全面的基准,用于评估跨科学领域的知识和推理密集型视频生成。它包含1,253个专家注释的示例,涵盖四个核心学科的60个主题:自然科学、医疗保健、人文与社会科学以及工程学。每个示例都要求模型生成时间上丰富的视频,这些视频需要科学推理和基于知识的综合,超越表面上的视觉合理性。我们进一步建立了一个基于评分标准的评估协议。我们的分析表明,在该协议下,非专家人类评估者和MLLM-as-Judge系统都能与专家判断达到相对较高的一致性,支持大规模可复现的评估。我们对16个前沿专有和开源模型进行了基准测试,发现虽然自动感知质量分数在各系统间紧密聚集,但提示接地性和科学与因果正确性的表现差异很大,且专有与开源模型之间存在明显差距。这些发现表明,视觉真实性的进步尚未转化为对科学和因果动态的可靠建模。
查看原文
查看缓存全文

缓存时间: 2026/08/11 06:20

论文页面 - Sci-VBench:评估科学领域中知识密集与推理密集的视频生成

来源:https://huggingface.co/papers/2608.09873

摘要

我们引入了 Sci-VBench,这是一个全面的基准测试,用于评估跨科学领域的知识密集与推理密集的视频生成。它包含 1,253 个由专家标注的示例,涵盖四个核心学科的 60 个主题:自然科学、医疗健康、人文与社会科学以及工程学。每个示例都要求模型生成在时间上丰富的视频,这需要科学推理和基于知识的综合,超越了表面层次的视觉合理性。我们进一步建立了一个基于评分细则的评估协议。我们的分析表明,在该协议下,非专家人类评估者和 MLLM-as-Judge 系统都能与专家判断达到相对较高的一致性,从而支持大规模的可复现评估。我们对 16 个前沿专有和开源模型进行了基准测试,发现虽然各系统的自动感知质量得分紧密聚集,但在提示词接地以及科学和因果正确性方面的表现差异很大,且专有模型与开源模型之间存在明显差距。这些发现表明,视觉真实性的进步尚未转化为对科学和因果动力学的可靠建模。

查看 arXiv 页面 (https://arxiv.org/abs/2608.09873) 查看 PDF (https://arxiv.org/pdf/2608.09873) GitHub 3 (https://github.com/sci-vbench/sci-vbench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09873)

在你的 agent 中获取这篇论文:

hf papers read 2608\.09873

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.09873 即可从本页面链接到该模型。

引用此论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.09873 即可从本页面链接到该数据集。

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.09873 即可从本页面链接到该 Space。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页面链接到该论文。

相似文章

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。

超大视频推理套件

Papers with Code Trending

本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。