Sci-VBench:评估科学领域中知识与推理密集型视频生成
摘要
介绍了Sci-VBench,这是一个用于评估跨科学领域知识和推理密集型视频生成的基准,发现视觉真实性尚未转化为可靠的科学和因果正确性。
查看缓存全文
缓存时间: 2026/08/11 06:20
论文页面 - Sci-VBench:评估科学领域中知识密集与推理密集的视频生成
来源:https://huggingface.co/papers/2608.09873
摘要
我们引入了 Sci-VBench,这是一个全面的基准测试,用于评估跨科学领域的知识密集与推理密集的视频生成。它包含 1,253 个由专家标注的示例,涵盖四个核心学科的 60 个主题:自然科学、医疗健康、人文与社会科学以及工程学。每个示例都要求模型生成在时间上丰富的视频,这需要科学推理和基于知识的综合,超越了表面层次的视觉合理性。我们进一步建立了一个基于评分细则的评估协议。我们的分析表明,在该协议下,非专家人类评估者和 MLLM-as-Judge 系统都能与专家判断达到相对较高的一致性,从而支持大规模的可复现评估。我们对 16 个前沿专有和开源模型进行了基准测试,发现虽然各系统的自动感知质量得分紧密聚集,但在提示词接地以及科学和因果正确性方面的表现差异很大,且专有模型与开源模型之间存在明显差距。这些发现表明,视觉真实性的进步尚未转化为对科学和因果动力学的可靠建模。
查看 arXiv 页面 (https://arxiv.org/abs/2608.09873) 查看 PDF (https://arxiv.org/pdf/2608.09873) GitHub 3 (https://github.com/sci-vbench/sci-vbench) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09873)
在你的 agent 中获取这篇论文:
hf papers read 2608\.09873
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.09873 即可从本页面链接到该模型。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.09873 即可从本页面链接到该数据集。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.09873 即可从本页面链接到该 Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页面链接到该论文。
相似文章
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。
VGenST-Bench:通过主动视频合成进行时空推理的基准测试
VGenST-Bench是一个基准测试,利用生成模型主动合成受控的时空推理场景,配备多智能体流水线和人工质量控制,用于评估多模态大语言模型。
超大视频推理套件
本文介绍了超大视频推理(VBVR)数据集和基准,这是一个大规模资源,包含超过一百万个视频片段,涵盖200个推理任务,能够系统研究时空推理,并展示了早期出现的涌现泛化迹象。
SVI-Bench:战略视频智能的动态微世界
介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。
WorldReasonBench:将视频生成器作为未来世界状态预测器进行人类对齐的压力测试
本文介绍了 WorldReasonBench 和 WorldRewardBench,这两个新基准旨在评估视频生成模型对世界状态演变和物理一致性的推理能力。研究突显了当前商业视频生成器在视觉合理性与真实逻辑推理之间存在的差距。