CRONOS:评估视频模型中反事实物理一致性的基准

Hugging Face Daily Papers 论文

摘要

CRONOS是一个基准测试,通过在保持物理事件类型不变的情况下对视角、场景、物体类别和外观进行干预,来评估视频预测模型的反事实物理一致性。它揭示了当前视频生成器的重大缺陷。

视频预测日益被视为通往通用世界模型的路径,然而目前尚不清楚这些系统是学习了潜在的因果结构,还是仅仅利用表面的视觉相关性进行未来预测。我们提出了CRONOS,一个基于干预的基准测试,旨在评估反事实物理一致性:即模型对物理事件的预测是否能够适当响应视觉输入中的受控变化,例如场景背景、视角、物体外观和物体类别的变化。CRONOS构建在逼真的Unreal Engine环境中,能够跨不同场景和动态生成受控的高保真视频。与以往的基准相比,CRONOS系统性地对四个关键因素——视角、场景、物体类别和物体外观——进行干预,同时保持底层的物理事件类型(例如碰撞、遮挡或下落)不变。我们对近期开源视频生成器的评估揭示了反事实物理一致性方面的重大缺陷:同一物理事件类型的预测质量受外观、环境以及特别是视角变化的影响。CRONOS提供了一个可控且可重复的测试平台,用于诊断不同干预下生成视频质量的变化,为开发在多种条件变化下表现一致的模型确立了具体目标。数据集和代码可在我们的项目页面上获取。
查看原文
查看缓存全文

缓存时间: 2026/05/26 10:43

论文页面 - CRONOS:视频模型中反事实物理一致性的基准测试

来源:https://huggingface.co/papers/2605.23699

摘要

CRONOS是一个基准测试,用于通过控制视角、场景、物体类别和外观的干预,同时保持固定的物理事件类型,来评估视频预测模型中的反事实物理一致性。

视频预测(https://huggingface.co/papers?q=Video%20prediction)越来越多地被视为通向可泛化世界模型的路径,但目前尚不清楚这些系统是学习了底层因果结构,还是仅仅利用表面视觉相关性进行未来预测。我们提出了CRONOS,这是一个基于干预的基准测试(https://huggingface.co/papers?q=intervention-based%20benchmark),旨在评估反事实物理一致性(https://huggingface.co/papers?q=counterfactual%20physical%20consistency):即模型对物理事件的预测是否会根据视觉输入中的可控变化(例如场景上下文、视角、物体外观和物体类别的变化)做出适当响应。CRONOS构建于逼真的Unreal Engine环境(https://huggingface.co/papers?q=photorealistic%20Unreal%20Engine%20environment)中,能够在多种场景和动力学条件下进行受控、高保真的视频生成。与以往的基准不同,CRONOS对四个关键因素(视角、场景、物体类别和物体外观)进行系统干预,同时保持底层物理事件类型(https://huggingface.co/papers?q=physical%20event%20type)(如碰撞、遮挡或坠落)不变。我们对近期开源视频生成器(https://huggingface.co/papers?q=video%20generators)的评估揭示了反事实物理一致性(https://huggingface.co/papers?q=counterfactual%20physical%20consistency)方面的重大缺陷:相同物理事件类型(https://huggingface.co/papers?q=physical%20event%20type)的预测质量会受到外观、环境,特别是视角变化的影响。CRONOS提供了一个受控且可重复的测试平台,用于诊断不同干预条件下生成视频质量的变化,从而为开发能在多种条件变化下保持稳定表现的模型确立了具体目标。数据集和代码可在我们的项目页面获取。

查看arXiv页面(https://arxiv.org/abs/2605.23699)查看PDF(https://arxiv.org/pdf/2605.23699)项目页面(https://genintel.github.io/CRONOS/)GitHub2(https://github.com/GenIntel/CRONOS-benchmark)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.23699)

在你的agent中获取此论文:

hf papers read 2605.23699

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

请在模型README.md中引用arxiv.org/abs/2605.23699以从此页面链接。

引用此论文的数据集1

genintel/CRONOS-benchmark 查看器• 更新于约3小时前 • 204k • 50 (https://huggingface.co/datasets/genintel/CRONOS-benchmark)

引用此论文的Spaces0

无Space关联此论文

请在Space README.md中引用arxiv.org/abs/2605.23699以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

MemoBench:动态变化环境中世界建模的基准测试

Hugging Face Daily Papers

MemoBench是一个诊断基准,用于评估视频生成模型在动态变化环境中的记忆一致性,其中物体消失并以更新后的状态重新出现。它包括360个真实视频片段和一个结合自动指标与基于VQA评估的测试套件,揭示了记忆一致性挑战的洞见。

OSCBench: 文本到视频生成中的对象状态变化基准测试

arXiv cs.CL

OSCBench是一个新的基准测试,用于评估文本到视频生成模型准确表示对象状态变化(由剥皮或切片等动作引起的转变)的能力。该论文表明,当前的T2V模型在处理时间上一致的状态变化方面存在困难,特别是在新颖和组合场景中,这被认定为视频生成的一个关键瓶颈。

YoCausal: 视频生成距离世界模型有多远?因果视角

Hugging Face Daily Papers

本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。