YoCausal: 视频生成距离世界模型有多远?因果视角

Hugging Face Daily Papers 论文

摘要

本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。

随着视频扩散模型(VDM)向世界模型迈进,一个关键问题浮现:它们是否真正理解因果关系,还是仅仅过拟合于统计时间模式?现有基准大多依赖合成数据,受限于模拟到真实的差距,导致现实世界泛化能力有限。我们提出了YoCausal,一个受认知科学中违反预期(VoE)范式启发的两级基准。通过将真实世界视频以零成本进行时间反转,作为自然的反事实样本,YoCausal建立了一个可任意扩展的评估协议。第一级引入了反转惊喜指数(RSI),通过去噪损失量化时间箭头感知。第二级引入了因果认知指数(CCI),利用视觉语言模型(VLM)将数据集分层为因果和非因果子集,从而将真正的因果推理与时间偏差分离开来。对13个最先进的VDM的评估显示,感知时间箭头并不意味着理解因果关系,且与人类级别的因果认知相比仍存在显著差距。
查看原文
查看缓存全文

缓存时间: 2026/05/29 07:01

论文页面 - YoCausal: 视频生成离世界模型还有多远?一个因果视角

来源:https://huggingface.co/papers/2605.30346

摘要

视频扩散模型表现出时间箭头感知,但缺乏真正的因果理解,这一点通过一个利用反向惊奇和视觉语言模型分析来衡量因果认知的新基准得到了证明。

随着视频扩散模型(VDMs)向世界模型发展,一个关键问题浮现:它们是否真正理解因果关系,抑或仅仅是过度拟合了统计时间模式?现有基准大多依赖合成数据,由于仿真到真实的差距,限制了在真实世界的泛化。我们提出YoCausal,一个受认知科学中“预期违背”(VoE)范式启发的两级基准。通过零成本地将真实世界视频进行时间反转作为自然反事实样本,YoCausal建立了一个可任意扩展的评估协议。第一级引入了反向惊奇指数(RSI),通过去噪损失量化时间箭头感知。第二级引入了因果认知指数(CCI),利用VLM将数据集分层为因果和非因果子集,从而将真正的因果推理与时间偏差分离开来。对13个最先进VDM的评估表明,感知时间箭头并不意味着理解因果关系,并且与人类水平的因果认知相比仍存在显著差距。

查看arXiv页面 (https://arxiv.org/abs/2605.30346) 查看PDF (https://arxiv.org/pdf/2605.30346) 项目页面 (https://www.youzhexie.me/papers/YoCausal/index.html) GitHub5 (https://github.com/youzhe0305/YoCausal) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30346)

在你的代理中获取这篇论文:

hf papers read 2605.30346

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2605.30346以在此页面链接它。

引用该论文的数据集1

YouZhe/YoCausal-dataset 更新于13分钟前 • 4 (https://huggingface.co/datasets/YouZhe/YoCausal-dataset)

引用该论文的Spaces0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2605.30346以在此页面链接它。

包含该论文的收藏1

相似文章

基于概念的扩散模型反事实视觉解释

arXiv cs.AI

介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。

CRONOS:评估视频模型中反事实物理一致性的基准

Hugging Face Daily Papers

CRONOS是一个基准测试,通过在保持物理事件类型不变的情况下对视角、场景、物体类别和外观进行干预,来评估视频预测模型的反事实物理一致性。它揭示了当前视频生成器的重大缺陷。