YoCausal: 视频生成距离世界模型有多远?因果视角
摘要
本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。
查看缓存全文
缓存时间: 2026/05/29 07:01
论文页面 - YoCausal: 视频生成离世界模型还有多远?一个因果视角
来源:https://huggingface.co/papers/2605.30346
摘要
视频扩散模型表现出时间箭头感知,但缺乏真正的因果理解,这一点通过一个利用反向惊奇和视觉语言模型分析来衡量因果认知的新基准得到了证明。
随着视频扩散模型(VDMs)向世界模型发展,一个关键问题浮现:它们是否真正理解因果关系,抑或仅仅是过度拟合了统计时间模式?现有基准大多依赖合成数据,由于仿真到真实的差距,限制了在真实世界的泛化。我们提出YoCausal,一个受认知科学中“预期违背”(VoE)范式启发的两级基准。通过零成本地将真实世界视频进行时间反转作为自然反事实样本,YoCausal建立了一个可任意扩展的评估协议。第一级引入了反向惊奇指数(RSI),通过去噪损失量化时间箭头感知。第二级引入了因果认知指数(CCI),利用VLM将数据集分层为因果和非因果子集,从而将真正的因果推理与时间偏差分离开来。对13个最先进VDM的评估表明,感知时间箭头并不意味着理解因果关系,并且与人类水平的因果认知相比仍存在显著差距。
查看arXiv页面 (https://arxiv.org/abs/2605.30346) 查看PDF (https://arxiv.org/pdf/2605.30346) 项目页面 (https://www.youzhexie.me/papers/YoCausal/index.html) GitHub5 (https://github.com/youzhe0305/YoCausal) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30346)
在你的代理中获取这篇论文:
hf papers read 2605.30346
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2605.30346以在此页面链接它。
引用该论文的数据集1
YouZhe/YoCausal-dataset 更新于13分钟前 • 4 (https://huggingface.co/datasets/YouZhe/YoCausal-dataset)
引用该论文的Spaces0
没有Space链接此论文
请在Space README.md中引用arxiv.org/abs/2605.30346以在此页面链接它。
包含该论文的收藏1
相似文章
CausalCine:用于多镜头视频叙事的实时自回归生成
CausalCine 是一个新的学术框架,用于实时交互式多镜头视频生成,它利用因果建模和动态内存路由技术,提高了自回归模型在镜头间的一致性。
Next Forcing:基于多块预测的因果世界建模
Next Forcing 提出了一种用于因果世界建模的多块预测框架,可加速自回归视频生成的训练和推理,同时提高准确性和对物理规律的遵循程度。
基于概念的扩散模型反事实视觉解释
介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。
文本到图像模型是归纳主义火鸡吗?一个用于因果推理的反事实基准
本文介绍了CF-World,一个用于评估文本到图像模型是否依赖因果推理或仅仅是模式匹配的反事实基准。实验表明,所有模型在反事实设置下表现急剧下降,表明它们的理解仅限于视觉-文本紧密耦合的模式,而非真正的因果推理。
CRONOS:评估视频模型中反事实物理一致性的基准
CRONOS是一个基准测试,通过在保持物理事件类型不变的情况下对视角、场景、物体类别和外观进行干预,来评估视频预测模型的反事实物理一致性。它揭示了当前视频生成器的重大缺陷。