@huang_biwei: 很高兴分享CausalWM,我们的因果世界模型v1,基于因果链式思考(CoT)构建。它目前排名…

X AI KOLs Timeline 模型

摘要

CausalWM是一个因果世界模型,使用链式思考通过逐步捕捉物理依赖关系来预测未来帧,在像TriWorldBench和PAI-Bench这样的基准测试中排名第一。

很高兴分享CausalWM,我们的因果世界模型v1,基于因果链式思考(CoT)构建。它目前在TriWorldBench和PAI-Bench的机器人领域排名第一。 许多世界模型直接从当前观察中预测未来帧,带有语言或动作条件。这可以产生第一眼看起来视觉上令人信服的视频,但仍然会弄错许多微妙但重要的物理细节。 因为底层物理变量在隐式表示中仍然纠缠,很难判断模型是否真正捕获了相关的物理机制,还是仅仅依赖于产生看似合理结果的捷径。 通过CausalWM,我们将因果CoT引入未来视频预测。模型遵循一个明确的序列: Optical Flow → Geometry / Pointmap → Future RGB 因果CoT中的每一步都捕获了一个有意义的中间过渡,使模型能够逐步捕获物理演化背后的因果依赖关系。 我特别感兴趣的一个结果是由因果CoT创建的上下文控制接口。因为我们的CausalWM已经学会了在因果CoT中使用新的视觉信号。通过有限的微调,任何有用的特征(例如,模拟器渲染的机器人轨迹)都可以作为上下文控制添加,以指导其生成一致的未来视频。 这种上下文学习能力为我们提供了一种进行物理推理和因果干预的实用方法。 链接在下方线程中。
查看原文
查看缓存全文

缓存时间: 2026/09/19 21:09

很高兴分享CausalWM,这是基于因果链式思维(Causal Chain-of-Thought,Causal CoT)构建的因果世界模型v1。该模型目前在TriWorldBench基准测试和PAI-Bench机器人领域排名第一。

许多世界模型通过语言或动作条件直接从当前观测预测未来帧。这类模型生成的视频初看可能视觉效果逼真,但往往在细微却关键的物理细节上出现错误。

这是因为底层物理变量在隐式表示中仍处于纠缠状态,我们难以判断模型是否真正捕获了相关物理机制,还是仅依赖产生看似合理结果的捷径。

通过CausalWM,我们将因果链式思维引入未来视频预测。模型遵循明确的因果推理序列:

光流 → 几何结构/点云图 → 未来RGB图像

因果链的每个步骤都捕获有意义的中间状态转换,使模型能够逐步把握物理演化背后的因果依赖关系。

我特别感兴趣的一个成果是Causal CoT创造的上下文控制接口。由于我们的CausalWM已学会在因果推理中利用新的视觉信号,通过有限微调,任何有用的特征(例如模拟器渲染的机器人轨迹)都可以作为上下文控制添加,引导模型生成符合物理一致性的未来视频。

这种上下文学习能力为物理推理和因果干预提供了实用方法。

相关链接详见下方讨论区。

相似文章

YoCausal: 视频生成距离世界模型有多远?因果视角

Hugging Face Daily Papers

本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。