@huang_biwei: 很高兴分享CausalWM,我们的因果世界模型v1,基于因果链式思考(CoT)构建。它目前排名…
摘要
CausalWM是一个因果世界模型,使用链式思考通过逐步捕捉物理依赖关系来预测未来帧,在像TriWorldBench和PAI-Bench这样的基准测试中排名第一。
查看缓存全文
缓存时间: 2026/09/19 21:09
很高兴分享CausalWM,这是基于因果链式思维(Causal Chain-of-Thought,Causal CoT)构建的因果世界模型v1。该模型目前在TriWorldBench基准测试和PAI-Bench机器人领域排名第一。
许多世界模型通过语言或动作条件直接从当前观测预测未来帧。这类模型生成的视频初看可能视觉效果逼真,但往往在细微却关键的物理细节上出现错误。
这是因为底层物理变量在隐式表示中仍处于纠缠状态,我们难以判断模型是否真正捕获了相关物理机制,还是仅依赖产生看似合理结果的捷径。
通过CausalWM,我们将因果链式思维引入未来视频预测。模型遵循明确的因果推理序列:
光流 → 几何结构/点云图 → 未来RGB图像
因果链的每个步骤都捕获有意义的中间状态转换,使模型能够逐步把握物理演化背后的因果依赖关系。
我特别感兴趣的一个成果是Causal CoT创造的上下文控制接口。由于我们的CausalWM已学会在因果推理中利用新的视觉信号,通过有限微调,任何有用的特征(例如模拟器渲染的机器人轨迹)都可以作为上下文控制添加,引导模型生成符合物理一致性的未来视频。
这种上下文学习能力为物理推理和因果干预提供了实用方法。
相关链接详见下方讨论区。
相似文章
学习用于部分可观测性下具身推理的反事实世界模型
本文介绍了反事实隐世界模型(CLWM),用于解决世界模型中的反事实坍缩问题,通过对比目标提高部分可观测性下具身推理的规划成功率。
YoCausal: 视频生成距离世界模型有多远?因果视角
本文介绍了YoCausal,一个基于认知科学中的违反预期(Violation of Expectation)范式的基准,用于评估视频扩散模型是否真正理解因果关系,还是仅仅过拟合于时间模式。对13个最先进模型的评估显示,与人类级别的因果认知相比,存在显著差距。
CausalNav: Reliability-Certified Causal World Models for Control under Physical-Parameter Shift
CausalNav is a controller using a signed causal transition graph as a world model, with certification gates that decide when to trust model-based advice. Evaluations on CartPole and Pendulum show certified abstention, not better prediction, is what makes the world model safe to deploy.
文本到图像模型是归纳主义火鸡吗?一个用于因果推理的反事实基准
本文介绍了CF-World,一个用于评估文本到图像模型是否依赖因果推理或仅仅是模式匹配的反事实基准。实验表明,所有模型在反事实设置下表现急剧下降,表明它们的理解仅限于视觉-文本紧密耦合的模式,而非真正的因果推理。
Next Forcing:基于多块预测的因果世界建模
Next Forcing 提出了一种用于因果世界建模的多块预测框架,可加速自回归视频生成的训练和推理,同时提高准确性和对物理规律的遵循程度。