未见先觉:世界行动模型的潜在未来

arXiv cs.AI 论文

摘要

提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。

arXiv:2608.11605v1 公告类型:新 摘要:世界行动模型(WAMs)将未来视觉预测与机器人动作生成相结合,使策略能够建模物理世界在交互过程中的演化。现有WAMs在预测动态如何暴露给动作通路方面有所不同。显式未来WAMs可直接访问预测的场景演化,但迭代视频去噪会带来可观的推理开销。相比之下,直接策略WAMs能从当前观测高效预测动作,但缺乏在推理时将预测动态暴露给Action DiT的显式接口。为了弥合这一差距,我们提出了ForeWAM,一种动态条件化的直接策略WAM,它无需解码未来视频即可为动作生成提供预测上下文。其核心Future-KV在当前视觉潜变量和随机未来槽上执行一次Video DiT预填充,并在整个动作去噪过程中复用由此产生的逐层键值状态。我们进一步引入了由冻结的潜在动作教师监督的动态寄存器,鼓励隐式未来状态捕捉交互引起的转换,如物体运动、接触变化和任务进度。真实未来观测和教师仅在训练期间使用;部署时两者都不需要,且不执行未来视频生成。在没有具身机器人数据预训练的情况下,ForeWAM的标准变体和加速变体在LIBERO上分别达到96.7%和96.9%的平均成功率。标准变体在LIBERO-Plus上进一步达到61.6%的成功率。这些结果表明,直接策略WAMs能够在将预测动态暴露给动作通路的同时,保持高效的动作预测,而无需显式生成未来观测。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:27

# 未见先觉:世界行动模型的潜在未来

来源:https://arxiv.org/html/2608.11605

Zhongbo Wu 单位:上海交通大学,单位:ACE Robotics  
Zheng Zhang 单位:ACE Robotics,单位:南洋理工大学  
Zihan Wang 致谢:研究实习生。单位:上海交通大学  
Shan You 单位:ACE Robotics  
Tao Huang 致谢:通讯作者。单位:上海交通大学  

######

相似文章

世界行动模型:具身智能的下一个前沿

Hugging Face Daily Papers

本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。

世界-动作交互模型的DAWN

Hugging Face Daily Papers

本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。