未见先觉:世界行动模型的潜在未来
摘要
提出了ForeWAM,一种直接策略世界行动模型,通过隐藏的未来槽KV状态为动作生成提供预测上下文,避免显式未来视频解码,同时在LIBERO基准上实现了高成功率。
arXiv:2608.11605v1 公告类型:新
摘要:世界行动模型(WAMs)将未来视觉预测与机器人动作生成相结合,使策略能够建模物理世界在交互过程中的演化。现有WAMs在预测动态如何暴露给动作通路方面有所不同。显式未来WAMs可直接访问预测的场景演化,但迭代视频去噪会带来可观的推理开销。相比之下,直接策略WAMs能从当前观测高效预测动作,但缺乏在推理时将预测动态暴露给Action DiT的显式接口。为了弥合这一差距,我们提出了ForeWAM,一种动态条件化的直接策略WAM,它无需解码未来视频即可为动作生成提供预测上下文。其核心Future-KV在当前视觉潜变量和随机未来槽上执行一次Video DiT预填充,并在整个动作去噪过程中复用由此产生的逐层键值状态。我们进一步引入了由冻结的潜在动作教师监督的动态寄存器,鼓励隐式未来状态捕捉交互引起的转换,如物体运动、接触变化和任务进度。真实未来观测和教师仅在训练期间使用;部署时两者都不需要,且不执行未来视频生成。在没有具身机器人数据预训练的情况下,ForeWAM的标准变体和加速变体在LIBERO上分别达到96.7%和96.9%的平均成功率。标准变体在LIBERO-Plus上进一步达到61.6%的成功率。这些结果表明,直接策略WAMs能够在将预测动态暴露给动作通路的同时,保持高效的动作预测,而无需显式生成未来观测。
查看缓存全文
缓存时间: 2026/08/13 15:27
# 未见先觉:世界行动模型的潜在未来 来源:https://arxiv.org/html/2608.11605 Zhongbo Wu 单位:上海交通大学,单位:ACE Robotics Zheng Zhang 单位:ACE Robotics,单位:南洋理工大学 Zihan Wang 致谢:研究实习生。单位:上海交通大学 Shan You 单位:ACE Robotics Tao Huang 致谢:通讯作者。单位:上海交通大学 ######
相似文章
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
世界行动模型:具身智能的下一个前沿
本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。
世界-动作交互模型的DAWN
本文介绍了DAWN,一种用于世界-动作交互模型(WAIMs)的潜在生成基线,通过递归细化联合建模场景演化与动作生成,在自动驾驶场景中实现了强大的长时域规划性能。
Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。