标签
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。
GameWAM引入了首个用于视频游戏原生闭环游戏玩法和GUI控制的世界动作模型,联合生成视觉观察和可执行动作,具有竞争力的任务成功率,并揭示了源敏感性故障模式。
GameWAM 引入了首个统一的世界动作模型,用于原生视频游戏控制,通过块因果流匹配和模式特定分布联合预测未来视觉和可执行动作。
本文介绍了DECOWAM,一种用于腿式移动操作的解耦全身世界-动作模型,通过专用条件接口和新数据集,在视频和动作预测性能上优于现有模型如FastWAM。
Dyna Robotics 推出了 Dyna-2,这是一个在一百万小时人类视频上预训练的世界-动作模型,揭示了缩放定律,并表明具身差距更像是一个适应问题,而非知识问题。
Dyna-2 is a world-action model pre-trained on over a million hours of human video, showing scaling laws on human data and a human-to-robot transfer scaling law for zero-shot robot performance.
Dyna Robotics 推出了 Dyna-2,一个在超过一百万小时人类视频上预训练的世界动作模型,发现了机器人操作的新扩展定律。
SimWAM是一种简单而有效的世界动作模型,用于端到端自动驾驶,它将视频生成纯粹用作训练信号,在NAVSIM上实现了最先进的91.5 PDMS,同时降低了推理延迟。
ST-WAM提出了一种语义-时间世界动作模型,使用DINOv3特征作为共享语义表示,以提高视觉分布偏移下机器人操作的鲁棒性,在LIBERO上达到98.7%,在RoboTwin 2.0上达到92.8%,在零样本设置下相较于Fast-WAM有显著提升。
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。
World Pilot 通过融入来自世界动作模型的动态场景演变和轨迹先验来增强视觉-语言-动作模型,在操作任务上实现了最先进的零样本性能。
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
WALL-WM 通过使用语义事件作为学习单元而非固定动作块,推进了视频-动作学习,实现了更灵活和可扩展的视觉-语言-动作训练与推理。
介绍了两个机器人世界模型相关的项目:Awesome-WAM(OpenMOSS)收录了World Action Models和DreamDojo等论文;awesome-physical-ai整理了VLA模型、世界模型和具身基础模型论文合集(含NVIDIA Cosmos Predict2.5)。
英伟达机器人负责人Jim Fan公开演讲,主张机器人应直接照搬大语言模型的成功路径,提出世界动作模型(WAM)、基于人类第一人称视频的数据革命以及神经模拟等方向,并预测95%概率在2040年前实现通用实体机器人终局。