标签
本文发现潜在世界动作模型无法泛化,并提出了Simple-WAM,它通过将未来建模简化为单次前向传递来提高泛化性能,同时保持效率。
EVO-WAM 是一个框架,通过从生成的视频-动作轨迹中学习,将世界动作模型适应于未见过的机器人任务,显著提高了成功率,而无需额外的专家示范。
AnyStep-WAM 引入了一个框架,用于世界动作模型中的可调预算预测和自适应推理,在机器人操作任务中显著减少去噪步数的同时保持任务成功率。
Rolling-WAM 引入了一种方法,将去噪过程分布在用于机器人操作的世界动作模型的重规划周期中,在重规划中实现了4.5倍的速度提升,同时保持了竞争性能。
DeltaWAM 引入了基于 Delta 的世界行动模型用于双臂操作,通过预测视觉变化和行动来提升效率和性能。它展示了成功率的提升和计算开销的降低。
OpenWAM 提出了一个开放的、模块化的框架,用于世界-动作模型预训练,以系统化地识别设计原则,预训练模型在模拟和真实世界的机器人应用中表现出色。
将视频预训练扩展到12万小时,可将世界行动模型在真实机器人上的零样本成功率从36.1%提升至77.8%,实现更快的动作预测。
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
LAWA是一个世界动作模型,使用潜在动作来实现机器人控制的高效未来想象,在降低推理延迟的同时达到最先进的性能。它无需生成未来观测即可在泛化能力和效率上优于基线。
RISE引入了一种自适应框架,用于世界动作模型中的想象推演,通过反事实驾驶数据集提高规划性能并减少不必要的计算。
BadWAM 引入了一个针对 World-Action Models (WAMs) 的对抗攻击框架,通过微小的视觉扰动打破想象与行动之间的对齐。这些攻击显著降低了任务成功率,暴露了这类模型中的一个漏洞。
GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。
Embodied.cpp 是一个可移植的C++推理运行时,通过模块化执行层和优化推理,能够在异构边缘设备和机器人上高效部署视觉-语言-动作模型与世界-动作模型。
本综述全面概述了世界行动模型(WAMs)——即生成未来状态以辅助决策的预测行动系统——并根据所需输出和设计选择对现有工作进行分类。
ImageWAM 提出在世界动作模型中用预训练图像编辑模型替代视频生成用于机器人控制,在将计算量降至视频方法的 1/6、延迟降至 1/4 的同时实现了更优性能。
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
Flash-WAM提出了一种面向世界行动模型的模态感知蒸馏方法,通过将扩散压缩为每个模态单步推理,实现了实时推理,速度提升23倍。
为机器人基础模型整理的视觉-语言-动作与世界动作模型研究 GitHub 列表。
在Sequoia AI Ascent演讲中,Jim Fan博士提出了与LLM成功相平行的实现Physical AGI路线图,介绍了视频世界模型、World Action Models (WAM) 和 Dexterity Scaling Law 等概念,并分享了对近期未来的预测。