GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM
摘要
GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。
查看缓存全文
缓存时间: 2026/07/16 05:42
论文页 - GigaWorld-Policy-0.5: 一个由AutoResearch驱动的更快更强的WAM
来源: https://huggingface.co/papers/2607.13960 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
世界动作模型(WAMs)通过联合建模动作和未来视觉观测来改进机器人策略学习,利用未来场景演化作为密集监督信号,实现基于物理的动作生成。然而,现有WAM的一个常见设计是在推理时显式生成未来视频,这带来了大量计算开销,阻碍了实时闭环部署。GigaWorld-Policy通过以动作为中心的公式解决了这一问题:训练时使用未来视觉动态,推理时仅解码动作。在此框架基础上,我们提出了GigaWorld-Policy-0.5,一个增强的以动作为中心的WAM,专为更高效的机器人控制而设计。在预训练阶段,GigaWorld-Policy-0.5采用混合的动作条件世界建模(AC-WM)与WAM训练策略。这增强了视觉动态与机器人动作之间的耦合,并提高了动作表示在下游策略学习中的可迁移性。为了实现高效推理,GigaWorld-Policy-0.5引入了混合Transformer架构,将视觉动态建模和动作生成分离到专门的专家模块中,在仅动作推理时减少活跃计算,在本地RTX 4090设置上实现了85ms的推理延迟。此外,我们采用基于智能体的AutoResearch管线系统性地搜索训练配置,从而在减少超参数调优所需时间和人工干预的同时,更高效地识别最优实验设置。实验和消融研究表明,GigaWorld-Policy-0.5保留了未来视觉动态的训练优势,同时提高了机器人控制的推理效率。
查看 arXiv 页面 (https://arxiv.org/abs/2607.13960)查看 PDF (https://arxiv.org/pdf/2607.13960)项目页面 (https://open-gigaai.github.io/giga-world-policy/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.13960)
在你的智能体中获取此论文:
hf papers read 2607\.13960
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
open-gigaai/Giga-World-Policy-0.5 更新于约3小时前 • 4 (https://huggingface.co/open-gigaai/Giga-World-Policy-0.5)
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.13960,以从本页链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.13960,以从本页链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)中,以从本页链接。
相似文章
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
Light-WAM:基于状态融合动作解码的高效世界动作模型
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
SimWAM:一种用于端到端自动驾驶的简单世界动作模型
SimWAM是一种简单而有效的世界动作模型,用于端到端自动驾驶,它将视频生成纯粹用作训练信号,在NAVSIM上实现了最先进的91.5 PDMS,同时降低了推理延迟。