GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM

Hugging Face Daily Papers 论文

摘要

GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。

世界动作模型(WAM)通过联合建模动作和未来视觉观察,利用未来场景演化作为密集监督来生成物理上合理的动作,从而改进机器人策略学习。然而,现有 WAM 的一个常见设计是在推理时显式生成未来视频,这带来了巨大的计算开销,阻碍了实时闭环部署。GigaWorld-Policy 通过以动作为中心的公式解决了这一问题:训练时使用未来视觉动态,推理时仅进行动作解码。在此基础上,我们提出了 GigaWorld-Policy-0.5,这是一个增强版的以动作为中心的 WAM,专为更高效的机器人控制而设计。在预训练阶段,GigaWorld-Policy-0.5 采用了混合动作条件世界建模(AC-WM)和 WAM 训练策略。这增强了视觉动态与机器人动作之间的耦合,提高了动作表示在下游策略学习中的可迁移性。为了实现高效推理,GigaWorld-Policy-0.5 引入了混合变换器(Mixture-of-Transformers)架构,将视觉动态建模和动作生成分离到专门的专家模块中,减少了纯动作推理时的活跃计算量,在本地 RTX 4090 设置下实现了 85 毫秒的推理延迟。此外,我们采用基于代理的 AutoResearch 流水线系统性地搜索训练配置,从而更高效地识别最优实验设置,同时减少超参数调优所需的时间和人工干预。实验和消融研究表明,GigaWorld-Policy-0.5 保留了未来视觉动态的训练优势,同时提高了机器人控制的推理效率。
查看原文
查看缓存全文

缓存时间: 2026/07/16 05:42

论文页 - GigaWorld-Policy-0.5: 一个由AutoResearch驱动的更快更强的WAM

来源: https://huggingface.co/papers/2607.13960 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

世界动作模型(WAMs)通过联合建模动作和未来视觉观测来改进机器人策略学习,利用未来场景演化作为密集监督信号,实现基于物理的动作生成。然而,现有WAM的一个常见设计是在推理时显式生成未来视频,这带来了大量计算开销,阻碍了实时闭环部署。GigaWorld-Policy通过以动作为中心的公式解决了这一问题:训练时使用未来视觉动态,推理时仅解码动作。在此框架基础上,我们提出了GigaWorld-Policy-0.5,一个增强的以动作为中心的WAM,专为更高效的机器人控制而设计。在预训练阶段,GigaWorld-Policy-0.5采用混合的动作条件世界建模(AC-WM)与WAM训练策略。这增强了视觉动态与机器人动作之间的耦合,并提高了动作表示在下游策略学习中的可迁移性。为了实现高效推理,GigaWorld-Policy-0.5引入了混合Transformer架构,将视觉动态建模和动作生成分离到专门的专家模块中,在仅动作推理时减少活跃计算,在本地RTX 4090设置上实现了85ms的推理延迟。此外,我们采用基于智能体的AutoResearch管线系统性地搜索训练配置,从而在减少超参数调优所需时间和人工干预的同时,更高效地识别最优实验设置。实验和消融研究表明,GigaWorld-Policy-0.5保留了未来视觉动态的训练优势,同时提高了机器人控制的推理效率。

查看 arXiv 页面 (https://arxiv.org/abs/2607.13960)查看 PDF (https://arxiv.org/pdf/2607.13960)项目页面 (https://open-gigaai.github.io/giga-world-policy/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.13960)

在你的智能体中获取此论文:

hf papers read 2607\.13960

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

open-gigaai/Giga-World-Policy-0.5 更新于约3小时前 • 4 (https://huggingface.co/open-gigaai/Giga-World-Policy-0.5)

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.13960,以从本页链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.13960,以从本页链接。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)中,以从本页链接。

相似文章

AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由

Hugging Face Daily Papers

AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。