GE-Act 2.0: 用于机器人操作的预训练与扩展世界-动作模型

Hugging Face Daily Papers 论文

摘要

本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。

世界-动作模型(WAM)预测未来状态以指导机器人动作,使得能够从无动作视频和动作标注交互中学习。大多数模型继承了预训练的视频生成器,使得世界-动作模型的预训练和扩展尚未得到充分探索。我们介绍了Genie Envisioner Act 2.0(GE-Act 2.0),这是一个世界-动作模型,其可训练的生成和动作组件均基于操作数据从头初始化。它结合了控制导向自编码器(CoAE)、单步视觉规划器(SVP)和逆动力学模型(IDM)。CoAE在激进压缩下保留动作和指令相关信息,而SVP通过一次可微分传递生成完整的未来状态,使得视觉规划和逆动力学可以在互补数据上分别预训练。然后,使用知识对齐选择性优化(KASO)对组件进行联合训练,通过仅选择与记录动作行为兼容的预测未来来减少不匹配的监督。我们直接评估预训练检查点,无需针对每项任务进行微调,在20个操作技能组的100项任务上进行测试,这些任务包含保留的场景、背景、光照和物体实例。将协同训练数据从300小时扩展到30,000小时,使G1-OP的成功率从17.1%提升到44.1%,G2-90D从13.4%提升到31.1%;尽管G2-90D仅占协同训练数据的不到2%,但提升了17.7个百分点,表明存在跨体态迁移。收益覆盖19/20和18/20的技能组,技能特定覆盖率与零样本分布外(OOD)成功率强相关(Pearson r=0.80;Spearman rho=0.85)。在相同协议下,模型在至少90%的试验中正确理解物体、颜色、形状和位置引用,即使指令与已承诺行为或常规场景关联冲突时也能遵循明确指令。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:29

论文页面 - GE-Act 2.0:面向机器人操作的世界-动作模型预训练与扩展

来源:https://huggingface.co/papers/2609.05588 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

GE-Act 2.0 是一个从头开始训练的世界-动作模型,采用面向控制的自编码器、单步视觉规划器和逆动力学模型,并利用知识对齐的选择性优化,实现跨多样技能和条件的可扩展零样本机器人操作。

世界-动作模型(WAM)(https://huggingface.co/papers?q=World-action%20models)预测未来状态以指导机器人动作,使其能够从无动作视频和有动作标记的交互中学习。大多数此类模型继承自预训练的视频生成器,使得WAM的预训练和扩展尚未得到充分探索。我们提出了 Genie Envisioner Act 2.0(GE-Act 2.0),这是一个其可训练的生成和动作组件均在操作数据上从头初始化的世界-动作模型。它结合了面向控制的自编码器(CoAE)(https://huggingface.co/papers?q=control-oriented%20autoencoder)、单步视觉规划器(SVP)(https://huggingface.co/papers?q=single-step%20visual%20planner)和逆动力学模型(IDM)(https://huggingface.co/papers?q=inverse%20dynamics%20model)。CoAE 在激进压缩下保留了与动作和指令相关的信息,而 SVP 在一次可微分过程中产生完整的未来状态,使得视觉规划和逆动力学可以在互补数据上分别进行预训练。随后,这些组件通过知识对齐的选择性优化(KASO)(https://huggingface.co/papers?q=knowledge-aligned%20selective%20optimization)进行联合训练,该优化通过仅选择在行为上与记录动作兼容的预测未来状态,来减少不匹配的监督信号。我们直接评估预训练检查点,无需针对特定任务进行微调,在20个操作技能组的100个任务上进行测试,这些任务使用了留出的场景、背景、光照和物体实例。将协同训练数据从300小时扩展到30,000小时,使G1-OP上的成功率从17.1%提升至44.1%,G2-90D上的成功率从13.4%提升至31.1%;尽管G2-90D仅占协同训练数据的不到2%,但其成功率提升了17.7个百分点,表明存在跨体态迁移(https://huggingface.co/papers?q=cross-embodiment%20transfer)。性能提升覆盖了19/20和18/20个技能组,并且技能特定覆盖率与零样本分布外(OOD)(https://huggingface.co/papers?q=zero-shot%20out-of-distribution)成功率高度相关(皮尔逊 r=0.80;斯皮尔曼 rho=0.85)。在相同协议下,该模型在至少90%的试验中正确解析了物体、颜色、形状和位置的指代,并且即使在明确指令与已执行行为或常规场景关联冲突时,也能遵循这些指令。

查看 arXiv 页面 (https://arxiv.org/abs/2609.05588)查看 PDF (https://arxiv.org/pdf/2609.05588)项目主页 (https://ge-act-v2.github.io/)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05588)

通过智能体获取此论文:

hf papers read 2609.05588

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文。

在模型的 README.md 中引用 arxiv.org/abs/2609.05588 以从本页面建立链接。

引用此论文的数据集 0

没有数据集关联此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2609.05588 以从本页面建立链接。

引用此论文的空间 0

没有空间关联此论文。

在空间的 README.md 中引用 arxiv.org/abs/2609.05588 以从本页面建立链接。

包含此论文的收藏夹 0

没有收藏夹包含此论文。

将此论文添加至收藏夹 (https://huggingface.co/new-collection)以从本页面建立链接。

相似文章

Geometric Action Model 用于机器人策略学习

Hugging Face Daily Papers

Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。

ABot-M0.5: 统一移动与操作的世界动作模型

Hugging Face Daily Papers

ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。

从动作到世界建模的可迁移动态先验学习

Hugging Face Daily Papers

本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。