GE-Act 2.0: 用于机器人操作的预训练与扩展世界-动作模型
摘要
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。
查看缓存全文
缓存时间: 2026/09/09 04:29
论文页面 - GE-Act 2.0:面向机器人操作的世界-动作模型预训练与扩展
来源:https://huggingface.co/papers/2609.05588 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
GE-Act 2.0 是一个从头开始训练的世界-动作模型,采用面向控制的自编码器、单步视觉规划器和逆动力学模型,并利用知识对齐的选择性优化,实现跨多样技能和条件的可扩展零样本机器人操作。
世界-动作模型(WAM)(https://huggingface.co/papers?q=World-action%20models)预测未来状态以指导机器人动作,使其能够从无动作视频和有动作标记的交互中学习。大多数此类模型继承自预训练的视频生成器,使得WAM的预训练和扩展尚未得到充分探索。我们提出了 Genie Envisioner Act 2.0(GE-Act 2.0),这是一个其可训练的生成和动作组件均在操作数据上从头初始化的世界-动作模型。它结合了面向控制的自编码器(CoAE)(https://huggingface.co/papers?q=control-oriented%20autoencoder)、单步视觉规划器(SVP)(https://huggingface.co/papers?q=single-step%20visual%20planner)和逆动力学模型(IDM)(https://huggingface.co/papers?q=inverse%20dynamics%20model)。CoAE 在激进压缩下保留了与动作和指令相关的信息,而 SVP 在一次可微分过程中产生完整的未来状态,使得视觉规划和逆动力学可以在互补数据上分别进行预训练。随后,这些组件通过知识对齐的选择性优化(KASO)(https://huggingface.co/papers?q=knowledge-aligned%20selective%20optimization)进行联合训练,该优化通过仅选择在行为上与记录动作兼容的预测未来状态,来减少不匹配的监督信号。我们直接评估预训练检查点,无需针对特定任务进行微调,在20个操作技能组的100个任务上进行测试,这些任务使用了留出的场景、背景、光照和物体实例。将协同训练数据从300小时扩展到30,000小时,使G1-OP上的成功率从17.1%提升至44.1%,G2-90D上的成功率从13.4%提升至31.1%;尽管G2-90D仅占协同训练数据的不到2%,但其成功率提升了17.7个百分点,表明存在跨体态迁移(https://huggingface.co/papers?q=cross-embodiment%20transfer)。性能提升覆盖了19/20和18/20个技能组,并且技能特定覆盖率与零样本分布外(OOD)(https://huggingface.co/papers?q=zero-shot%20out-of-distribution)成功率高度相关(皮尔逊 r=0.80;斯皮尔曼 rho=0.85)。在相同协议下,该模型在至少90%的试验中正确解析了物体、颜色、形状和位置的指代,并且即使在明确指令与已执行行为或常规场景关联冲突时,也能遵循这些指令。
查看 arXiv 页面 (https://arxiv.org/abs/2609.05588)查看 PDF (https://arxiv.org/pdf/2609.05588)项目主页 (https://ge-act-v2.github.io/)添加至收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05588)
通过智能体获取此论文:
hf papers read 2609.05588
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.05588 以从本页面建立链接。
引用此论文的数据集 0
没有数据集关联此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.05588 以从本页面建立链接。
引用此论文的空间 0
没有空间关联此论文。
在空间的 README.md 中引用 arxiv.org/abs/2609.05588 以从本页面建立链接。
包含此论文的收藏夹 0
没有收藏夹包含此论文。
将此论文添加至收藏夹 (https://huggingface.co/new-collection)以从本页面建立链接。
相似文章
ZimaBlue: 通过可扩展的视频预训练进化可泛化的世界行动模型
ZimaBlue 引入了一个可扩展框架,从大规模自我中心视频中学习可泛化的世界行动模型,通过三阶段课程和慢-快架构,显著提升了零样本机器人操作能力。
Geometric Action Model 用于机器人策略学习
Geometric Action Model (GAM) 将预训练的几何基础模型 (GFM) 重新用作语言条件机器人操作的统一骨干,在模拟和真实世界基准测试中,相比现有的基础模型规模基线,实现了更高的准确性、鲁棒性和效率。
Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models (29 minute read)
Dyna-2 is a world-action model pre-trained on over a million hours of human video, showing scaling laws on human data and a human-to-robot transfer scaling law for zero-shot robot performance.
ABot-M0.5: 统一移动与操作的世界动作模型
ABot-M0.5 是一种针对移动操作的新型世界动作模型,通过时间粒度对齐、动作空间解耦和训练-测试一致性提升性能,在长时域和细粒度操作基准上达到了最先进水平。
从动作到世界建模的可迁移动态先验学习
本文介绍了A2World,一种基于扩散的世界模型,在大规模机器人操作数据上预训练,以学习可迁移的动态先验。该模型可适配为真实世界模拟器(A2World-sim)用于策略评估,或视频-动作联合预测模型(A2World-policy)用于动作预测,展示了在模拟器中心和策略中心的机器人学习中的优势。