Hydra-0:用于通用世界建模与控制的动作流
摘要
Hydra-0引入动作流作为通用世界建模和机器人控制的共享视觉接口,实现了显著的误差减少,并支持跨多种具身的零样本组合。
查看缓存全文
缓存时间: 2026/08/24 16:29
论文页面 - Hydra-0:面向通用世界建模与控制的动作流
来源:https://huggingface.co/papers/2608.18077 作者: , , , , , , , , ,
摘要
Hydra-0 使用动作流作为共享的视觉接口,实现跨不同具身形态和任务的通用世界建模与机器人控制。
我们提出了 Hydra-0,一个基于动作流条件化的通用世界模型(https://huggingface.co/papers?q=world%20model),它将机器人动作表示为像素运动(https://huggingface.co/papers?q=pixel%20motion)。这一共享的视觉接口通过学习跨具身形态、任务、环境和视频生成骨干网络的动作后果,实现了通用的世界建模和控制。我们最佳配置的机器人运动误差比基于动作条件的基线降低了90.4%,物体运动误差降低了60.2%,同时支持零样本组合(https://huggingface.co/papers?q=zero-shot%20composition)和数据高效适应。在 RoboLab 基准测试中,Hydra-0 重放成功率与参考成功率之间的皮尔逊相关系数达到 r=0.96。最后,我们发现了该接口的一个涌现式逆向模式(https://huggingface.co/papers?q=inverse%20mode):一个世界动作模型(https://huggingface.co/papers?q=world%20action%20model),它能根据从人类演示中迁移来的期望物体流预测兼容的机器人运动。训练好的动作头将所得的潜在特征映射为可执行动作,无需特定任务的专家机器人演示。这些结果共同证明了动作流(https://huggingface.co/papers?q=action%20flow)作为连接异构训练数据、开环策略评估(https://huggingface.co/papers?q=open-loop%20policy%20evaluation)和机器人控制的共享控制接口的潜力。
查看 arXiv 页面 (https://arxiv.org/abs/2608.18077)查看 PDF (https://arxiv.org/pdf/2608.18077)项目页面 (https://nvidia-isaac.github.io/video_to_data/hydra-0/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18077)
在你的智能体中获取此论文:
hf papers read 2608\.18077
还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.18077 即可从本页面链接到它。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.18077 即可从本页面链接到它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.18077 即可从本页面链接到它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection)即可从本页面链接到它。
相似文章
@NVIDIARobotics: 机器人动作可以在像素空间中表示为运动。NVIDIA Research 推出 Hydra-0,一个通用的世界模型……
NVIDIA Research 推出 Hydra-0,一个基于动作流条件的世界模型,将机器人动作表示为像素运动,实现了跨多种体现的学习,显著降低错误并具备零样本能力。
Masked Visual Actions:统一世界建模
介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。
Hy-Embodied-0.5-VLA: 从视觉-语言-动作模型到真实世界机器人学习栈
HyVLA-0.5 是一个端到端机器人学习系统,整合了数据收集、模型设计、预训练、微调和强化学习,用于真实世界部署。
AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由
AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。
GE-Act 2.0: 用于机器人操作的预训练与扩展世界-动作模型
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。