Hydra-0:用于通用世界建模与控制的动作流

Hugging Face Daily Papers 论文

摘要

Hydra-0引入动作流作为通用世界建模和机器人控制的共享视觉接口,实现了显著的误差减少,并支持跨多种具身的零样本组合。

我们介绍了Hydra-0,一个基于动作流的通用世界模型,它将机器人动作表示为像素运动。这种共享视觉接口通过学习跨具身、任务、环境和视频生成主干的动作后果,实现了通用世界建模和控制。我们的最佳配置相比动作条件基线,机器人运动误差降低了90.4%,物体运动误差降低了60.2%,同时支持零样本组合和数据高效适应。在RoboLab基准测试中,Hydra-0在回放成功率和参考成功率之间达到了r=0.96的皮尔逊相关系数。最后,我们发现了这种接口的一个涌现逆模式:一个世界动作模型,可以从人类演示中转移的期望物体流动预测兼容的机器人运动。一个训练好的动作头将由此产生的潜在特征映射到可执行动作,无需任务特定的专家机器人演示。总之,这些结果证明了动作流作为共享控制接口的潜力,它连接了异构训练数据、开环策略评估和机器人控制。
查看原文
查看缓存全文

缓存时间: 2026/08/24 16:29

论文页面 - Hydra-0:面向通用世界建模与控制的动作流

来源:https://huggingface.co/papers/2608.18077 作者: , , , , , , , , ,

摘要

Hydra-0 使用动作流作为共享的视觉接口,实现跨不同具身形态和任务的通用世界建模与机器人控制。

我们提出了 Hydra-0,一个基于动作流条件化的通用世界模型(https://huggingface.co/papers?q=world%20model),它将机器人动作表示为像素运动(https://huggingface.co/papers?q=pixel%20motion)。这一共享的视觉接口通过学习跨具身形态、任务、环境和视频生成骨干网络的动作后果,实现了通用的世界建模和控制。我们最佳配置的机器人运动误差比基于动作条件的基线降低了90.4%,物体运动误差降低了60.2%,同时支持零样本组合(https://huggingface.co/papers?q=zero-shot%20composition)和数据高效适应。在 RoboLab 基准测试中,Hydra-0 重放成功率与参考成功率之间的皮尔逊相关系数达到 r=0.96。最后,我们发现了该接口的一个涌现式逆向模式(https://huggingface.co/papers?q=inverse%20mode):一个世界动作模型(https://huggingface.co/papers?q=world%20action%20model),它能根据从人类演示中迁移来的期望物体流预测兼容的机器人运动。训练好的动作头将所得的潜在特征映射为可执行动作,无需特定任务的专家机器人演示。这些结果共同证明了动作流(https://huggingface.co/papers?q=action%20flow)作为连接异构训练数据、开环策略评估(https://huggingface.co/papers?q=open-loop%20policy%20evaluation)和机器人控制的共享控制接口的潜力。

查看 arXiv 页面 (https://arxiv.org/abs/2608.18077)查看 PDF (https://arxiv.org/pdf/2608.18077)项目页面 (https://nvidia-isaac.github.io/video_to_data/hydra-0/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.18077)

在你的智能体中获取此论文:

hf papers read 2608\.18077

还没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.18077 即可从本页面链接到它。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.18077 即可从本页面链接到它。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.18077 即可从本页面链接到它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)即可从本页面链接到它。

相似文章

Masked Visual Actions:统一世界建模

Hugging Face Daily Papers

介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。

AHA-WAM:异步视野自适应世界动作建模与观测引导上下文路由

Hugging Face Daily Papers

AHA-WAM是一种异步世界动作模型,采用双扩散Transformer将世界预测与动作执行解耦,实现了高效的长视野规划和实时控制。它在机器人操作任务上达到了最先进的性能,在RoboTwin上成功率达92.8%,在现实世界任务中达78.3%,同时实现了24.17 Hz的闭环控制。