@NVIDIARobotics: 机器人动作可以在像素空间中表示为运动。NVIDIA Research 推出 Hydra-0,一个通用的世界模型……

X AI KOLs Timeline 模型

摘要

NVIDIA Research 推出 Hydra-0,一个基于动作流条件的世界模型,将机器人动作表示为像素运动,实现了跨多种体现的学习,显著降低错误并具备零样本能力。

机器人动作可以在像素空间中表示为运动。 NVIDIA Research 推出 Hydra-0,一个基于动作流条件的世界模型:图像平面轨迹,使得一个模型能够跨人手、手持夹具、单臂机器人和双臂系统进行学习。 探索项目 https://nvda.ws/4xaO9C0
查看原文
查看缓存全文

缓存时间: 2026/09/01 15:48

机器人动作可以表现为像素空间中的运动。

NVIDIA Research 推出 Hydra-0,一个基于动作流条件的通用世界模型:通过图像平面轨迹,使一个模型能够学习人类手部、手持抓具、单臂机器人及双臂系统的操作。

探索该项目:https://nvda.ws/4xaO9C0


Hydra-0:用于通用世界建模与控制的动作流

来源:https://nvidia-isaac.github.io/video_to_data/hydra-0/?linkId=100000437297790

概览视频

图 1:来自第一人称人类视角、UMI 抓具、双臂系统及单臂系统的异构交互视频被转换为统一的动作流,该动作流作为 Hydra-0 的条件;随后模型支持模拟、策略评估与策略学习。(https://nvidia-isaac.github.io/video_to_data/hydra-0/img/teaser_figure1.webp)

**图 1:作为共享控制接口的动作流。**上方: Hydra-0 从包含第一人称人类演示、手持 UMI 抓具、双臂机械臂和单臂机器人的多样化交互视频中学习。中间: 可见的执行体运动被表示为图像平面流轨迹,将异构交互置于一个共同的、与执行体特定关节或末端执行器坐标无关的像素对齐动作流空间中。这一统一接口使得单一通用世界模型能够从多执行体数据中学习,并跨交互场景迁移。下方: 在正向模式中,提供的抓具流条件预测未来场景演变,其展开支持开环策略评估;在逆向模式中,期望的物体流生成兼容的机器人运动,再由监督读出模块转换为可执行动作。

动作流作为共享视觉接口

图 1,条带 1–2 · 动画

来源

共享动作流

EgoDex · 人类手部

Deform360 · 手持抓具

DROID · 单臂

XVLA-Soft-Fold · 双臂

一种表示,四种执行体:第一人称视角的人类手部、手持抓具、单臂和双臂机器人。下行是上行加上接口——承载模型条件轨迹的同一窗口。该接口带来的优势体现在本页其余部分:模拟、策略评估与控制。

摘要

我们提出 Hydra-0,一个以动作流为条件的通用世界模型,它将机器人动作表示为像素运动。这一共享视觉接口通过跨执行体、任务、环境和视频生成骨干网络学习动作后果,实现了通用世界建模与控制。我们最优配置相比基于原生动作的基线,实现了机器人运动误差降低 90.4% 和物体运动误差降低 60.2%,同时支持零样本组合与数据高效适应。在 RoboLab 基准测试中,Hydra-0 在回放与参考成功率之间实现了 r = 0.96 的皮尔逊相关性。

最后,我们发现了该接口的一种涌现式逆向模式:一个世界动作模型,能够根据从人类演示中转移的期望物体流预测兼容的机器人运动。一个训练好的动作头将相应的潜在特征映射为可执行动作,无需任务特定的专家机器人演示。这些结果共同证明了动作流作为连接异构训练数据、开环策略评估与机器人控制的共享控制接口的潜力。

90.4%

机器人运动误差相比原生动作基线降低

60.2%

物体运动误差降低

0.96

在300个测试集上与 RoboLab 成功率的相关性

16.0×

经少步蒸馏后的生成速度提升

2,202 小时

经筛选的多执行体训练视频

方法

一种条件接口,通过两种方式构建:训练时从视频生成,部署时从运动学生成。

执行体 — 执行的身体

被操作物体

动作流是一组描述可见执行体指定运动的摄像机平面轨迹:包含图像位置与可见性标志,并在预测时间步长内被追踪。相同的表示可用于描述机械臂、手持抓具或人类手部,而无需向视频模型暴露它们各自原生的动作空间。

离线训练动作流从交互视频中恢复

DROID 单臂

交互视频

动作流

Deform360 手持抓具

交互视频

动作流

XVLA-Soft-Fold 双臂

交互视频

动作流

每一行是一个5秒窗口播放两次,帧锁定:右侧是同一窗口,承载模型条件轨迹,并绘制在一秒滚动历史之上。该行水平滚动。轨迹同时标注在执行体和被操作物体上:密集追踪器从视频中恢复轨迹,并用分割掩码将其分离。此通道中的任何内容均非从机器人几何结构投影得出——那是下面的部署路径。第一帧加上此流即为全部条件;片段的其余部分即为流匹配的目标。

在线部署一个混合循环:物理引擎驱动机器人,世界模型驱动世界

部署不是单一模拟器,而是两个,每个只负责其擅长的部分。Isaac Lab 负责机器人:一个刚性的、经过标定的、完全已知的身体,其对指令的响应是已解决的问题,因此被精确执行而非预测。Hydra-0 负责物理引擎需要资产和材料模型才能处理的一切——布料、可变形物体、接触、光照以及其从未获得网格模型的场景。动作流是二者之间的接缝:它是物理引擎移交的内容,也是视频模型关于机器人的唯一信息。

真实 RGB 观测于展开起始时刻1 观测 模型所依据的单帧图像2 Isaac Lab 中的指令展开 候选指令,由物理模拟器执行3 运动学投影流 交接点——相同指令,在图像平面中4 预测后果 世界模型生成的内容

可见的机器人表面点通过指定的连杆变换进行传播,并通过标定的摄像机投影;模型随后预测该指令的后果。步骤3始于带有自身投影流的 Isaac Lab 渲染,并溶解到带有相同流的真实观测——两者都是相同的标定顶部摄像机,因此轨迹在任一情况下都位于机械臂上,这也是在模拟中执行的指令能够条件化真实场景预测的全部原因。这三个片段是一个时长17秒的闭环展开,共享同一时钟,因此模拟器中的机械臂姿态、观测上绘制的流以及生成的帧都属于同一时刻。

几何感知构建

当机器人几何结构和标定信息可用时,第一观测中可见的表面点在候选指令下进行传播,并投影到摄像机平面。一个点仅在摄像机深度为正、位于图像内、且在3×3邻域内与渲染深度缓冲区一致(误差在1.2厘米内)时才被视为可见,这用于剔除自遮挡点。

纯视频构建

大多数大型交互数据集既不提供机器人描述文件也不提供标定信息。在此,我们使用流追踪器恢复密集的图像平面轨迹,并用执行体和物体的分割掩码进行分割——相同的表示,无需特权元数据。

分割与采样

图 2 · 密集轨迹被掩码分割,然后每个训练步骤抽取一种条件模式。

执行体 — 执行的身体

被操作物体

密集轨迹 追踪器输出,在任何标注之前执行体掩码 在双臂移动时保持被操作物体掩码 在布料变形时保持执行体· p = 0.40 执行体轨迹——主要动作条件。物体· p = 0.40 任务或期望运动流;用于模型逆向的模式。全部· p = 0.15 语义分割不完整时的后备选项。无· p = 0.05 条件丢弃——仅文本和图像。所有七个面板是相同的81帧窗口,一起播放。每个训练步骤从掩码定义的池中抽取一种条件模式:从追踪器返回的14,997条轨迹中,有1,819条执行体轨迹和3,250条物体轨迹。

定性展开结果

图 3

完整的5秒展开,每行一个留出数据集。一行中的所有面板都是同一评估样本在相同时间步,因此按列读取代表一种方法,按行读取代表一个数据集。每行包含三个留出样本——使用数据集名称旁边的箭头逐步查看,并悬停计数器查看模型所依据的任务。

Wan-Move

Cosmos 2.5

本方法

真实值

XVLA-Soft-Fold

双臂 YAM · 服装折叠

1 / 3

Deform360

手持抓具 · 单物体操作

1 / 3

DROID

单个 Franka 臂 · 真实场景

1 / 3

ABC-130k

双臂 YAM · 家务杂务

1 / 3

一行中的四个面板作为一个片段播放:页面将它们固定到共享时钟并在循环换帧时进行校正,因此屏幕上的差异是方法之间的差异,而非播放器之间的差异。每个基线都重采样到该样本的真实帧尺寸——Cosmos 2.5 将每个样本渲染为 320×256,Wan-Move 渲染为 720×544 到 832×464,而真实值运行在 640×480 到 848×480——因此面板中物体占据的比例不是谁渲染得更大的伪影。

多执行体数据集上的评估

所有方法在五个留出数据集上,每个数据集看到相同的100个验证片段。

在相同的 Cosmos 2.5 骨干网络内,将原生相对6D动作替换为动作流,在所有五个数据集上提升了 PSNR、SSIM、抓具 EPE、FID 和 FVD,在四个测量物体 EPE 的数据集上也提升了该指标——这一受控比较隔离了条件表示的影响。VLM 评分是例外,且结果不一:该评分器评估物理合理性和时间一致性,而非生成运动是否遵循指定轨迹(流 EPE 直接衡量后者)。最优配置是蒸馏后的四步 Wan2.2 A14B 模型,在几乎所有单元格中表现最佳且速度最快。

模型PSNR ↑SSIM ↑物体 EPE ↓抓具 EPE ↓FID ↓FVD ↓VLM ↑

{{ row.name }}

{{ cell.text }}

灰色行是使用已发布检查点的零样本基线;每列的最佳值以粗体绿色显示。标准误差在论文中报告。DROID 数据集的物体 EPE 已省略,因为该场景中物体分割不可靠。

腕部相机自我运动

安装在机械臂上的相机会产生固定视角所不具备的全局图像运动。给定深度和相对相机位姿,相机自我运动可转换为相同的图像空间条件,因此一个接口可同时覆盖相机运动和交互运动。这是一个单次展开的概念验证,并非系统性评估。

一个 DROID 腕部窗口:真实值、本方法的生成结果及其所依据的条件流。

来自多执行体中期训练的数据效率

六个留出的交互世界模拟器任务,使用 0-100% 的各任务训练集进行适应。

LPIPS、物体流 EPE 和 FVD 与任务特定训练数据百分比的关系,针对六个交互世界模拟器任务六个留出 IWS 任务的数据效率;三项指标均为越低越好。本方法 (MT) 从多执行体中期训练检查点开始,本方法 (PT) 从原始 Wan2.2 权重开始;Wan-Move 和 ATI 以零样本评估。在使用任何任务数据前的最强迁移

在 0% 时,中期训练版本在所有六个任务上均优于仅预训练版本,体现在 LPIPS、物体流 EPE 和 FVD 指标上。任务特定的 IWS 模型和新增的 Cosmos 2.5 动作层在这三项指标上表现明显较差,表明其未适应的动作接口无法迁移到留出任务。

优势在适应后得以保持

在 100% 时,中期训练版本在所有六个任务上具有最低的 LPIPS 和 FVD,在四个任务上具有最低的流 EPE。

大部分增益在 20% 时即已获得

在任务集的 20% 到 100% 之间,各项任务的指标值变动最多为 LPIPS 3.4%,流 EPE 6.7%,FVD 6.8%。

通过开环回放进行策略评估

模拟器从某集的第一个观测初始化,并将该集已实现的轨迹作为动作流进行回放。

由于策略从未在生成的观测上进行查询,这衡量的是模拟器能否保留其被展示的结果——而非对未执行指令的前瞻性评估。生成的展开由人类评分员应用相同任务谓词进行评分,且策略身份被隐藏。

RoboLab

5 个策略 × 6 个任务 · 300 集

π0, π0.5, GR00T N1.7, Cosmos-3 Nano 和 Cosmos-3 Edge,每个任务展开10次。

重放成功率与参考成功率的散点图,针对六个 RoboLab 任务上的五个策略,带最小二乘拟合每个点汇总一个策略-任务对的10次展开;虚线为最小二乘拟合。

  • 总体成功率 26.3%(模拟)vs. RoboLab 中的 26.7%——偏差为 -0.3 个百分点。
  • 两者对所有五个策略的排序一致。
  • 逐集判定匹配率为 93.0%(Cohen’s κ = 0.82):10 个假阳性,11 个假阴性。

并排回放

参考值 vs. 模拟值,相同复位与相机

RoboLab 参考值 · 成功模拟值 · 成功RoboLab 参考值 · 失败模拟值 · 失败

反向运行接口

图 4 · 柔性管弯曲,从人类演示直至机器人执行。

提供期望的物体流而非执行体流,世界模型会生成兼容的机器人运动,随后通过学习的动作读出模块产生可执行的14自由度指令。此处的物体流转移自一个留出的人类演示,读出模块在包含成功与失败的真实世界配对展开上训练——无需任务特定的专家机器人演示。

人类演示 留出来源期望物体流 提供的唯一条件生成的机器人运动 无执行体流输入物理执行 14自由度 YAM,动作读出模块所有四个片段来自同一次柔性管运行。

局限性

世界动作模型可能存在约1厘米的抓取不精确。我们假设有限的深度感知是原因之一,但未证实其为根本原因。生成的展开中抓取与接触状态也可能存在歧义,包括物体是否确实被稳固夹持。基于深度、触觉或力信号进行条件化是明显的下一步工作。腕部相机结果是 DROID 的定性概念验证;在移动操作及更广泛相机运动下的系统性评估仍是未来工作,闭环策略评估亦是如此——本文报告的所有结果均为开环。

BibTeX

如果您觉得此工作有用,请引用该报告。

arXiv:2608.18077

@misc{li_hydra-0_2026,
    title = {Hydra-0: {Action} {Flow} for {Generalist} {World} {Modeling} and {Control}},
    shorttitle = {Hydra-0},
    url = {http://arxiv.org/abs/2608.18077},
    doi = {10.48550/arXiv.2608.18077},
    publisher = {arXiv},
    author = {Li, Hongyu and Wen, Bowen and Zhu, Xinghao and Wang, Yixuan and Du, Yilun and Li, Yunzhu and Konidaris, George and Birchfield, Stan and Pouya, Soha and Li, Chenran and Chang, Yan},
    month = aug,
    year = {2026},
    note = {arXiv:2608.18077 [cs.RO]},
}

相似文章

Masked Visual Actions:统一世界建模

Hugging Face Daily Papers

介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。

nvidia/Cosmos3-Nano

Hugging Face Models Trending

NVIDIA 发布 Cosmos3-Nano,一个用于物理 AI 的全能世界模型,能够从文本、图像、视频和动作输入生成视频、图像、音频和动作指令,面向机器人、自动驾驶和智能空间应用。