DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

arXiv cs.AI 论文

摘要

本文介绍了DECOWAM,一种用于腿式移动操作的解耦全身世界-动作模型,通过专用条件接口和新数据集,在视频和动作预测性能上优于现有模型如FastWAM。

arXiv:2608.20114v1 公告类型:新 摘要:移动操作要求机器人预测运动和臂部动作如何共同改变未来的观测和控制。现有的世界-动作模型主要为固定基座平台开发,没有明确区分摄像机的自主运动与基座和臂部动作。本文介绍DECOWAM,一种全身世界-动作模型,通过专用条件接口分离这些因素。DECOWAM冻结了适配的FastWAM主干网络,并训练残差适配器、从特权观测中提取的动作等效未来瓶颈、对抗性分离的基座和臂部潜变量,以及用于视频预测的基座速度条件。我们进一步引入ARMDOG,一个同步视频、全身状态和动作以及语言的真实机器人数据集。在固定回放协议下,DECOWAM在视频预测和动作预测上均优于FastWAM,将动作均方误差降低了21.7%,使用了25.95M的可训练适配参数。在每种方法的79次闭环试验中,它在比较系统中实现了最高的观察到的全身协调性和基座位移鲁棒性,同时任务完成情况与最强基线相当。这些结果表明,具身感知的分解可以支持在移动视点下的参数高效联合视觉预测和全身控制。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:17

# 面向腿式移动操作的解耦全身世界-动作模型
来源:https://arxiv.org/html/2608.20114
马思远\*,1,张博石\*,1,张宇天\*,2,吴青莲3,翟佳琪4,魏栋†,4,于乔俊†,2
机构:1清华大学,北京,中国 2上海人工智能实验室,上海,中国 3哈尔滨工业大学,哈尔滨,中国 4杭州云深处科技有限公司(深度机器人),杭州,中国 \*同等贡献。†通讯作者。

###### 摘要

移动操作要求机器人预测移动和手臂动作如何共同改变未来的观测并进行控制。现有的世界-动作模型主要为固定基座平台开发,并未明确区分相机自运动与基座和手臂动作。本文引入了 DECOWAM,一种通过专用条件接口分离这些因素的全身世界-动作模型。DECOWAM 冻结了一个适配的 FastWAM 主干网络,并训练残差适配器、一个从特权观测中蒸馏出的、动作等价的未来瓶颈、一个通过对抗性分离的基座与手臂潜变量,以及用于视频预测的基座速度条件。我们进一步引入了 ARMDOG,一个同步了视频、全身状态与动作以及语言的真实机器人数据集。在固定的回放协议下,DECOWAM 在未来视频和动作预测方面均优于 FastWAM,在可训练的适配参数为 25.95M 的情况下,将动作的均方误差降低了 21.7%。在每种方法进行的 79 次闭环试验中,它在所比较的系统中取得了最高的整体协调性和基座位移鲁棒性,同时任务完成率与最强基线相当。这些结果表明,具身感知的分解能够在移动视角下,以参数高效的方式支持联合视觉预测与全身控制。

## I 引言

一个既能*穿过*物理世界又能*作用于*物理世界的机器人,是具身人工智能研究的长期目标。近期的视觉-语言-动作(VLA)和世界-动作模型——Aloha\[1 (https://arxiv.org/html/2608.20114#bib.bib1)\]、RT-1/2\[26 (https://arxiv.org/html/2608.20114#bib.bib26), 2 (https://arxiv.org/html/2608.20114#bib.bib2)\]、OpenVLA\[3 (https://arxiv.org/html/2608.20114#bib.bib3)\]、PaLM-E\[27 (https://arxiv.org/html/2608.20114#bib.bib27)\]、SayCan\[28 (https://arxiv.org/html/2608.20114#bib.bib28)\]、π0\\pi\_\{0\}\[4 (https://arxiv.org/html/2608.20114#bib.bib4)\]、RDT-2\[5 (https://arxiv.org/html/2608.20114#bib.bib5)\]和 Motus——在固定基座的双手平台上取得了令人印象深刻的结果,这些平台的相机几何结构固定,动作空间仅限于手臂轨迹。腿式移动操作机器人改变了建模问题:相机搭载在移动基座上,策略必须协调高频的手臂运动与低频的基座速度指令。

参考图注 图 1:DECOWAM 架构、训练与部署。(A)一个冻结的 WAN 主干网络被增强为可训练的残差适配器、一个教师-学生未来瓶颈、分离的基座/手臂潜变量,以及基座速度自运动条件;ActionDiT 产生未来的 RGB 片段和一个 48 步、14 维的动作块。(B)部署时移除未来帧输入和特权教师路径,得到严格的因果 14 维动作推断。(C)分阶段训练首先将预训练的 FastWAM 与 ARMDOG 对齐,然后适配解耦模块以获得可部署的策略。#### 问题描述。

给定一个指令 $l\ell$,当前 RGB 观测 $x_0x\_\{0\}$,以及机器人状态 $s$,一个全身世界-动作模型预测未来的动作块 $\hat{\mathbf{a}}\_\{1:K\}\\hat\{\\mathbf\{a\}\}\_\{1:K\}$ 和未来的视频片段 $\hat{x}\_\{1:T\}\\hat\{x\}\_\{1:T\}$。在我们的设置中,$a_1:K\in RK×14\mathbf\{a\}\_\{1:K\}\\in\\mathbb\{R\}^\{K\\times 14\}$ 包含手臂关节、抓手状态、基座速度和负载器兼容的填充项。难点在于结构。首先,相机坐标系随腿式基座变化,因此图像表观运动混合了场景动态、手臂运动和自运动。其次,动作向量是多因素的:手臂/抓手通道和基座速度通道具有不同的语义和不同的控制时间尺度。第三,基座速度具有双重角色:它既是动作专家预测的目标,也是视频专家用于解释相机运动的观测。

#### 为什么腿式移动操作更困难?

这些特性使得腿臂建模不同于固定基座操作:

- •动态视角。机载相机随基座移动。手眼几何结构连续变化,图像流包含自运动和场景运动的混合。移动操作世界模型需要一条表示相机运动的路径,而不是将所有像素位移都视为场景动态。
- •多速率动作耦合。手臂关节轨迹需要高频率控制($\sim$∼15-30 Hz),而基座速度指令通常以较低频率发出($\sim$∼3-5 Hz)。将两者连接成一个统一采样的动作块,要求一种表示能同时覆盖导航尺度的速度和操作尺度的关节修正。
- •层次化意图。真实任务将*去哪里*与*如何行动*交织在一起。一个单一的整体潜变量难以同时表示导航尺度的决策和操作尺度的修正。

#### 我们的方法。

本文的核心思想是针对移动操作的解耦建模范式:一个世界-动作模型应该将*基座移动到哪里*、*手臂如何行动*以及*相机自运动如何改变未来的像素*表示为显式因素。我们在 FastWAM 的基础上实现了这一范式,FastWAM 是一个基于 Wan-2.2 的世界-动作主干网络,配有一个用于动作块的 ActionDiT 分支。动作等价的未来瓶颈提供了一个来自特权未来潜变量的、适中的因果训练信号。分阶段冻结适配通过在最终阶段保持基础 FastWAM 先验固定,仅学习残差机器人特定路径,将该方法转变为一个参数高效的系统。具有 GRL 的基座/手臂双潜变量是主要的动作分解机制,将导航尺度的基座指令与操作尺度的手臂命令分离。基座速度标记是用于视频分支的显式自运动接口:它将未来的视觉展开条件化在当前归一化的基座速度上,而不是要求视频分支仅从像素推断相机运动。

#### 数据集。

方法开发只是故事的一半。腿式移动操作需要数据在其中视觉变化、基座自运动、手臂运动和语言意图是同步的,而不是作为独立日志记录。因此,我们构建了 ARMDOG,一个带有 6 自由度手臂的四足平台的真实机器人数据资源。它的贡献在于具身完整的模型接口:每个转换后的片段对齐了 15 Hz 的 RGB 视频流、一个 $T\times 14T\{\\times\}14$ 的具有显式基座和手臂通道的全身状态/动作张量、自然语言指令文本和预计算的语言嵌入。当前转换的世界-动作快照包含来自 27 个任务文件夹的 217 个片段和 56,041 个同步帧。这种数据组织使得在一个回放协议内训练和评估基座/手臂分解、自运动感知的视频条件化以及全身世界-动作预测成为可能。

#### 贡献。

1. 1\.我们将腿式移动操作表述为一个解耦的世界-动作建模问题,其中基座控制、手臂操作和相机自运动通过显式、语义对齐的接口进入。
2. 2\.我们在 DECOWAM 中通过冻结残差适配、从特权未来潜变量进行因果蒸馏、对抗性基座/手臂分解以及基座速度条件化的视频预测实现了这一表述。
3. 3\.我们引入了同步的 ARMDOG 数据集,并通过受控回放和真实机器人实验评估了 DECOWAM,展示了参数高效的预测、改善的全身协调性和更强的扰动容忍度。

## II 相关工作

#### 用于固定基座机器人的视觉-语言-动作模型。

现代 VLA 模型——RT-1/2\[26 (https://arxiv.org/html/2608.20114#bib.bib26), 2 (https://arxiv.org/html/2608.20114#bib.bib2)\]、OpenVLA\[3 (https://arxiv.org/html/2608.20114#bib.bib3)\]、π0\\pi\_\{0\}\[4 (https://arxiv.org/html/2608.20114#bib.bib4)\]、Octo\[7 (https://arxiv.org/html/2608.20114#bib.bib7)\]、RDT-2\[5 (https://arxiv.org/html/2608.20114#bib.bib5)\]、X-VLA\[6 (https://arxiv.org/html/2608.20114#bib.bib6)\]、PaLM-E\[27 (https://arxiv.org/html/2608.20114#bib.bib27)\]、SayCan\[28 (https://arxiv.org/html/2608.20114#bib.bib28)\]、Gato\[29 (https://arxiv.org/html/2608.20114#bib.bib29)\]和 RoboCat\[30 (https://arxiv.org/html/2608.20114#bib.bib30)\]——通过在大型异构语料库上预训练的 Transformer 策略将语言和像素映射到机器人动作。任务条件化的操作策略,如 BC-Z、PerAct、VIMA 和 Diffusion Policy\[31 (https://arxiv.org/html/2608.20114#bib.bib31), 32 (https://arxiv.org/html/2608.20114#bib.bib32), 33 (https://arxiv.org/html/2608.20114#bib.bib33), 25 (https://arxiv.org/html/2608.20114#bib.bib25)\],提供了补充证据,表明语言、视觉标记和动作轨迹可以共享一个策略接口。这些模型提供了强大的动作策略参考,我们在回放实验中包含了适配的 π0\.5\\pi\_\{0\.5\} 和 X-VLA 运行。它们的标准动作头没有明确建模未来的 RGB 展开,或将基座引起的相机运动与手臂引起的场景变化分开。

#### 用于机器人控制的世界模型。

世界模型方法\[8 (https://arxiv.org/html/2608.20114#bib.bib8), 34 (https://arxiv.org/html/2608.20114#bib.bib34), 9 (https://arxiv.org/html/2608.20114#bib.bib9), 35 (https://arxiv.org/html/2608.20114#bib.bib35), 10 (https://arxiv.org/html/2608.20114#bib.bib10)\]生成未来的观测,并将其用作学习到的模拟器或策略的结构先验。视频扩散和交互式视频系统\[36 (https://arxiv.org/html/2608.20114#bib.bib36), 37 (https://arxiv.org/html/2608.20114#bib.bib37), 11 (https://arxiv.org/html/2608.20114#bib.bib11)\]进一步表明,未来的视觉预测可以作为一种强大的生成先验。近期基于视频的世界-动作模型,如 UniSim\[11 (https://arxiv.org/html/2608.20114#bib.bib11)\]、UVA\[12 (https://arxiv.org/html/2608.20114#bib.bib12)\]、X-WAM\[13 (https://arxiv.org/html/2608.20114#bib.bib13)\]、FastWAM 和 Motus 将视觉预测与动作建模相结合。我们的工作并不追求通用的模拟器扩展。它研究特定于具身的适配:如何在保持预训练视频先验有用的同时,在腿式操作数据集上分离自运动、基座动作、手臂动作和等价于未来的控制信息。

#### 移动与移动操作。

腿式移动已通过强化学习得到广泛研究\[15 (https://arxiv.org/html/2608.20114#bib.bib15), 16 (https://arxiv.org/html/2608.20114#bib.bib16)\],其控制器输出基座速度指令但不涉及操作。轮式和家庭移动操作系统\[17 (https://arxiv.org/html/2608.20114#bib.bib17), 18 (https://arxiv.org/html/2608.20114#bib.bib18), 19 (https://arxiv.org/html/2608.20114#bib.bib19), 23 (https://arxiv.org/html/2608.20114#bib.bib23), 38 (https://arxiv.org/html/2608.20114#bib.bib38), 39 (https://arxiv.org/html/2608.20114#bib.bib39)\]已经产生了分离导航和操作的级联策略。Mobile ALOHA\[40 (https://arxiv.org/html/2608.20114#bib.bib40)\]展示了全身遥操作对于双手移动操作的价值,但很少有工作学习统一策略,更少将这些策略基于预测视频模型。据我们所知,没有先前的工作在带机械手的腿式基座上执行统一的全身世界-动作建模。

#### 机器人数据集。

Open-X Embodiment\[20 (https://arxiv.org/html/2608.20114#bib.bib20)\]、DROID\[21 (https://arxiv.org/html/2608.20114#bib.bib21)\]、BridgeData V2\[41 (https://arxiv.org/html/2608.20114#bib.bib41)\]、RoboNet\[42 (https://arxiv.org/html/2608.20114#bib.bib42)\]、RLBench\[43 (https://arxiv.org/html/2608.20114#bib.bib43)\]、CALVIN\[44 (https://arxiv.org/html/2608.20114#bib.bib44)\]、Language Table\[45 (https://arxiv.org/html/2608.20114#bib.bib45)\]、ManiSkill2\[46 (https://arxiv.org/html/2608.20114#bib.bib46)\]、LIBERO\[47 (https://arxiv.org/html/2608.20114#bib.bib47)\]、RoboTwin\[22 (https://arxiv.org/html/2608.20114#bib.bib22)\]和基于 Aloha 的集合\[1 (https://arxiv.org/html/2608.20114#bib.bib1)\]为固定基座或轮式操作提供了广泛的覆盖,但它们没有提供我们模型所需的组合:在一个同步训练单元中同时包含腿式基座的自运动流、机械手动作、视觉观测和语言指令。ARMDOG 通过记录四足移动操作并将其转换为 FastWAM 类世界-动作模型所使用的视频-状态/动作-语言格式,填补了这一互补领域。

## III 背景:FastWAM 世界-动作主干网络

我们简要回顾 FastWAM 架构,我们的方法基于此构建。FastWAM 将 Wan-2.2 视频扩散主干网络\[14 (https://arxiv.org/html/2608.20114#bib.bib14)\]与一个 ActionDiT 分支耦合,该分支使用相同的连续流训练接口预测分块动作。在 ARMDOG 配置中,模型消耗当前 RGB 帧、预计算的语言上下文和 14 维的本体感知状态标记,然后联合生成未来的 RGB 帧和一个 48 步的全身动作块。此处评估的原始 FastWAM 检查点共有 6725.44M 参数,全微调期间有 6020.75M 可训练参数。

我们保留这种联合视频/动作分解,并增加四个机制,分别在参数空间、未来信息使用、动作因素和自运动条件化方面解耦适配问题。

## IV 方法

### IV-A 问题表述

令 $l\ell$ 表示语言指令,$x_0x\_\{0\}$ 表示当前 RGB 观测,$s_0\in R14s\_\{0\}\\in\\mathbb\{R\}^\{14\}$ 表示当前全身状态。我们学习条件联合模型

$p_\theta\!\\left(x_{1:T},\mathbf{a}_{1:K} \mid x_0, s_0, \ell\right), p\_\{\\theta\}\\\!\\left\(x\_\{1:T\},\\mathbf\{a\}\_\{1:K\}\\mid x\_\{0\},s\_\{0\},\\ell\\right\), (1)$

其中 $x_{1:T}x\_\{1:T\}$ 是未来视频,$a_{1:K}\in RK×14\mathbf\{a\}\_\{1:K\}\\in\\mathbb\{R\}^\{K\\times 14\}$ 是动作块。我们使用 $T=8T\{=\}8$ 和 $K=48K\{=\}48$。每个动作具有语义分解

$\mathbf{a}_k = [\mathbf{a}_k^\mathrm{arm}, a_k^\mathrm{grip}, \mathbf{a}_k^\mathrm{base}, \mathbf{a}_k^\mathrm{pad}], \quad \mathbf{a}_k^\mathrm{base} \in \mathbb{R}^3.$

$\mathbf\{a\}\_\{k\}=\\left\[\\mathbf\{a\}^\{\\mathrm\{arm\}\}\_\{k\},a^\{\\mathrm\{grip\}\}\_\{k\},\\mathbf\{a\}^\{\\mathrm\{base\}\}\_\{k\},\\mathbf\{a\}^\{\\mathrm\{pad\}\}\_\{k\}\\right\],\\qquad\\mathbf\{a\}^\{\\mathrm\{base\}\}\_\{k\}\\in\\mathbb\{R\}^\{3\}\. (2)$

手臂和抓手占据通道 $[0:7][0\{:\}7]$,基座速度占据 $[7:10][7\{:\}10]$,负载器填充占据 $[10:14][10\{:\}14]$。基座速度既是控制目标,也是相机自运动的来源。因此,DECOWAM 分离了手臂控制、基座控制和视觉自运动,而不是将它们编码在一个无差别的上下文中。

我们的主干网络是 FastWAM,它将 ActionDiT 动作专家与 WAN 视频专家配对。两个专家都接收语言和本体感知上下文。动作专家预测动作块上的流,而视频专家预测未来视觉潜变量上的流。DECOWAM 保留了这个联合接口,并改变了具身特定信息如何为每个专家提供条件。未来观测仅在训练期间监督模型,因此部署在 $(x_0, s_0, \ell)$ 上保持因果性。

### IV-B 分阶段参数

相似文章

世界行动模型:具身智能的下一个前沿

Hugging Face Daily Papers

本综述论文介绍了世界行动模型(World Action Models,WAMs),这是一种将预测性状态建模与行动生成相结合的具身智能统一框架。该文提供了现有方法的分类体系,分析了数据生态系统,并概述了这一新兴范式的评估协议。

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。