LUCID:基于想象动力学的潜在技能统一控制,用于长时域人形机器人移动操作

arXiv cs.LG 论文

摘要

本文介绍了LUCID,一种用于长时域人形机器人移动操作的分层基于模型的强化学习框架。它学习可复用的潜在技能和宏动力学世界模型,通过想象展开实现高层规划,并提高模拟多物体重排任务中的成功率。

arXiv:2608.07746v1 公告类型:新 摘要:长时域人形机器人移动操作需要组合多样的全身技能和可靠的高层决策。现有方法通常将预训练技能与脚本化规划器、有限状态机或特定任务的无模型策略相协调,限制了它们处理复杂任务序列的能力。为解决这一局限,我们提出了\textbf{LUCID},一种分层基于模型的强化学习框架,通过学习到的动力学模型的想象展开来规划可复用技能。LUCID首先通过对抗模仿训练结构化的潜在条件低层策略,然后冻结该策略,同时联合学习高层策略和宏动力学世界模型。该世界模型预测由潜在决策引起的时间扩展状态转移,从而通过想象展开实现高层策略优化。我们在多种模拟多物体重排场景中评估了我们的框架。实验结果表明,与先前的基线方法相比,LUCID提高了全任务成功率和部分完成率,证明了其在复杂顺序移动操作任务中的有效性。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:06

# 基于想象动力学的潜在技能统一控制用于长时程人形机器人移动操作
Source: https://arxiv.org/html/2608.07746

###### 摘要

长时程人形机器人移动操作需要组合多种全身技能和可靠的高层决策能力。现有方法通常将预训练技能与脚本化规划器、有限状态机或任务特定的无模型策略相协调,从而限制了它们处理复杂任务序列的能力。为克服这一局限,我们提出了 LUCID,一种基于模型的分层强化学习框架,它通过对学习到的动力学模型进行想象推演来规划可复用技能。LUCID 首先通过对抗模仿训练一个结构化的潜在条件化低层策略,然后将其冻结,同时联合学习高层策略和宏观动力学世界模型。该世界模型预测由潜在决策引起的时间扩展状态转移,从而使高层策略能够通过想象推演进行优化。我们在多种模拟多物体重排场景中评估了该框架。实验结果表明,与之前的基线方法相比,LUCID 提高了完整任务成功率和部分完成率,证明了其在复杂序列移动操作任务中的有效性。

## 引言

人形机器人能够执行单次的移动和操作行为,但在长时程序列中可靠地执行这些行为仍然是一个挑战(Guet al.2026 (https://arxiv.org/html/2608.07746#bib.bib1))。例如,在多物体重排任务中,人形机器人需要在连续回合内反复地在物体之间导航并操作它们。此类任务既需要多样的全身技能,也需要一个能够将它们向序列目标协调的高层策略。已有工作在基于物理的人形机器人控制方面取得了显著进展,通过对抗模仿和潜在技能学习,实现了自然的全身运动和可复用的运动行为(Penget al.2021 (https://arxiv.org/html/2608.07746#bib.bib5),2022 (https://arxiv.org/html/2608.07746#bib.bib2);Wenget al.2025 (https://arxiv.org/html/2608.07746#bib.bib22);Wanget al.2025a (https://arxiv.org/html/2608.07746#bib.bib19))。最近的人形机器人与场景交互方法进一步将这些运动控制扩展到更复杂环境中的导航和物体操作(Starkeet al.2019 (https://arxiv.org/html/2608.07746#bib.bib16);Hassanet al.2023 (https://arxiv.org/html/2608.07746#bib.bib10);Panet al.2024 (https://arxiv.org/html/2608.07746#bib.bib14);Xiaoet al.2024 (https://arxiv.org/html/2608.07746#bib.bib15))。这些工作共同将人形机器人控制从孤立的运动技能扩展到了具有场景感知的移动操作。

然而,在长任务序列上协调这些行为仍然困难。现有方法要么主要考虑用于孤立物体交互的专用控制器(Xuet al.2024 (https://arxiv.org/html/2608.07746#bib.bib6);Wanget al.2025b (https://arxiv.org/html/2608.07746#bib.bib20)),要么通过手工设计的机制来连接连续交互,例如固定的导航到操作状态机(Panet al.2025 (https://arxiv.org/html/2608.07746#bib.bib17)),或通过脚本化阶段交接进行逐物体参考跟踪(Xuet al.2025 (https://arxiv.org/html/2608.07746#bib.bib18))。尽管这类系统能有效处理单个交互,但它们的时间组织在很大程度上是预定义的,没有考虑中间决策如何影响后续子任务。分层强化学习通过将快速运动控制与在时间扩展技能上的较慢决策相分离来解决这一结构性问题(Suttonet al.1999 (https://arxiv.org/html/2608.07746#bib.bib23))。在基于物理的角色控制中,潜在技能方法已经产生了可控的运动表示和紧凑的分类先验,可用于下游任务(Tessleret al.2023 (https://arxiv.org/html/2608.07746#bib.bib12);Zhuet al.2023 (https://arxiv.org/html/2608.07746#bib.bib24))。高层策略也可以将预训练的人形运动原语有限的任务特定奖励设计相结合(Kuanget al.2025 (https://arxiv.org/html/2608.07746#bib.bib13))。然而,现有分层系统仍依赖于预定义的技能转换或通过直接环境交互训练的任务特定无模型高层策略。因此,它们能够选择可复用的行为,却无法预测一种技能如何改变后续交互的条件,这一局限在长时程多物体重排中变得越来越重要。

世界模型通过近似环境动力学并利用想象轨迹来改进决策,从而提供了这种预测能力(Ha and Schmidhuber2018 (https://arxiv.org/html/2608.07746#bib.bib21);Hafneret al.2020 (https://arxiv.org/html/2608.07746#bib.bib4))。世界模型已在多个控制领域展现出强大性能,并已被应用于机器人操作、导航和移动(Wuet al.2023 (https://arxiv.org/html/2608.07746#bib.bib28);Liet al.2025 (https://arxiv.org/html/2608.07746#bib.bib29))。然而,对于人形机器人交互而言,在扩展时域上预测每一个关节级转移是很困难的:高维、接触丰富的动力学需要许多自回归步骤,这会放大模型误差。分层结构为此提供了天然的时间抽象。模型不必重建完整的物理轨迹,而是可以预测每个时间扩展技能所引发的任务级变化。这把可复用的运动行为与预测性的高层推理联系起来,从而启发了一个学习技能级动力学并用其协调顺序人形交互的框架。

为此,我们提出了 LUCID,一个用于长时程技能组合的分层基于模型的强化学习框架,如图1 (https://arxiv.org/html/2608.07746#Sx2.F1) 所示。与依赖脚本化转换或任务特定无模型技能排序的人形分层控制器不同,LUCID 学习技能级动力学,并通过想象的宏观转移来优化目标条件下的高层策略。冻结的潜在条件化低层控制器通过一个结合离散技能锚点与连续变化的结构化接口提供可复用的全身技能。在宏观时间尺度上,高层策略选择潜在命令,而宏观动力学世界模型则预测这些命令对人形机器人、被操作物体和任务进展所产生的任务级后果,而非对每个关节级转移进行建模。通过该模型的想象推演使策略能够预判当前技能选择如何影响后续子任务,而真实的仿真器经验则持续改进模型。这种组合使 LUCID 无需脚本化交接即可协调完整的多物体重排序列。

总之,我们的贡献有三点。

- •我们提出了 LUCID,一种基于模型的分层强化学习框架,用于从想象动力学中进行任务规划。其世界模型预测潜在决策如何影响任务进展,使高层策略能够在想象中优化长时程行为。
- •我们通过对抗模仿和交互感知课程来训练低层控制器,并使用一个结构化潜在接口将全身运动原语暴露给高层策略。
- •我们在多种长时程多物体重排任务中评估了我们的方法,展示了完整序列成功率的提升,并通过消融实验验证了关键组件。

## 相关工作

参见图注 图1:LUCID 概述。LLC 使用对抗模仿和任务奖励进行训练,然后冻结。训练期间,潜在变量 z 由基于状态的 oracle 产生。HLC 与宏观动力学世界模型联合训练。重放缓冲区以真实转移初始化,并在每次更新时刷新。虚线表示分离(stop-gradient)的数据流。

### 基于物理的运动生成

基于物理的运动生成通过在仿真中训练控制器来产生动力学上可行的行为。DeepMimic 推广了用于角色动画的参考跟踪强化学习(Penget al.2018 (https://arxiv.org/html/2608.07746#bib.bib40)),而 AMP 则从非结构化演示中获取任务兼容的运动先验(Penget al.2021 (https://arxiv.org/html/2608.07746#bib.bib5))。在这些基础上,可复用和可引导的表示推动了更广泛的下游应用(Penget al.2022 (https://arxiv.org/html/2608.07746#bib.bib2);Tessleret al.2023 (https://arxiv.org/html/2608.07746#bib.bib12),2024 (https://arxiv.org/html/2608.07746#bib.bib41))。面向交互的研究进一步将范围扩展到物理场景接触、动态模仿和物体抓取(Hassanet al.2023 (https://arxiv.org/html/2608.07746#bib.bib10);Wanget al.2023 (https://arxiv.org/html/2608.07746#bib.bib42);Luoet al.2024 (https://arxiv.org/html/2608.07746#bib.bib43));通用重排(Xuet al.2024 (https://arxiv.org/html/2608.07746#bib.bib6));以及可扩展的多技能执行(Xuet al.2025 (https://arxiv.org/html/2608.07746#bib.bib18);Panet al.2025 (https://arxiv.org/html/2608.07746#bib.bib17))。最近的系统还将这些能力迁移到了真实人形机器人上(Wanget al.2025a (https://arxiv.org/html/2608.07746#bib.bib19);Liet al.2026 (https://arxiv.org/html/2608.07746#bib.bib30))。与这些方法不同,LUCID 使用在想象中训练的高层控制器来组织相位可控制的技能。

### 分层强化学习

分层强化学习将长时程控制分解为高层决策和低层技能(Suttonet al.1999 (https://arxiv.org/html/2608.07746#bib.bib23);Baconet al.2017 (https://arxiv.org/html/2608.07746#bib.bib31))。早期系统构建技能库并利用调度器来选择或组合控制器(Faloutsoset al.2001 (https://arxiv.org/html/2608.07746#bib.bib33);Heesset al.2016 (https://arxiv.org/html/2608.07746#bib.bib32))。后来的方法学习潜在技能空间,使高层策略能够引导这些技能来生成运动(Merelet al.2018 (https://arxiv.org/html/2608.07746#bib.bib35);Penget al.2019 (https://arxiv.org/html/2608.07746#bib.bib34);Hasencleveret al.2020 (https://arxiv.org/html/2608.07746#bib.bib36);Tessleret al.2023 (https://arxiv.org/html/2608.07746#bib.bib12))。这些抽象被扩展到有腿机器人的移动操作,通过技能排序和残差组合实现(Jiet al.2022 (https://arxiv.org/html/2608.07746#bib.bib37);Kumaret al.2023 (https://arxiv.org/html/2608.07746#bib.bib38))。最近的人形系统则使用分层世界模型规划运动参考,或混合目标条件下的技能(Hansenet al.2025 (https://arxiv.org/html/2608.07746#bib.bib39);Kuanget al.2025 (https://arxiv.org/html/2608.07746#bib.bib13))。LUCID 在冻结的结构化接口上学习离散相位决策,并通过想象的宏观动力学来优化多物体重排中的长时程技能排序。

### 用于机器人的世界模型

世界模型学习以动作条件为条件的动力学,用于通过想象轨迹进行规划和策略优化(Ha and Schmidhuber2018 (https://arxiv.org/html/2608.07746#bib.bib21))。PlaNet 引入了用于规划的潜在动力学(Hafneret al.2019 (https://arxiv.org/html/2608.07746#bib.bib25)),而 Dreamer 则从潜在想象中训练演员-评论家策略(Hafneret al.2020 (https://arxiv.org/html/2608.07746#bib.bib4),2025 (https://arxiv.org/html/2608.07746#bib.bib3))。TD-MPC 将学习到的表示与轨迹优化相结合(Hansenet al.2022 (https://arxiv.org/html/2608.07746#bib.bib27),2024 (https://arxiv.org/html/2608.07746#bib.bib26)),DayDreamer 则将基于想象的学习扩展到了物理机器人上(Wuet al.2023 (https://arxiv.org/html/2608.07746#bib.bib28))。更多最近的机器人特定模型强调预测可靠性。RWM 使用双自回归训练来降低复合误差,并在学习的神经仿真器中优化移动策略(Liet al.2025 (https://arxiv.org/html/2608.07746#bib.bib29))。HAIC 则从本体感觉中预测未观测到的物体动力学,以改善人形机器人-物体交互过程中的反馈控制(Liet al.2026 (https://arxiv.org/html/2608.07746#bib.bib30))。然而,这些方法主要对关节级动力学建模、提供状态估计或处理连续控制。LUCID 则对由结构化相位命令引发的技能级转移进行建模,并通过想象推演训练高层策略,从而在保持低层物理控制器不变的情况下实现长时程规划。

## 方法

图1 (https://arxiv.org/html/2608.07746#Sx2.F1) 展示了 LUCID,一个可扩展的长时程机器人-物体交互分层框架。训练分两个阶段进行。首先,我们参照 ASE(Penget al.2022 (https://arxiv.org/html/2608.07746#bib.bib2))通过对抗模仿训练一个可复用的潜在条件化低层控制器(LLC)。然后,我们冻结 LLC,并类似 DreamerV3(Hafneret al.2025 (https://arxiv.org/html/2608.07746#bib.bib3))联合训练宏观动力学世界模型(WM)和目标条件下的高层控制器(HLC)。WM 预测潜在决策的物理后果,使 HLC 能够从想象的宏观推演中学习,而真实的仿真器交互则持续为 WM 提供训练数据。

### 问题形式化

我们考虑一个必须在规定顺序下重排多个物体的模拟人形机器人。我们将任务形式化为目标条件下的马尔可夫决策过程(MDP)\(\langle\mathcal{S},\mathcal{A},\mathcal{T},\mathcal{R},\gamma,\mathcal{G}\rangle\)。在仿真步 \(t\),\(s_t\in\mathcal{S}\) 包含人形机器人和环境状态,\(a_t\in\mathcal{A}\) 表示关节级 PD 目标,\(\mathcal{T}\) 由物理仿真器诱导。回合目标 \(g=(g^1,\ldots,g^M)\in\mathcal{G}\) 指定了 \(M\) 个物体重排子目标的有序序列。目标是最大化 \(\mathbb{E}\left[\sum_{t=0}^{T-1}\gamma^t r_t\right]\),其中 \(r_t\) 奖励子目标完成和物理合理运动。

### 潜在技能原语

LLC \(\pi_L(a_t \mid s_t^L, z_t)\) 将低层状态 \(s_t^L\) 和技能潜在变量 \(z_t\) 映射到关节级动作。低层状态包含本体感觉、物体状态以及当前的任务引导变量;特别地,由 \(p_t^g\) 表示的有界引导偏移和航路点推进信息在 LLC 执行前被编码进 \(s_t^L\)。我们通过将对抗模仿奖励 \(r_t^D\) 与目标条件任务奖励 \(r_t^G\) 相结合来训练它,使其产生类人且具有交互感知的行为,同时仍能通过 \(z_t\) 进行控制:

\[
\max_{\pi_L}\;\mathbb{E}_{\tau\sim p(\tau\mid\pi_L,\psi)}\left[\sum_{t=0}^{T-1}\gamma^t\bigl(r_t^D+\lambda_G r_t^G\bigr)\right].
\]
(1)

其中,\(\tau=(s_0^L,z_0,a_0,s_1^L,\ldots)\) 是低层轨迹,\(\lambda_G\) 平衡任务进展与模仿,而 oracle \(\psi(s_t^L,g)\)

相似文章