TANGO:基于全身视觉-语言-动作模型的人形机器人在杂乱环境中的导航

Hugging Face Daily Papers 论文

摘要

TANGO 是一个视觉-语言-动作框架,用于人形机器人在杂乱环境中导航,使用模拟训练数据,展示了最先进的性能和零样本真实世界部署。

我们研究用人形机器人导航杂乱室内环境的问题。与将导航建模为二维路径规划问题的传统方法不同,人形机器人在杂乱环境中的穿越需要持续的几何感知全身适应,包括协调手臂放置、躯干调整和步态调节,以实现无碰撞地通过复杂的三维空间。我们介绍了TANGO,这是第一个用于语言条件人形机器人穿越杂乱环境的全身视觉-语言导航框架。给定自然语言指令和自我中心RGB观察,TANGO直接预测29自由度关节空间动作,用于下游全身控制。我们完全在模拟中训练TANGO,通过全局路径规划、运动学全身运动生成、障碍物感知运动编辑和基于强化学习的跟踪来合成多样化的无碰撞穿越行为。这个流程为学习语言条件全身策略提供了动态可行的动作监督。在大量模拟实验中,TANGO在视觉-语言导航中展示了最先进的性能,同时在导航需要障碍物协商的挑战性场景中超越了强大的模块化基线。最后,我们在Unitree G1人形机器人上零样本部署TANGO,并观察到在杂乱真实世界场景中的鲁棒语言引导穿越,而无需在任何真实世界导航数据上进行训练。
查看原文
查看缓存全文

缓存时间: 2026/09/09 08:33

论文页面 - TANGO:基于全身视觉语言动作模型的人形机器人在杂乱环境中的导航

来源:https://huggingface.co/papers/2609.09158

摘要

TANGO是一个视觉语言框架,它通过仅使用模拟训练数据来预测人形机器人的全身关节动作,从而实现其在杂乱室内环境中的导航。

我们研究了使用人形机器人在杂乱室内环境中导航的问题。与将导航建模为二维路径规划问题的传统方法不同,人形机器人在杂乱环境中的穿越需要持续的几何感知全身适应,包括协调的手臂放置、躯干调整以及为在复杂的三维空间中实现无碰撞运动而进行的步态调节。我们引入了TANGO,这是第一个用于语言条件在杂乱环境中人形机器人穿越的全身视觉语言导航框架。给定自然语言指令和自我中心RGB观测,TANGO直接预测29自由度的关节空间动作,用于下游的全身控制。我们完全在仿真环境中训练TANGO,通过全局路径规划、运动学全身运动生成、障碍物感知的运动生成编辑以及基于强化学习的跟踪来合成多样化的无碰撞穿越行为。该流程为学习语言条件的全身策略提供了动态可行的动作监督。在大量的仿真实验中,TANGO在视觉语言导航中展示了最先进的性能,同时在需要穿越障碍物的挑战性场景导航中,超越了强大的模块化基线方法。最后,我们在Unitree G1人形机器人上零样本部署了TANGO,并观察到其在未经任何真实世界导航数据训练的情况下,能够在杂乱的真实世界场景中实现稳健的语言引导穿越。

查看arXiv页面 (https://arxiv.org/abs/2609.09158)查看PDF (https://arxiv.org/pdf/2609.09158)项目主页 (https://tango-vla.github.io/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.09158)

通过您的代理获取本文:

hf papers read 2609\.09158

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型的README.md中引用arxiv.org/abs/2609.09158以从本页面链接它。

引用本文的数据集 0

没有数据集链接本文

在数据集的README.md中引用arxiv.org/abs/2609.09158以从本页面链接它。

引用本文的空间 0

没有空间链接本文

在空间的README.md中引用arxiv.org/abs/2609.09158以从本页面链接它。

包含本文的收藏 0

没有收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接它。

相似文章

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。

HumanCLAW:视觉-语言模型能否通过身体行动?

Hugging Face Daily Papers

本文介绍HumanCLAW评估框架,该框架将动作决策与底层执行解耦,用以评估视觉-语言模型能否通过物理身体行动。在41个场景的1218个试验片段中测试了九种最先进的VLM,最佳模型成功率仅为16.8%,表明当前VLM缺乏具身自我意识。

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。