MobileVLA-R1 2.0:强化学习增强的移动机器人控制推理

Hugging Face Daily Papers 论文

摘要

MobileVLA-R1 2.0是一个强化学习增强的视觉-语言-动作框架,将结构化推理与移动机器人控制相结合,在真实平台上的长期指令跟随方面取得了改进。

将自然语言指令转化为可靠且可执行的动作,对于移动机器人上的视觉-语言-动作(VLA)系统来说,仍然是一个基本挑战,这是由于高级语义推理与低级移动和操作控制之间持续存在的差距。现有方法通常依赖于隐式推理或整体动作预测,使得在生成精确且可适应的机器人动作时,难以保持连贯的长期决策。为了解决这一挑战,我们提出了MobileVLA-R1 2.0,一个强化学习增强的VLA框架,将结构化的具身推理与可执行的移动机器人控制显式耦合。该框架通过监督链式思维(CoT)对齐和强化学习,学习具身轨迹上的多粒度推理,提高了推理到动作的一致性,超越了纯粹的行为监督。为了支持移动和操作,我们进一步引入了一个推理条件动作解码器,将多模态推理表示映射到任务级动作目标,随后由机器人控制器转换为特定于具身的命令。这一设计提供了一个统一的感知-推理-动作接口,同时将高层动作生成与特定于机器人的执行解耦。我们在语言引导的导航、四足控制和人形移动操作方面进行了广泛评估,涵盖了VLN-CE、QUARD以及在Unitree Go2和G1机器人上的真实部署。MobileVLA-R1 2.0始终优于强大的VLA基线,在VLN-CE上的SR平均提高了1.6个百分点,并在真实世界G1移动操作任务的完整任务成功率上比MobileVLA-R1提高了10.0个百分点,同时展示了在不同机器人平台上稳健的长期指令跟随和闭环执行。
查看原文
查看缓存全文

缓存时间: 2026/09/15 02:39

论文页面 - MobileVLA-R1 2.0:增强移动机器人控制推理能力的强化学习方法

来源:https://huggingface.co/papers/2609.06251

摘要

MobileVLA-R1 2.0 通过思维链对齐与强化学习,将结构化推理与机器人控制相结合,从而提升移动机器人对长序列指令的遵循能力。

将自然语言指令转化为可靠且可执行的动作,是移动机器人领域中视觉-语言-动作(https://huggingface.co/papers?q=vision-language-action)系统所面临的一个根本性挑战,其根源在于高层语义推理与底层运动、操作控制之间存在持续性差距。现有方法通常依赖于隐式推理或整体式动作预测,难以在保持长序列决策连贯性的同时,生成精确且适应性强的机器人动作。为应对这一挑战,我们提出了 MobileVLA-R1 2.0——一个强化学习增强的 VLA 框架,它显式地将结构化的具身推理(https://huggingface.co/papers?q=embodied%20reasoning)与可执行的移动机器人控制(https://huggingface.co/papers?q=mobile%20robot%20control)相耦合。该框架通过监督式的思维链(https://huggingface.co/papers?q=Chain-of-Thought)对齐与强化学习(https://huggingface.co/papers?q=reinforcement%20learning),学习对具身轨迹进行多粒度推理,从而提升了超越纯行为监督的推理-动作一致性。为同时支持运动与操作,我们进一步引入了一个推理条件动作解码器(https://huggingface.co/papers?q=reasoning-conditioned%20action%20decoder),该解码器将多模态推理(https://huggingface.co/papers?q=multimodal%20reasoning)表征映射到任务级动作目标,随后由机器人控制器将其转换为特定于具体执行器的指令。这种设计提供了一个统一的感知-推理-动作接口,同时将高层动作生成与机器人特定的驱动执行解耦。我们在语言引导导航、四足机器人控制和人形机器人移动操作任务上进行了广泛评估,涵盖 VLN-CE、QUARD 数据集,以及 Unitree Go2 和 G1 机器人在真实世界的部署。MobileVLA-R1 2.0 在各项指标上持续优于强大的 VLA 基线模型:在 VLN-CE 上成功率平均提升 1.6 个百分点,在真实世界的 G1 移动操作任务上完全任务成功率较 MobileVLA-R1 提升了 10.0 个百分点,同时在不同机器人平台上展现出稳健的长序列指令遵循与闭环执行能力。

查看 arXiv 页面 (https://arxiv.org/abs/2609.06251) 查看 PDF (https://arxiv.org/pdf/2609.06251) 项目页面 (https://aigeeksgroup.github.io/MobileVLA-R1-2.0/) GitHub6 (https://github.com/AIGeeksGroup/MobileVLA-R1-2.0) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.06251)

通过您的代理获取本文:

hf papers read 2609.06251

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无关联模型

在模型的 README.md 中引用 arxiv.org/abs/2609.06251 以从本页面链接。

引用本文的数据集0

无关联数据集

在数据集的 README.md 中引用 arxiv.org/abs/2609.06251 以从本页面链接。

引用本文的 Space0

无关联 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2609.06251 以从本页面链接。

包含本文的收藏集0

无包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

从基础到应用:在实践中改进VLA模型

Papers with Code Trending

本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。