MobileVLA-R1 2.0:强化学习增强的移动机器人控制推理
摘要
MobileVLA-R1 2.0是一个强化学习增强的视觉-语言-动作框架,将结构化推理与移动机器人控制相结合,在真实平台上的长期指令跟随方面取得了改进。
查看缓存全文
缓存时间: 2026/09/15 02:39
论文页面 - MobileVLA-R1 2.0:增强移动机器人控制推理能力的强化学习方法
来源:https://huggingface.co/papers/2609.06251
摘要
MobileVLA-R1 2.0 通过思维链对齐与强化学习,将结构化推理与机器人控制相结合,从而提升移动机器人对长序列指令的遵循能力。
将自然语言指令转化为可靠且可执行的动作,是移动机器人领域中视觉-语言-动作(https://huggingface.co/papers?q=vision-language-action)系统所面临的一个根本性挑战,其根源在于高层语义推理与底层运动、操作控制之间存在持续性差距。现有方法通常依赖于隐式推理或整体式动作预测,难以在保持长序列决策连贯性的同时,生成精确且适应性强的机器人动作。为应对这一挑战,我们提出了 MobileVLA-R1 2.0——一个强化学习增强的 VLA 框架,它显式地将结构化的具身推理(https://huggingface.co/papers?q=embodied%20reasoning)与可执行的移动机器人控制(https://huggingface.co/papers?q=mobile%20robot%20control)相耦合。该框架通过监督式的思维链(https://huggingface.co/papers?q=Chain-of-Thought)对齐与强化学习(https://huggingface.co/papers?q=reinforcement%20learning),学习对具身轨迹进行多粒度推理,从而提升了超越纯行为监督的推理-动作一致性。为同时支持运动与操作,我们进一步引入了一个推理条件动作解码器(https://huggingface.co/papers?q=reasoning-conditioned%20action%20decoder),该解码器将多模态推理(https://huggingface.co/papers?q=multimodal%20reasoning)表征映射到任务级动作目标,随后由机器人控制器将其转换为特定于具体执行器的指令。这种设计提供了一个统一的感知-推理-动作接口,同时将高层动作生成与机器人特定的驱动执行解耦。我们在语言引导导航、四足机器人控制和人形机器人移动操作任务上进行了广泛评估,涵盖 VLN-CE、QUARD 数据集,以及 Unitree Go2 和 G1 机器人在真实世界的部署。MobileVLA-R1 2.0 在各项指标上持续优于强大的 VLA 基线模型:在 VLN-CE 上成功率平均提升 1.6 个百分点,在真实世界的 G1 移动操作任务上完全任务成功率较 MobileVLA-R1 提升了 10.0 个百分点,同时在不同机器人平台上展现出稳健的长序列指令遵循与闭环执行能力。
查看 arXiv 页面 (https://arxiv.org/abs/2609.06251) 查看 PDF (https://arxiv.org/pdf/2609.06251) 项目页面 (https://aigeeksgroup.github.io/MobileVLA-R1-2.0/) GitHub6 (https://github.com/AIGeeksGroup/MobileVLA-R1-2.0) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.06251)
通过您的代理获取本文:
hf papers read 2609.06251
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无关联模型
在模型的 README.md 中引用 arxiv.org/abs/2609.06251 以从本页面链接。
引用本文的数据集0
无关联数据集
在数据集的 README.md 中引用 arxiv.org/abs/2609.06251 以从本页面链接。
引用本文的 Space0
无关联 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2609.06251 以从本页面链接。
包含本文的收藏集0
无包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
从基础到应用:在实践中改进VLA模型
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
EVLA:用于物理基础驾驶推理与控制的电感知多模态助手
介绍了EVLA,这是一个通过实时感知电动动力总成状态来增强视觉-语言驾驶助手,从而实现能量最优和物理基础决策的框架。