DyPES-VLA:面向跨具身操作的学习共享动力学先验与具身特定控制

Hugging Face Daily Papers 论文

摘要

DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。

视觉-语言-动作(VLA)模型已成为机器人操作的有力范式,但为异构机器人具身训练单一通用策略仍是一个开放问题。现有方法有两个主要局限。首先,它们未充分利用跨多样视觉和交互数据中共享的动力学先验,限制了跨具身迁移。其次,它们需要大量手动预处理,将具身特定的动作转换为统一格式。为了克服这些局限,我们提出了DyPES-VLA,一种学习共享动力学先验和具身特定控制的跨具身VLA。首先,我们通过在跨具身数据上以未来预测目标训练视觉-语言模型(VLM)来学习共享动力学先验,驱动共享查询表示捕获物体运动、接触以及交互引起的场景变化。其次,一个具身特定的混合专家(MoE)动作头直接将这些共享动力学先验转换为每个具身原生动作空间中的可执行控制,而无需手动将异构动作预先对齐为统一格式。该动作头共享注意力层以捕获常见的时序动作结构,同时其具身特定的前馈专家解决不同具身独特的运动学约束和控制语义。作为通用策略,我们的\ourmethod在仿真和真实世界评估中均取得了最先进的性能,在LIBERO上达到98.0%的成功率,在RoboCasa-GR1上达到59.25%,在RoboTwin~2.0上达到89.02%。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:56

论文页面 - DyPES-VLA:学习共享动力学先验与具身特定控制以实现跨具身操作

来源: https://huggingface.co/papers/2608.06374 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

视觉-语言-动作(VLA)模型已成为机器人操作中的强大范式,但为异构机器人具身训练单一通用策略仍然是一个悬而未决的问题。现有方法存在两个主要局限。首先,它们未能充分利用来自多样化视觉和交互数据中共享的动力学先验,限制了跨具身迁移。其次,它们需要大量手动预处理,将具身特定的动作转换为通用格式。为了克服这些局限,我们提出了DyPES-VLA,一种跨具身VLA,它学习共享的动力学先验和具身特定的控制。首先,我们通过在跨具身数据上使用未来预测目标训练视觉-语言模型(VLM)来学习共享的动力学先验,促使共享查询表示捕捉物体运动、接触以及交互引发的场景变化。其次,一个具身特定的混合专家(MoE)动作头将这些共享的动力学先验直接转换为每个具身原生动作空间中的可执行控制,无需手动将异构动作预先对齐为通用格式。该动作头共享注意力层以捕捉常见的时序动作结构,而其具身特定的前馈专家则解决不同具身独特的运动学约束和控制语义。作为一种通用策略,我们的方法在仿真和真实世界评估中均达到最先进水平,在LIBERO上达到98.0%的成功率,在RoboCasa-GR1上达到59.25%,在RoboTwin 2.0上达到89.02%。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06374) 查看 PDF (https://arxiv.org/pdf/2608.06374) 项目页面 (https://livfour.github.io/DyPES-VLA_RELEASE/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06374)

在您的智能体中获取此论文:

hf papers read 2608.06374

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型引用此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.06374,即可从本页链接到它。

引用此论文的数据集 0

没有数据集引用此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.06374,即可从本页链接到它。

引用此论文的 Space 0

没有 Space 引用此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.06374,即可从本页链接到它。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页链接到它。

相似文章

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。