DyPES-VLA:面向跨具身操作的学习共享动力学先验与具身特定控制
摘要
DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/07 05:56
论文页面 - DyPES-VLA:学习共享动力学先验与具身特定控制以实现跨具身操作
来源: https://huggingface.co/papers/2608.06374 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
视觉-语言-动作(VLA)模型已成为机器人操作中的强大范式,但为异构机器人具身训练单一通用策略仍然是一个悬而未决的问题。现有方法存在两个主要局限。首先,它们未能充分利用来自多样化视觉和交互数据中共享的动力学先验,限制了跨具身迁移。其次,它们需要大量手动预处理,将具身特定的动作转换为通用格式。为了克服这些局限,我们提出了DyPES-VLA,一种跨具身VLA,它学习共享的动力学先验和具身特定的控制。首先,我们通过在跨具身数据上使用未来预测目标训练视觉-语言模型(VLM)来学习共享的动力学先验,促使共享查询表示捕捉物体运动、接触以及交互引发的场景变化。其次,一个具身特定的混合专家(MoE)动作头将这些共享的动力学先验直接转换为每个具身原生动作空间中的可执行控制,无需手动将异构动作预先对齐为通用格式。该动作头共享注意力层以捕捉常见的时序动作结构,而其具身特定的前馈专家则解决不同具身独特的运动学约束和控制语义。作为一种通用策略,我们的方法在仿真和真实世界评估中均达到最先进水平,在LIBERO上达到98.0%的成功率,在RoboCasa-GR1上达到59.25%,在RoboTwin 2.0上达到89.02%。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06374) 查看 PDF (https://arxiv.org/pdf/2608.06374) 项目页面 (https://livfour.github.io/DyPES-VLA_RELEASE/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06374)
在您的智能体中获取此论文:
hf papers read 2608.06374
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型引用此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.06374,即可从本页链接到它。
引用此论文的数据集 0
没有数据集引用此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.06374,即可从本页链接到它。
引用此论文的 Space 0
没有 Space 引用此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.06374,即可从本页链接到它。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从本页链接到它。
相似文章
Hy-Embodied-0.5-VLA: 从视觉-语言-动作模型到真实世界机器人学习栈
HyVLA-0.5 是一个端到端机器人学习系统,整合了数据收集、模型设计、预训练、微调和强化学习,用于真实世界部署。
Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。
HiVLA: 一种以视觉接地为中心的分层具身操作系统
HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
面向机器人操作的视觉-语言-动作模型中的双潜在记忆
LaMem-VLA提出了一种原生于潜在记忆的框架,将短期和长期历史经验直接整合到视觉-语言-动作推理中,从而在长周期机器人操作任务上实现更优性能。