Hy-Embodied-0.5-VLA: 从视觉-语言-动作模型到真实世界机器人学习栈

Hugging Face Daily Papers 论文

摘要

HyVLA-0.5 是一个端到端机器人学习系统,整合了数据收集、模型设计、预训练、微调和强化学习,用于真实世界部署。

在本报告中,我们介绍 Hy-Embodied-0.5-VLA(简称 HyVLA-0.5),这是一个覆盖完整机器人学习栈的端到端系统:数据收集、模型设计、持续预训练和有监督微调、RL 后训练以及真实世界部署。每个组件在该栈中都扮演着独特的角色。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:04

论文页面 - Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实世界机器人学习栈

来源:https://huggingface.co/papers/2606.14409 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

HyVLA-0.5 是一个端到端的机器人学习系统,集成了数据采集、模型设计、预训练、微调以及强化学习,用于真实世界的部署。

在本报告中,我们介绍 Hy-Embodied-0.5-VLA(简称 HyVLA-0.5),这是一个完整的端到端系统(https://huggingface.co/papers?q=end-to-end%20system),覆盖了机器人学习栈(https://huggingface.co/papers?q=robot%20learning%20stack)的各个环节:数据采集(https://huggingface.co/papers?q=data%20collection)、模型设计(https://huggingface.co/papers?q=model%20design)、持续预训练(https://huggingface.co/papers?q=continued%20pre-training)与监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)、强化学习后训练(https://huggingface.co/papers?q=RL%20post-training),以及真实世界部署(https://huggingface.co/papers?q=real-world%20deployment)。该栈中的每一个组件都发挥着独特的作用。

查看 arXiv 页面(https://arxiv.org/abs/2606.14409)查看 PDF(https://arxiv.org/pdf/2606.14409)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2606.14409)

在你的智能体中获取此论文:

hf papers read 2606\.14409

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型2

tencent/Hy-Embodied-0.5-VLA-UMI 机器人学• 5B• 更新于约6小时前 • 9 • 2(https://huggingface.co/tencent/Hy-Embodied-0.5-VLA-UMI)

tencent/Hy-Embodied-0.5-VLA-RoboTwin 机器人学• 5B• 更新于约5小时前 • 1 • 2(https://huggingface.co/tencent/Hy-Embodied-0.5-VLA-RoboTwin)

引用本文的数据集1

tencent/Hy-Embodied-0.5-VLA-Data 更新于约6小时前 • 43 • 2(https://huggingface.co/datasets/tencent/Hy-Embodied-0.5-VLA-Data)

引用本文的Space0

没有 Space 链接到此论文

请在 Space 的 README.md 中引用 arxiv.org/abs/2606.14409,以在此页面建立链接。

包含本文的合集0

没有合集包含此论文

将这篇论文添加到一个合集(https://huggingface.co/new-collection)中,以便在此页面建立链接。

相似文章

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。