SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending 论文

摘要

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

在大规模多模态数据集上预训练的视觉-语言模型(VLM)编码了丰富的视觉和语言知识,使其成为机器人技术的坚实基础。不同于从头开始训练机器人策略,近期的方法将VLM适配为视觉-语言-动作(VLA)模型,实现基于自然语言的感知与控制。然而,现有VLA通常规模庞大——往往拥有数十亿参数——导致训练成本高昂且现实部署能力有限。此外,它们依赖学术和工业数据集,忽视了来自廉价机器人平台的社区收集数据日益增长的可获得性。在这项工作中,我们提出SmolVLA,一个小巧、高效且由社区驱动的VLA,大幅降低了训练和推理成本,同时保持有竞争力的性能。SmolVLA设计为可在单张GPU上训练,并部署在消费级GPU甚至CPU上。为了进一步提升响应速度,我们引入了异步推理栈,将感知和动作预测与动作执行解耦,通过分块动作生成实现更高的控制频率。尽管体积紧凑,SmolVLA达到了比其大10倍的VLA相当的性能。我们在模拟和真实机器人基准测试中评估了SmolVLA,并发布了所有代码、预训练模型和训练数据。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:42

论文页面 - SmolVLA:面向低成本高效机器人的视觉-语言-动作模型

来源:https://huggingface.co/papers/2506.01844

摘要

SmolVLA 是一个紧凑、高效的视觉-语言-动作模型,能够在降低计算成本的同时实现具有竞争力的性能,并可部署在消费级硬件上。

在大规模多模态数据集上预训练的视觉-语言模型 (https://huggingface.co/papers?q=Vision-language%20models) 编码了丰富的视觉和语言知识,为机器人技术提供了坚实基础。与其从头训练机器人策略 (https://huggingface.co/papers?q=robotic%20policies),近期的方法将 VLM 适配为视觉-语言-动作(VLA)模型,从而实现自然语言驱动的感知 (https://huggingface.co/papers?q=natural%20language-driven%20perception) 和控制。然而,现有的 VLA 模型通常规模庞大——往往拥有数十亿参数——导致训练成本高昂且实际部署受限。此外,它们依赖于学术和工业数据集,忽视了来自低成本机器人平台的社区收集数据日益增长的可用性。在这项工作中,我们提出了 SmolVLA,一个小型、高效且社区驱动的 VLA 模型,它大幅降低了训练和推理成本,同时保持了具有竞争力的性能。SmolVLA 被设计为可在单个 GPU 上训练,并部署在消费级 GPU 甚至 CPU 上。为了进一步提升响应速度,我们引入了一个异步推理 (https://huggingface.co/papers?q=asynchronous%20inference) 栈,将感知和动作预测与动作执行 (https://huggingface.co/papers?q=action%20execution) 解耦,从而通过分块动作生成实现更高的控制频率。尽管体积紧凑,SmolVLA 仍达到了与体积大 10 倍的 VLA 模型相当的性能。我们在模拟和真实世界的机器人基准上对 SmolVLA 进行了评估,并发布了所有代码、预训练模型和训练数据。

查看 arXiv 页面 (https://arxiv.org/abs/2506.01844)查看 PDF (https://arxiv.org/pdf/2506.01844)项目页面 (https://huggingface.co/blog/smolvla)GitHub26k (https://github.com/huggingface/lerobot)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2506.01844)

在您的 agent 中获取本文:

hf papers read 2506\.01844

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型 1,000+

lerobot/smolvla_base 机器人 • 0.5B • 更新于 1月22日 • 40.8k • 402 (https://huggingface.co/lerobot/smolvla_base)

HuggingFaceVLA/smolvla_libero 机器人 • 0.6B • 更新于 2025年9月17日 • 21.4k • 15 (https://huggingface.co/HuggingFaceVLA/smolvla_libero)

jadechoghari/smolvla_metaworld 机器人 • 0.6B • 更新于 2025年10月5日 • 180 • 4 (https://huggingface.co/jadechoghari/smolvla_metaworld)

ezzzeee/my_smolvla 机器人 • 0.5B • 更新于 2025年6月25日 • 4 • 3 (https://huggingface.co/ezzzeee/my_smolvla)

浏览引用该论文的 1,000+ 个模型 (https://huggingface.co/models?other=arxiv:2506.01844)

引用该论文的数据集 11

lerobot/community_dataset_v3 更新于约 18 小时前 • 4.83k • 3 (https://huggingface.co/datasets/lerobot/community_dataset_v3)

HuggingFaceVLA/community_dataset_v1 Viewer • 更新于 2025年11月13日 • 44.4k • 2.69k • 6 (https://huggingface.co/datasets/HuggingFaceVLA/community_dataset_v1)

HuggingFaceVLA/community_dataset_v2 Viewer • 更新于 2025年11月13日 • 200 • 2.69k • 4 (https://huggingface.co/datasets/HuggingFaceVLA/community_dataset_v2)

HuggingFaceVLA/community_dataset_v3 Viewer • 更新于 2025年12月10日 • 12.5k • 1.96k • 24 (https://huggingface.co/datasets/HuggingFaceVLA/community_dataset_v3)

浏览引用该论文的 11 个数据集 (https://huggingface.co/datasets?other=arxiv:2506.01844)

引用该论文的 Space 10

浏览引用该论文的 10 个 Space (https://huggingface.co/spaces?arxivIds=2506.01844)

包含该论文的收藏集 32

浏览包含该论文的 32 个收藏集 (https://huggingface.co/collections?paper=2506.01844)

相似文章

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

刚刚开源 FastVLA

Reddit r/LocalLLaMA

FastVLA,一款开源视觉-语言-动作模型,现可在 L4 GPU 上实现 5 Hz 机器人控制。