SmolVLA:一种经济高效的视觉-语言-动作模型
摘要
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
查看缓存全文
缓存时间: 2026/07/20 09:42
论文页面 - SmolVLA:面向低成本高效机器人的视觉-语言-动作模型
来源:https://huggingface.co/papers/2506.01844
摘要
SmolVLA 是一个紧凑、高效的视觉-语言-动作模型,能够在降低计算成本的同时实现具有竞争力的性能,并可部署在消费级硬件上。
在大规模多模态数据集上预训练的视觉-语言模型 (https://huggingface.co/papers?q=Vision-language%20models) 编码了丰富的视觉和语言知识,为机器人技术提供了坚实基础。与其从头训练机器人策略 (https://huggingface.co/papers?q=robotic%20policies),近期的方法将 VLM 适配为视觉-语言-动作(VLA)模型,从而实现自然语言驱动的感知 (https://huggingface.co/papers?q=natural%20language-driven%20perception) 和控制。然而,现有的 VLA 模型通常规模庞大——往往拥有数十亿参数——导致训练成本高昂且实际部署受限。此外,它们依赖于学术和工业数据集,忽视了来自低成本机器人平台的社区收集数据日益增长的可用性。在这项工作中,我们提出了 SmolVLA,一个小型、高效且社区驱动的 VLA 模型,它大幅降低了训练和推理成本,同时保持了具有竞争力的性能。SmolVLA 被设计为可在单个 GPU 上训练,并部署在消费级 GPU 甚至 CPU 上。为了进一步提升响应速度,我们引入了一个异步推理 (https://huggingface.co/papers?q=asynchronous%20inference) 栈,将感知和动作预测与动作执行 (https://huggingface.co/papers?q=action%20execution) 解耦,从而通过分块动作生成实现更高的控制频率。尽管体积紧凑,SmolVLA 仍达到了与体积大 10 倍的 VLA 模型相当的性能。我们在模拟和真实世界的机器人基准上对 SmolVLA 进行了评估,并发布了所有代码、预训练模型和训练数据。
查看 arXiv 页面 (https://arxiv.org/abs/2506.01844)查看 PDF (https://arxiv.org/pdf/2506.01844)项目页面 (https://huggingface.co/blog/smolvla)GitHub26k (https://github.com/huggingface/lerobot)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2506.01844)
在您的 agent 中获取本文:
hf papers read 2506\.01844
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型 1,000+
lerobot/smolvla_base 机器人 • 0.5B • 更新于 1月22日 • 40.8k • 402 (https://huggingface.co/lerobot/smolvla_base)
HuggingFaceVLA/smolvla_libero 机器人 • 0.6B • 更新于 2025年9月17日 • 21.4k • 15 (https://huggingface.co/HuggingFaceVLA/smolvla_libero)
jadechoghari/smolvla_metaworld 机器人 • 0.6B • 更新于 2025年10月5日 • 180 • 4 (https://huggingface.co/jadechoghari/smolvla_metaworld)
ezzzeee/my_smolvla 机器人 • 0.5B • 更新于 2025年6月25日 • 4 • 3 (https://huggingface.co/ezzzeee/my_smolvla)
浏览引用该论文的 1,000+ 个模型 (https://huggingface.co/models?other=arxiv:2506.01844)
引用该论文的数据集 11
lerobot/community_dataset_v3 更新于约 18 小时前 • 4.83k • 3 (https://huggingface.co/datasets/lerobot/community_dataset_v3)
HuggingFaceVLA/community_dataset_v1 Viewer • 更新于 2025年11月13日 • 44.4k • 2.69k • 6 (https://huggingface.co/datasets/HuggingFaceVLA/community_dataset_v1)
HuggingFaceVLA/community_dataset_v2 Viewer • 更新于 2025年11月13日 • 200 • 2.69k • 4 (https://huggingface.co/datasets/HuggingFaceVLA/community_dataset_v2)
HuggingFaceVLA/community_dataset_v3 Viewer • 更新于 2025年12月10日 • 12.5k • 1.96k • 24 (https://huggingface.co/datasets/HuggingFaceVLA/community_dataset_v3)
浏览引用该论文的 11 个数据集 (https://huggingface.co/datasets?other=arxiv:2506.01844)
引用该论文的 Space 10
浏览引用该论文的 10 个 Space (https://huggingface.co/spaces?arxivIds=2506.01844)
包含该论文的收藏集 32
浏览包含该论文的 32 个收藏集 (https://huggingface.co/collections?paper=2506.01844)
相似文章
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
MotionVLA:用于人形机器人运动的视觉-语言-动作模型
提出MotionVLA,一种用于人形运动生成的视觉-语言-动作模型,采用双流频率分词器分别编码姿态和物理动态,实现了更高的多样性和一致性。
刚刚开源 FastVLA
FastVLA,一款开源视觉-语言-动作模型,现可在 L4 GPU 上实现 5 Hz 机器人控制。