TurboVLA:在RTX 4090上以32 Hz运行且显存占用小于1 GB的实时视觉-语言-动作模型
摘要
TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。
查看缓存全文
缓存时间: 2026/07/30 05:46
论文页面 - TurboVLA:在RTX 4090上以32 Hz频率运行、VRAM占用不足1 GB的实时视觉-语言-动作模型
来源:https://huggingface.co/papers/2607.27205
摘要
视觉-语言-动作(VLA)模型通常采用以LLM为中心的V到L到A路径,即先将视觉观测投射到大语言模型的表征空间,再解码为机器人动作。虽然这种方法有效,但每次策略调用都会带来巨大的计算和内存开销。在本工作中,我们提出TurboVLA,一种新的VLA范式,将传统的V到L到A路径重新构建为直接的V+L到A映射。TurboVLA不再将大语言模型作为感知与动作之间的核心接口,而是独立编码视觉观测和语言指令,通过轻量级的双向视觉-语言交互在两者之间直接交换信息,并使用紧凑解码器预测连续的动作块。这种简单的设计直接从视觉和语言特征中构建任务条件表征,大幅降低了VLA推理的计算和内存成本。在LIBERO上,TurboVLA参数量仅0.2B,推理延迟31.2 ms,推理VRAM占用0.9 GB(在消费级RTX 4090上),平均成功率97.7%,与规模大得多的VLA策略相当或更优。这些结果表明,TurboVLA是当前主流以LLM为中心的VLA范式的一种简单而有效的替代方案,为视觉、语言和动作的高效机器人操控连接提供了新的视角。代码已开源:https://github.com/H-EmbodVis/TurboVLA。
查看arXiv页面 (https://arxiv.org/abs/2607.27205)查看PDF (https://arxiv.org/pdf/2607.27205)项目页面 (https://h-embodvis.github.io/TurboVLA/)GitHub15 (https://github.com/H-EmbodVis/TurboVLA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27205)
在你的agent中获取此论文:
hf papers read 2607.27205
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2607.27205即可从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
在数据集README.md中引用arxiv.org/abs/2607.27205即可从此页面链接。
引用此论文的Space0
没有Space关联此论文
在Space README.md中引用arxiv.org/abs/2607.27205即可从此页面链接。
包含此论文的合集0
没有包含此论文的合集
将本论文添加到合集 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
刚刚开源 FastVLA
FastVLA,一款开源视觉-语言-动作模型,现可在 L4 GPU 上实现 5 Hz 机器人控制。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
@askalphaxiv: “实时视觉-语言-动作策略的强化学习” VLA 模型通常对实时机器人控制来说太慢...
本文介绍了一种方法,将视觉-语言-动作模型中的动作生成分离为慢层和快层,从而实现实时反应式机器人控制,并将成功率从42%提高到97%,仅需10分钟的在线数据。
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。