TurboVLA:在RTX 4090上以32 Hz运行且显存占用小于1 GB的实时视觉-语言-动作模型

Hugging Face Daily Papers 论文

摘要

TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。

视觉-语言-动作(VLA)模型通常采用以LLM为中心的V→L→A路径,即将视觉观测投影到大语言模型的表示空间,然后再解码为机器人动作。虽然有效,但这种设计在每次策略调用时都会产生大量的计算和内存开销。在这项工作中,我们提出了TurboVLA,这是一种新的VLA范式,将传统的V→L→A路径重构为直接的V+L→A映射。TurboVLA不再使用大语言模型作为感知和动作之间的中央接口,而是独立编码视觉观测和语言指令,通过轻量级的双向视觉-语言交互直接在它们之间交换信息,并使用紧凑的解码器预测连续动作块。这种简单的设计直接从视觉和语言特征构建任务条件表示,显著降低了VLA推理的计算和内存成本。在LIBERO上,TurboVLA在消费级RTX 4090上仅用0.2B参数、31.2 ms推理延迟和0.9 GB推理显存就实现了97.7%的平均成功率,匹配或超越了规模大得多的VLA策略。这些结果确立了TurboVLA作为当前流行的以LLM为中心的VLA范式的一种简单而有效的替代方案,为如何连接视觉、语言和动作以实现高效的机器人操作提供了新的视角。代码可在 https://github.com/H-EmbodVis/TurboVLA 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/30 05:46

论文页面 - TurboVLA:在RTX 4090上以32 Hz频率运行、VRAM占用不足1 GB的实时视觉-语言-动作模型

来源:https://huggingface.co/papers/2607.27205

摘要

视觉-语言-动作(VLA)模型通常采用以LLM为中心的V到L到A路径,即先将视觉观测投射到大语言模型的表征空间,再解码为机器人动作。虽然这种方法有效,但每次策略调用都会带来巨大的计算和内存开销。在本工作中,我们提出TurboVLA,一种新的VLA范式,将传统的V到L到A路径重新构建为直接的V+L到A映射。TurboVLA不再将大语言模型作为感知与动作之间的核心接口,而是独立编码视觉观测和语言指令,通过轻量级的双向视觉-语言交互在两者之间直接交换信息,并使用紧凑解码器预测连续的动作块。这种简单的设计直接从视觉和语言特征中构建任务条件表征,大幅降低了VLA推理的计算和内存成本。在LIBERO上,TurboVLA参数量仅0.2B,推理延迟31.2 ms,推理VRAM占用0.9 GB(在消费级RTX 4090上),平均成功率97.7%,与规模大得多的VLA策略相当或更优。这些结果表明,TurboVLA是当前主流以LLM为中心的VLA范式的一种简单而有效的替代方案,为视觉、语言和动作的高效机器人操控连接提供了新的视角。代码已开源:https://github.com/H-EmbodVis/TurboVLA。

查看arXiv页面 (https://arxiv.org/abs/2607.27205)查看PDF (https://arxiv.org/pdf/2607.27205)项目页面 (https://h-embodvis.github.io/TurboVLA/)GitHub15 (https://github.com/H-EmbodVis/TurboVLA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.27205)

在你的agent中获取此论文:

hf papers read 2607.27205

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2607.27205即可从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2607.27205即可从此页面链接。

引用此论文的Space0

没有Space关联此论文

在Space README.md中引用arxiv.org/abs/2607.27205即可从此页面链接。

包含此论文的合集0

没有包含此论文的合集

将本论文添加到合集 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

刚刚开源 FastVLA

Reddit r/LocalLLaMA

FastVLA,一款开源视觉-语言-动作模型,现可在 L4 GPU 上实现 5 Hz 机器人控制。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

TBD-VLA: 时序块扩散视觉语言动作模型

Hugging Face Daily Papers

TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。