@songhan_mit:探索 VLASH:通过未来状态感知异步推理实现的实时 VLA

X AI KOLs Following 论文

摘要

MIT 研究人员开发了 VLASH,这是一种使视觉-语言-动作模型能够预测未来机器人状态的方法,在拾取放置和乒乓球等任务中速度加倍并减少延迟。

探索 VLASH:通过未来状态感知异步推理实现的实时 VLA https://t.co/ibrRWeZhWQ
查看原文
查看缓存全文

缓存时间: 2026/07/28 20:40

探索 VLASH:通过未来状态感知异步推理实现实时 VLA https://t.co/ibrRWeZhWQ


让机器人通过提前思考而更快行动

来源:https://news.mit.edu/2026/making-robots-faster-helping-them-think-ahead-0728 MIT 研究人员开发的一种新方法,能让机器人在行动的同时更好地预判下一步,从而实现更平滑的动作和更快的反应。

该技术能够使规划机器人动作的人工智能模型提前预测其未来的位置。模型利用这一预测,将当前动作无缝衔接到下一步动作。

许多现有方法会导致机器人停下来思考下一步该做什么,从而动作缓慢且卡顿。MIT 的方法通过基于机器人未来状态(而非当前位置)进行计算,帮助机器人运行得更快。

重要的是,该技术未给规划过程增加任何计算负担,并且可以应用于各种机器人硬件。

在执行拾取与放置等任务时,这种新方法将机器人速度提升了一倍,同时显著缩短了动作之间的延迟。它还能提升机械臂在高度动态活动(如打乒乓球和打地鼠)中的表现。

该系统对需要在挑战性现实环境中执行快速敏捷动作的机器人(如应急响应或搜救任务)尤为有用。它还能让机器人在从错误中恢复时反应更快。

“这项工作为高效、快速、加速且低成本的机器人应用奠定了良好基础。我们期待将工作扩展到最新的世界动作模型中,从而在持续推动物理 AI 加速发展的过程中获得更强能力。”MIT 电气工程与计算机科学系 (EECS) 副教授、电子研究实验室成员、该论文 (https://arxiv.org/pdf/2512.01031) 的第一作者 Song Han 表示。

该论文的共同第一作者包括 MIT EECS 研究生 Jiaming Tang、清华大学学生 Yufei Sun,以及来自英伟达、加州大学伯克利分校、加州大学圣迭戈分校和加州理工学院的其他人。该研究将在智能机器人与系统会议上展示。

预测未来

在最新机器人应用中,被称为视觉-语言-动作 (VLA) 模型的生成式 AI 系统充当机器人的大脑,规划其下一步动作并执行这些动作。

VLA 模型获取机器人摄像头的环境观察数据以及任务指令,输出接下来几个动作作为一组动作块,然后在机器人硬件上执行这些动作。

但 VLA 推理(模型在实时过程中处理视觉输入、推理任务并输出动作)计算量大,因此机器人在规划下一步动作时可能会出现明显停顿。这些停顿破坏了动作的流畅性,使其对环境变化的反应变慢。

“我们的动机是让思考过程与执行过程重叠,从而加快反应速度。”Tang 说。

MIT 研究人员开发了一种名为 VLASH 的新系统,使 VLA 能够预测机器人及其环境的未来状态。它利用这一信息在机器人完成当前动作块的同时规划下一组动作。

这解决了许多其他方法面临的一个主要障碍——它们使用机器人的当前状态来预测下一步动作。

“由于机器人移动后环境会改变,如果基于过时的当前环境观察进行规划,就会产生不一致,导致非常不稳定的控制。”Tang 解释道。

VLASH 通过研究人员的一个关键洞察避免了这种不一致。尽管模型不知道环境未来到底会是什么样子,但它知道机器人的当前位置以及它将如何移动以执行即将采取的动作。

该框架利用这些信息预测机器人完成当前动作块后的状态。它使用该估计值来规划下一步动作。

“这样,我们就让机器人意识到自己的未来状态。”Tang 说。

加速增强

单凭这一技术,就能通过消除动作块之间通常出现的延迟时间来加快机器人的动作,使反应速度提高 30 倍以上。

但为了让方法更快,MIT 研究人员生成了更粗略的动作块,让机器人执行几个沿相同轨迹的较大步骤。这种技术称为动作量化。

虽然动作量化会带来轻微精度下降,但它使机器人完成整个任务的速度提高了两到三倍。

然而,研究人员发现,在部署期间仅向 VLA 提供未来机器人状态信息不足以实现对机器人的精确稳定控制。

他们开发了一种训练增强方法,将训练数据进行分组,使 VLA 学会使用未来状态信息而不是当前观察。

通过重用部分训练数据,这种微调方法在没有任何额外计算负担的情况下将训练速度提高了五倍。

“即使后台有一个非常大的模型在工作,VLASH 也能让机器人非常快速地反应和执行动作,更像人类一样。这有助于使各种动态任务的机器人更加高效。”Tang 说。

与模拟中的基线方法相比,VLASH 在保持机器人操作精度的同时始终更快。该系统在真实硬件上的拾取与放置、堆叠和排序任务中也超过了这些方法。

例如,VLASH 在将立方体按颜色分拣放入盒子时速度是这些方法的两倍,同时达到了与最佳基线相同的 90% 准确率。该系统还能执行高度动态的任务,如打乒乓球和打地鼠。

未来,研究人员希望将 VLASH 与更强大的生成式 AI 系统(称为世界模型)结合,这些模型可以预测机器人的实际环境观察,从而提升性能并开辟新应用。

这项工作得到了 MIT-IBM 计算研究实验室、亚马逊、美国国家科学基金会和英伟达的部分支持。

相似文章

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。

InSight:通过可操控的VLA实现自主技能获取

Hugging Face Daily Papers

InSight提出了一种框架,用于在视觉-语言-动作(VLA)模型中实现自主技能获取。该框架通过在原始动作层面实现可操控性,并利用VLM引导的数据飞轮生成演示,从而在没有人类演示的情况下完成诸如翻转方块和倒水等操作任务。