标签
文章指出真实机器人交互数据是VLA落地的关键瓶颈,模型架构趋同但数据获取难,少数公司拥有专有数据构成护城河,同时开源数据集如Open X-Embodiment、DROID等可供参考验证。
一篇综述论文,将机器人学习技术按照“冻结权重策略(VLA模型)”与“以代码形式自行编写可执行技能的智能体”这一轴线进行组织,提供了自我改进机制的分类法,并分析了新兴的机器人技能经济。
本文介绍了LingBot-VLA 2.0,它通过改进跨任务和具身形态的泛化能力、将动作空间扩展至全身自由度,并引入预测动力学建模以提升时间推理能力,从而增强了用于机器人技术的VLA基础模型。
提出WIZARD,一种权重空间元学习框架,它从语言指令和演示视频中为冻结的VLA策略生成任务特定的LoRA参数,从而实现无需微调的高效任务自适应。
介绍 StereoPolicy 框架,该框架利用同步立体图像对来提升机器人操作策略的几何推理能力,避免了 RGB-D 和点云的脆弱性。它可以集成到基于扩散和视觉-语言-行动的策略中,在仿真和现实任务中均展现出稳定的改进效果。
RoboSemanticBench 是一个基准测试,用于诊断视觉-语言-动作模型在动作预测中的语义基础,揭示机器人虽然能够抓取物体,但无法根据指令语义选择语义上正确的目标。
Hide-and-Seek是一个通过对比学习定位故障指示动作来检测VLA模型中机器人执行故障的框架,无需步骤级标注,实现了最先进的多任务故障检测性能。
NXP和Hugging Face展示了在嵌入式机器人平台上部署视觉-语言-动作(VLA)模型的技术,涵盖数据集录制最佳实践、VLA微调以及针对i.MX 95处理器的设备端优化,包括量化和异步推理调度。