标签
MobileVLA-R1 2.0是一个强化学习增强的视觉-语言-动作框架,将结构化推理与移动机器人控制相结合,在真实平台上的长期指令跟随方面取得了改进。
一项针对9个视觉语言模型的专家机械师刹车维修考试评估显示,它们懂得理论,但在实际部署中自主发现问题和适应调整方面表现不佳。
Google DeepMind 发布了 Gemini Robotics 2,这是一种能控制整个类人机器人做出全身动作、提升灵活度的 AI 模型。同时,该更新还引入了具身推理能力、端侧模型,以支持多机器人协同与安全保障。
DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。
SleepWalk 是一个三层基准,用于评估视觉语言模型从文本指令和视觉观察中预测3D环境中空间连贯轨迹的能力,揭示了在遮挡和多步指令下接地空间推理的系统性失败。