标签
DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。
小米发布了 XR-1,这是一个机器人基础模型,基于超过 10 万小时的真实世界操作轨迹进行训练。它基于 Qwen3-VL 和 Diffusion Transformer 构建,能够在未见过的环境中实现开箱即用的移动操作。
介绍了W2-VLA,一种用于精细机器人操作的视觉-语言-动作模型,该模型对任务条件下的未来手腕观测进行建模,在基准测试和真实世界任务中实现了改进的操作性能。
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
本文介绍了DRIFT,一种针对流匹配视觉-语言-动作模型(如pi0和pi0.5)的对抗性补丁攻击,表明先前的鲁棒性声明是虚幻的,并且仅攻击第一步去噪既更强又更便宜,能破坏LIBERO基准套件中几乎所有可解决的任务。
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
DeepMind 推出 Gemini Robotics 2,这是一组 AI 模型(VLA、ER、On-Device),使机器人能够进行全身控制、精细操作和多机器人协作,支持本地设备端执行,并能快速适应新的机器人本体。
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。
ReferTrack 提出了一种用于具身视觉追踪的“先指代后追踪”范式,在 EVT-Bench 上取得了单视角成功率高达 89.4% 的最先进性能,并在腿式机器人和人形机器人上展示了强大的仿真到现实迁移能力。
OpenBMB发布了MiniCPM-RobotTrack,这是一个基于MiniCPM4-0.5B构建的紧凑型视觉-语言-动作模型,用于自然语言条件的目标跟踪,在unitree Go2上实现5+ FPS,并采用质量驱动的自进化数据和高效的板载推理。
OpenBMB发布了MiniCPM-RobotManip,这是一个1.5B参数的视觉-语言-动作模型,用于设备端机器人操控,通过高效的流式推理和长时视觉记忆,性能超越较大模型。
JoyNexus提出了一种用于多租户VLA模型后训练的统一服务,将训练、推理和环境服务解耦,采用共享基础模型和租户专属插槽,通过分组批处理和调度提高效率。
本文介绍了UESF-Bench,一个面向统一具身人类搜索与跟随的大规模基准,并提出了SeekFollow-VLA,一个视觉-语言-动作框架,该框架处理语义引导的探索以及搜索与跟随之间的可靠行为切换。
小米推出小米机器人-1,这是一个基于超过10万小时真实世界操作轨迹训练的视觉-语言-动作基础模型,展现出清晰的规模化定律,并以极少的微调数据在真实世界任务中实现高成功率。
Papers with Code新推出的机器人学专属页面,汇集了主要基准评测、带代码链接的热门论文以及开源成果,并持续追踪LIBERO、SimplerEnv等基准的进展。
介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。
CLAP提出了一种方法,通过将自然语言动作描述前置到动作标记序列中,将预训练的视觉-语言模型(VLM)转换为视觉-语言-动作模型(VLA),无需改变架构即可保留语义能力。该方法在LIBERO上达到90.8%,并提升了鲁棒性。
本文介绍了机器人中心点云图,它将机器人坐标系中的3D场景坐标直接编码到图像像素中,以解决视觉-语言-动作模型中相机观测与机器人动作定义之间的坐标系不匹配问题。该方法在RoboCasa上提升了Pi0.5和SmolVLA的性能,并在真实机器人实验中更好地泛化到未见过的相机位置。