@_akhaliq: CHORUS 去中心化多形态协作与单一VLA策略
摘要
CHORUS是一种去中心化方法,使不同形态的多个机器人能够使用单一的视觉-语言-动作策略进行协作。
CHORUS
去中心化多形态协作与单一VLA策略 https://t.co/QIyWXsMdiL
查看缓存全文
缓存时间: 2026/06/12 15:01
CHORUS
去中心化的多形态协作,采用单一VLA策略 https://t.co/QIyWXsMdiL
相似文章
MA-VLA:面向协作与组合泛化的多臂视觉-语言-动作模型
MA-VLA 是一个用于多臂机器人协作的统一框架,它将协作行为分解为原子提示,并在训练时进行排列(Arm Shuffle)以实现对未见协调模式的泛化。
Qwen-VLA:统一跨任务、环境与机器人具身形态的视觉-语言-动作建模
Qwen-VLA是一个面向具身决策的统一视觉-语言-动作模型,整合了不同机器人平台上的操作、导航与轨迹预测。它采用基于DiT的动作解码器和具身感知提示条件,实现了强性能与分布外泛化。
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。
BridgeVLA++:面向三维操作的数据高效、可泛化且记忆增强的视觉-语言-动作框架
BridgeVLA++ 是一个用于三维机器人操作的记忆增强视觉-语言-动作框架,它在 BridgeVLA 的基础上增加了时空记忆,在记忆依赖的操作基准上取得了最先进的成果,同时保持了数据效率和泛化能力。
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。