标签
H2R-Bench 是一个新的基准,用于评估视频世界模型将人类操作视频转换为以机器人为中心的演示的能力,跨六类操作行为和两种机器人形态测试具身约束与交互保真度。
Dyna-2 is a world-action model pre-trained on over a million hours of human video, showing scaling laws on human data and a human-to-robot transfer scaling law for zero-shot robot performance.
DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。
小米开源了Xiaomi-Robotics-1,这是一个在超过10万小时的UMI数据上预训练,并在1万小时以上的跨具身数据上后训练的具身AI基础模型。此次发布包含完整的真实机器人后训练与部署流程,旨在挑战Figure AI和Tesla的专有机器人模型。
小米宣布推出Robotics-1,这是一种采用VLA架构的新型机器人基础模型,基于超过10万小时的真实世界机器人数据进行训练,具备跨本体泛化和快速适应新任务的能力。
介绍Pegasus,一种低资源框架,利用基于图的任务表示、分层可供性潜在空间和闭环物理验证,将人类示范视频转换为机器人可执行数据,旨在将硬件数据收集转变为可规模化的知识迁移。
研究人员引入了统一手部动作空间(UHAS),这是一种表示方法,使得单一策略能够控制具有不同运动学结构和不同手指数量的机器手,从而推进了跨本体的灵巧操作。
介绍 ASPIRE,一个让机器人通过进化搜索和蒸馏不断进化技能库的框架,实现高效的 sim-to-real 和跨本体迁移,迁移学习 token 减少高达 10 倍。完整代码已开源。
Kairos是一个面向物理AI的原生世界模型框架,它通过跨具身数据课程从多样化的经验中学习,利用混合时序注意力维持持久状态,并支持在服务器和消费级硬件上高效部署。
本文介绍了一种检索增强的视觉-语言-动作策略,通过使用预训练模型和索引演示,消除了每个任务的微调,实现了高效的跨本体泛化和测试时的任务适应。
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。
OmniHumanoid是一个框架,通过分解运动迁移和实体特定自适应,利用非配对数据和分支隔离注意力减少干扰,实现可扩展的跨实体视频生成。