标签
InterEvolve 引入了面向人形机器人移动操作的奖励程序测试时进化方法,利用物体感知的前向-行为(FB)基础模型以及在上下文中修订分阶段奖励程序的 LLM 智能体,来解锁未训练过的技能,并将进化后的行为自主部署在实体 Unitree G1 机器人上。
OTRetarget 提出一种统一方法,利用熵最优传输联合重定向机器人与多物体的运动,通过保持接触一致性显著优于 OmniRetarget,并在物理人形机器人 G1 上验证了迁移到强化学习训练的全身策略的可行性。
PRISM 是一个 real-to-sim-to-real(真实-仿真-真实)框架,通过视频到视频(V2V)生成将少量真实的人-物交互视频放大为数百个多样的反事实视频,随后重建物理上合理的动作,从而训练出可泛化的人形机器人行走-操作策略,并直接部署在真实机器人上,无需真实世界微调。
FetchMan是一个完全在模拟环境中训练的基于视觉的人形策略,能够零样本迁移到多样化的现实世界场景和对象,用于移动操作任务。
本文介绍了LUCID,一种用于长时域人形机器人移动操作的分层基于模型的强化学习框架。它学习可复用的潜在技能和宏动力学世界模型,通过想象展开实现高层规划,并提高模拟多物体重排任务中的成功率。
OASIS是一个仿真数据驱动的框架,用于人形机器人全身操控,它使用3D生成模型和分层视运动策略。通过利用仿真中的域随机化,它在零样本迁移上取得了比真实机器人训练更好的性能。
GRAIL利用3D资产和视频基础模型生成多样的人形机器人操作与移动数据,实现了有效的仿真到现实迁移,在真实世界中取得了高成功率。