标签
本文介绍了一种方法,从离线轨迹中提取拓扑必要条件作为机制不变的子目标,从而实现目标条件强化学习中的跨具身转移,并在基准任务上取得了经验性改进。
本文介绍了LUCID,一种用于长时域人形机器人移动操作的分层基于模型的强化学习框架。它学习可复用的潜在技能和宏动力学世界模型,通过想象展开实现高层规划,并提高模拟多物体重排任务中的成功率。