标签
本文介绍了强化规划,一种利用潜世界模型学习改进多步骤规划的方法,在视觉导航和机器人操作等任务中取得了近乎完美的成功率,并且效率显著高于手工设计的算法。
本文引入了决策指标对齐诊断和动作条件目标,以改进用于模型预测控制的潜在世界模型。提出的DA-LeWM方法提高了规划任务的收敛速度和成功率。
本文探讨了潜在世界模型为何在长时程规划中失败,发现瓶颈在于规划目标(潜在距离的平方)而非预测器的准确性;用学得的代价函数替换该目标可显著提升规划性能。
本文通过提出离线诊断方法来解决基于模型的强化学习中的目标失配问题,以预测潜在世界模型的闭环性能。在LunarLander-v3上,奖励可观性分数(ROF)和复合分数(CROF)能够选择出生成强大MPC和基于模型的强化学习策略的检查点,同时大幅减少与真实环境的交互次数。