标签
本文诊断了世界模型中的长时程失败,并将其归因于运动学而非动力学想象。作者引入了一个度量(iKCE),并表明即使策略奖励崩溃,想象展开也无法捕捉动态状态变化。
GPLD为DreamerV3引入了梯度惩罚潜在动力学正则化器,强制转换学习中的局部平滑性,提高了连续控制任务(尤其是复杂运动)的样本效率。