标签
本文提出了一种预测性深度强化学习公式,通过将未来参考视界加入状态空间,实现轨迹跟踪的预期控制。仿真结果显示误差显著降低,但零样本迁移到物理硬件时暴露了仿真与现实的差距。
本文提出了一种两阶段学习流水线,使用注意力增强的门控循环网络从机载运动学中估计风速,然后利用该估计值在强化学习控制器中提升四旋翼在湍流风下的轨迹跟踪性能,相比基线将跟踪误差降低了48%。