td-target

标签

Cards List
#td-target

重访不确定性下Q学习中的TD目标聚合

arXiv cs.LG ↗ · 2026-08-05 缓存

本文提出SADQ,一种对Q学习的改进,利用动力学模型的一步轨迹预测来正则化TD目标聚合,减少自举引起的过估计,并在多个基准上提高训练稳定性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈