self-predictive-learning

标签

Cards List
#self-predictive-learning

R2R2: 通过自预测学习中的冗余减少实现鲁棒表示,用于密集经验重用

arXiv cs.LG · 2026-05-15 缓存

提出R2R2,一种用于强化学习中自预测学习的正则化方法,以缓解高更新-数据比下的过拟合,在连续控制任务上取得了显著改进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈