hindsight-relabeling

标签

Cards List
#hindsight-relabeling

Learning More from Less: 从后见之明中进行强化学习

arXiv cs.LG · 2026-07-13 缓存

介绍了Learning from Hindsight (LfH)方法,该方法将后见之明重标注应用于视觉-语言-动作模型的强化学习后训练。通过将失败的机器人轨迹重新标注为它们实际完成的任务,LfH在分布外操作任务上实现了5倍的样本效率提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈