open-loop

标签

Cards List
#open-loop

PIRL:从开环探索到闭环强化学习 [R]

Reddit r/MachineLearning · 4天前

介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈