reward-model-free

标签

Cards List
#reward-model-free

SP3O:无需奖励建模的基于片段偏好的强化学习

arXiv cs.LG · 4天前 缓存

介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈