preference-based-rl

标签

Cards List
#preference-based-rl

SP3O:无需奖励建模的基于片段偏好的强化学习

arXiv cs.LG · 2026-08-05 缓存

介绍SP3O,一种新颖的无需奖励模型、无需评论家的基于梯度的偏好强化学习算法,利用片段级偏好,在机器人控制和LLM微调中展现出改进的性能,尤其是在长时程任务中。

0 人收藏 0 人点赞
#preference-based-rl

LEMUR:从偏好反馈中学习与多目标强化学习对齐

arXiv cs.AI · 2026-08-03 缓存

本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。

0 人收藏 0 人点赞
#preference-based-rl

S2T-RLHF:面向稳定偏好型RLHF的分层信用分配

arXiv cs.AI · 2026-07-22 缓存

S2T-RLHF提出了一种句子到令牌的奖励分解框架,通过在句子粒度上分配序列级奖励,提高了偏好型RLHF的训练稳定性和鲁棒性,避免了过度细粒度的令牌级精化带来的不稳定性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈