multi-objective-rl

标签

Cards List
#multi-objective-rl

LEMUR:从偏好反馈中学习与多目标强化学习对齐

arXiv cs.AI · 2026-08-03 缓存

本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。

0 人收藏 0 人点赞
#multi-objective-rl

AETDICE:用于非线性多目标强化学习的统一框架与离线优化

arXiv cs.LG · 2026-07-01 缓存

AETDICE 提出了一种用于离线场景下非线性多目标强化学习的统一框架,通过密度比估计桥接了 SER 和 ESR 两种范式。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈