标签
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
AETDICE 提出了一种用于离线场景下非线性多目标强化学习的统一框架,通过密度比估计桥接了 SER 和 ESR 两种范式。