面向多目标强化学习的确定性帕累托最优策略综合
摘要
本文引入了一种基于切比雪夫标量化的新颖偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明了该算子的收敛性及其在捕获完整帕累托前沿方面的有效性。
查看缓存全文
缓存时间: 2026/06/26 05:18
# 确定性帕累托最优策略合成用于多目标强化学习 来源:https://arxiv.org/abs/2606.26397 查看PDF(https://arxiv.org/pdf/2606.26397) > 摘要:现实世界中的决策常常需要平衡多个相互冲突的目标,而标准强化学习(RL)通常通过将奖励聚合为单一标量信号来处理这一挑战。虽然这种方法在简单任务中有效,但它往往无法捕捉最优权衡的完整集合,即帕累托前沿。在本文中,我们提出了一种新颖的偏好条件贝尔曼算子,其动机源于切比雪夫标量化,旨在为多目标马尔可夫决策过程(MOMDP)计算确定性帕累托最优策略。我们证明该算子满足一个包络性质,即估计的值函数对真实帕累托前沿给出上界,并证明它能单调收敛到该前沿的一个覆盖集。此外,我们还展示了如何从这些收敛的Q估计中提取确定性策略。这确保了智能体能够为任意给定的偏好恢复出一个策略,从而捕获整个帕累托最优前沿,同时保证每个合成的策略保持近似帕累托最优。实验结果验证了我们的算法能够成功恢复复杂的权衡,为确定性帕累托最优策略合成提供了一种解决方案。 ## 提交历史 来自:Aniruddha Joshi [查看邮件(https://arxiv.org/show-email/6ea3df43/2606.26397)] **[v1]** 2026年6月24日星期三 21:28:49 UTC(109 KB)
相似文章
面向运行时可调公交信号优先的偏好条件多目标强化学习
本文提出了一种偏好条件多目标强化学习控制器,用于公交信号优先,可在无需重新训练的情况下,在运行时调整公交优先与整体交通延误之间的权衡。实验表明,该控制器在维持可行性约束的同时,优于固定时间和基于规则的基线方法。
从正确性到偏好:个性化智能体强化学习框架
本文提出了一个统一的个性化智能体强化学习框架,将通用任务奖励与个性化偏好奖励解耦,引入了PARPO和PSGM用于偏好对齐的策略优化和技能检索。
LEMUR:从偏好反馈中学习与多目标强化学习对齐
本文介绍了LEMUR,一个结合多目标强化学习与基于偏好的多人类反馈学习的框架,无需预定义奖励函数即可学习帕累托最优策略。
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.
基于后验混合贝叶斯信念的正则化离线策略优化
本文介绍了后验混合贝叶斯信念(PhyB),这是一个将贝叶斯强化学习中的期望重新表述为动力学模型的凸组合的框架,从而能够实现具有有界目标差异和最新性能的高效正则化离线策略优化。