基于后验混合贝叶斯信念的正则化离线策略优化
摘要
本文介绍了后验混合贝叶斯信念(PhyB),这是一个将贝叶斯强化学习中的期望重新表述为动力学模型的凸组合的框架,从而能够实现具有有界目标差异和最新性能的高效正则化离线策略优化。
arXiv:2606.00680v1 公告类型:新
摘要:离线强化学习旨在从预收集的数据集优化策略。该范式的一个瓶颈是管理认知不确定性,这种不确定性源于有限的数据覆盖(样本层面)以及从有限数据中识别转移动力学的模糊性(模型层面)。为了对这些不确定性进行统一量化,贝叶斯强化学习通过将动力学模型视为随机变量并维护相应的信念而被提出。尽管其理论吸引力,贝叶斯强化学习中的策略优化仍然计算上具有挑战性,因为它需要求解带有期望的复合目标。先前的方法要么采用搜索技术但计算可扩展性差,要么施加限制性的后验假设而牺牲贝叶斯强化学习的适应性。为了解决这些限制,我们提出了后验混合贝叶斯信念(PhyB),它将期望重新表述为动力学模型子集的凸组合。理论分析表明,这种近似引起的目标差异是有界的。基于PhyB,我们开发了一种迭代正则化策略优化算法,该算法提供了与度量无关的单调改进保证直至收敛。实验结果表明,PhyB在各种基准测试中达到了最先进的性能。
查看缓存全文
缓存时间: 2026/06/02 15:48
# 基于后验混合贝叶斯信念的正则化离线策略优化 来源:https://arxiv.org/abs/2606.00680 查看PDF(https://arxiv.org/pdf/2606.00680) > 摘要:离线强化学习旨在从预先收集的数据集中优化策略。该范式的一个瓶颈在于管理认知不确定性,这种不确定性源于有限的数据覆盖(样本层面)以及从有限数据中识别转移动态的模糊性(模型层面)。为了对这些不确定性进行统一量化,贝叶斯强化学习通过将动态模型视为随机变量并维护相应的信念而被提出。尽管在理论上具有吸引力,但贝叶斯强化学习中的策略优化在计算上仍然具有挑战性,因为它需要求解带有期望的复合目标。先前的方法要么采用计算可扩展性差的搜索技术,要么施加限制性的后验假设,从而牺牲了贝叶斯强化学习的适应性。为了解决这些局限性,我们提出了后验混合贝叶斯信念(PhyB),它将期望重新表述为动态模型子集上的凸组合。理论分析表明,由该近似引起的目标差异是有界的。基于PhyB,我们开发了一种迭代正则化策略优化算法,该算法为单调改进提供了与度量无关的保证,直到收敛。实验结果表明,PhyB在各种基准测试中均达到了最先进的性能。 ## 提交历史 来自:林鸿强 \[查看邮箱(https://arxiv.org/show-email/d0fd1c71/2606.00680)\] **\[v1\]**2026年5月30日星期六 11:35:26 UTC(3,720 KB)
相似文章
生成式OOD正则化的基于模型的策略优化
介绍 GORMPO,一种密度正则化的离线强化学习算法,使用生成式密度建模将策略更新限制在高密度区域,在真实世界医疗数据集上实现17%的提升,并超越最先进的基线模型。
面向风险感知AutoRL的高效异方差贝叶斯优化
提出ERAHBO,一种用于强化学习中风险感知超参数优化的高效异方差贝叶斯优化方法,通过自适应重采样相比固定预算方法提高了样本效率。
PBSD:用于长时域信用分配的特权贝叶斯自蒸馏
PBSD提出了一种贝叶斯自蒸馏方法,将稀疏的最终奖励转化为经过校准的回合级信用信号,用于长时域智能体任务,从而改进策略学习与泛化能力。
面向多目标强化学习的确定性帕累托最优策略综合
本文引入了一种基于切比雪夫标量化的新颖偏好条件贝尔曼算子,用于计算多目标马尔可夫决策过程中的确定性帕累托最优策略,并证明了该算子的收敛性及其在捕获完整帕累托前沿方面的有效性。
Bayesian-Agent:后验引导的LLM代理技能进化框架
Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。