使用动作相关分解基线的策略梯度方差缩减

OpenAI Blog 论文

摘要

# 使用动作相关分解基线的策略梯度方差缩减 来源: [https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/](https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/) OpenAI## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。高方差问题特别

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:56

# 带有动作相关因子化基线的策略梯度的方差缩减 来源: https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/ OpenAI ## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。在长时间视界或高维动作空间的问题中,高方差问题尤为严重。为了缓解这个问题,我们推导了一个无偏的动作相关基线,用于方差缩减,它充分利用了随机策略本身的结构形式,不对马尔可夫决策过程(MDP)做任何额外假设。我们通过理论分析和数值结果演示并量化了动作相关基线的优势,包括对最优状态相关基线次优性的分析。结果是一个计算效率高的策略梯度算法,可扩展到高维控制问题,正如一个综合的2000维目标匹配任务所展示的那样。我们的实验结果表明,动作相关基线可以在标准强化学习基准测试以及高维手部操纵和综合任务上实现更快的学习。最后,我们证明了在基线中包含额外信息以改进方差缩减的一般想法可以扩展到部分可观测和多智能体任务。

相似文章

不要让收益FADE:解析强化学习中的策略梯度权重

arXiv cs.LG

本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。

BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计

arXiv cs.CL

BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。

进化策略梯度

OpenAI Blog

OpenAI 推出进化策略梯度(EPG),这是一种元学习方法,通过进化而非直接学习策略来学习损失函数,使强化学习代理能够通过利用类似人类技能迁移的先验经验,更好地跨任务泛化。

面向奖励引导扩散的分层变分策略

arXiv cs.LG

提出了面向奖励引导扩散的分层变分策略框架,在降低推理成本的同时实现高质量采样。在超分辨率等任务上展现了优异的质量-速度权衡。