使用动作相关分解基线的策略梯度方差缩减
摘要
# 使用动作相关分解基线的策略梯度方差缩减 来源: [https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/](https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/) OpenAI## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。高方差问题特别
查看缓存全文
缓存时间: 2026/04/20 14:56
相似文章
面向低方差在线策略评估的鲁棒数据收集策略学习
本文提出了一种鲁棒的基于梯度的算法,用于学习行为策略,以降低在线强化学习策略评估中的方差,通过理论保证和数值验证来处理转移函数中的不确定性。
不要让收益FADE:解析强化学习中的策略梯度权重
本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
@msjgriffiths: 哦,真有意思。过去一年我一直有个疑问:GRPO(一种简单的方法)应该与斯坦因悖论有关……
本文提出了基于可验证奖励的收缩基线方法,用于强化学习领域,以此降低策略梯度估计器的方差并提升训练稳定性。
BiPACE: 面向LLM智能体的双模拟引导策略优化与动作反事实估计
BiPACE提出了一种即插即用的优势估计器,用于修复LLM智能体逐步分组强化学习中的状态-动作信用分配错配问题。该方法利用双模拟引导的状态聚类和动作反事实估计,在ALFWorld、WebShop和TextCraft基准上,配合Qwen2.5模型实现了显著的性能提升。