policy-gradient

标签

Cards List
#policy-gradient

Boundary-Seeking Policy Gradient for Safe Reinforcement Learning

arXiv cs.LG · 昨天 缓存

Introduces Boundary-Seeking Policy Gradient (BSPG), a first-order method for safe reinforcement learning that actively drives the policy toward the constraint boundary, with convergence guarantees and improved reward/boundary tracking on a Safety-Gymnasium task.

0 人收藏 0 人点赞
#policy-gradient

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

arXiv cs.LG · 2026-08-04 缓存

This paper proves that using error-penalized scoring rules with abstention as a discrete action can kill both the reward gradient and the KL anchor, causing models to collapse toward refusing everything. It proposes a structural repair — training a mandatory confidence report — and validates the mechanism with simulations and language model experiments.

0 人收藏 0 人点赞
#policy-gradient

策略梯度引导:来自行为目标的干预

arXiv cs.LG · 2026-07-31 缓存

介绍了策略梯度引导(PGS),一种将激活引导形式化为强化学习问题的方法,利用策略梯度从行为目标中构建可移除、可组合的引导向量。在网格世界、国际象棋谜题和足球环境中进行了验证。

0 人收藏 0 人点赞
#policy-gradient

从结果到行动:利用事后视角进行长周期语言智能体训练

arXiv cs.LG · 2026-07-21 缓存

介绍Hindsight Policy Optimization (HPO),一种新颖的策略梯度方法,它利用意图空间和Wasserstein距离来减少长周期语言智能体训练中的方差,显示出比GRPO和PPO更好的稳定性。

0 人收藏 0 人点赞
#policy-gradient

安全探索者:一种针对带有恢复干预的强化学习的无偏策略梯度

arXiv cs.LG · 2026-07-13 缓存

安全探索者(SafeExplorer)引入了一种用于带有恢复干预的强化学习的无偏策略梯度估计器,在机器人任务上显著减少了训练期间的跌倒次数,同时达到或超过了标准PPO的最终奖励。

0 人收藏 0 人点赞
#policy-gradient

用于LLM强化学习的预测性散度掩码

Hugging Face Daily Papers · 2026-07-12 缓存

提出用于LLM强化学习的预测性散度掩码,通过预测下一步策略梯度步骤将增加还是减少信任区域所使用的散度,改进了PPO的方向准则,从而带来更好的对齐,并提升了不同模型规模下的强化学习训练效果。

0 人收藏 0 人点赞
#policy-gradient

不要让收益FADE:解析强化学习中的策略梯度权重

arXiv cs.LG · 2026-07-03 缓存

本文介绍了FADE(Focal Advantage with Dynamic Entropy),一种自适应优势函数,能在大型语言模型的强化学习后训练过程中动态调度梯度权重,与静态基线相比,实现了更快的收敛和更好的准确率-多样性平衡。

0 人收藏 0 人点赞
#policy-gradient

EMAgnet:大型游戏中策略梯度自我博弈的参数空间EMA正则化

arXiv cs.LG · 2026-06-24 缓存

EMAgnet针对大型两人零和游戏中的策略梯度自我博弈引入了参数空间指数移动平均正则化,与均匀正则化目标相比,实现了更低的可利用性。

0 人收藏 0 人点赞
#policy-gradient

KLip-PPO: 从逐样本KL角度解读PPO-Clip

arXiv cs.LG · 2026-06-24 缓存

本文表明,近端策略优化(PPO)中裁剪替代目标的梯度可以被一个具有可变系数的逐样本KL散度惩罚项精确重现,揭示了裁剪替代目标的结构特性,并提出了新的设计方向。

0 人收藏 0 人点赞
#policy-gradient

在博弈论中,通才有时胜过专才

MIT News — Artificial Intelligence · 2026-06-17 缓存

麻省理工学院研究人员合著的一篇论文表明,通用策略梯度算法在不完全信息博弈中可以胜过专门的博弈论算法,挑战了该领域长期以来的假设。

0 人收藏 0 人点赞
#policy-gradient

嵌入模型路由的策略遗憾:具有低秩专家的上下文赌博机

arXiv cs.LG · 2026-06-16 缓存

本文将嵌入模型路由形式化为具有低秩专家的对抗性上下文线性赌博机,提出了Hypentropy策略梯度(HPG)算法,该算法实现了O~(s√(MT))的策略遗憾,避免了维度灾难。

0 人收藏 0 人点赞
#policy-gradient

无漂移扩散策略优化

arXiv cs.LG · 2026-06-15 缓存

DiPOD通过交错自蒸馏与策略梯度更新来稳定扩散策略优化,保持紧凑的ELBO,防止双重漂移现象,在语言和连续控制任务中均能获得更高奖励。

0 人收藏 0 人点赞
#policy-gradient

自蒸馏策略梯度

arXiv cs.LG · 2026-06-04 缓存

SDPG(自蒸馏策略梯度)是一种面向大语言模型的全新强化学习训练框架,结合了基于组相对验证器的优势函数、在线自蒸馏与KL正则化,旨在解决RLVR训练中稀疏奖励与训练不稳定的问题。该方法通过条件化特权上下文,使同一模型同时充当学生和教师,在稳定性和性能上均优于RLVR及自蒸馏基线方法。

0 人收藏 0 人点赞
#policy-gradient

基于重试的策略梯度强化学习中探索的涌现

arXiv cs.LG · 2026-06-02 缓存

本文提出ReMax,一种新的强化学习目标函数,通过基于多个样本的期望最大回报来评估策略,从而将探索作为涌现属性引入,无需显式的探索奖励。作者推导了策略梯度公式,并提出了RePPO,一种PPO变体,在MinAtar和Craftax基准测试上实现了高效探索。

0 人收藏 0 人点赞
#policy-gradient

自蒸馏策略梯度

Hugging Face Daily Papers · 2026-06-02 缓存

本文提出SDPG,一种自蒸馏策略梯度框架,结合在线策略自蒸馏、验证器优势及KL正则化,以提升强化学习的稳定性和性能。

0 人收藏 0 人点赞
#policy-gradient

完成与最优性:长期累积损伤问题中的策略梯度

arXiv cs.AI · 2026-05-27 缓存

本文识别了长期累积损伤问题中策略梯度方法的两种失败模式——完成与最优性——并提出了一种分别处理它们的分解方法,并在两个校准环境中进行了验证。

0 人收藏 0 人点赞
#policy-gradient

熵正则化演员-评论家方法的精细分析

arXiv cs.LG · 2026-05-26 缓存

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。

0 人收藏 0 人点赞
#policy-gradient

ECHO: 终端代理免费学习世界模型

Hugging Face Daily Papers · 2026-05-23 缓存

ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。

0 人收藏 0 人点赞
#policy-gradient

表征优先于路由:克服多时间尺度PPO中的代理劫持

Hugging Face Daily Papers · 2026-05-21 缓存

本文指出了代理劫持和时间不确定性是多时间尺度强化学习中的失败模式,并提出了一种目标解耦架构,该架构从Actor中移除路由,利用Critic进行辅助表征学习。该方法消除了LunarLander-v2基准上的策略崩溃,并稳定地超越了'环境已解决'阈值,而无需超参数劫持。

0 人收藏 0 人点赞
#policy-gradient

DelTA:面向可验证奖励强化学习的判别性Token信用分配

Hugging Face Daily Papers · 2026-05-20 缓存

介绍DelTA,一种用于可验证奖励强化学习(RLVR)的判别性Token信用分配方法,该方法放大独特的Token梯度方向,减少共享模式的噪声,在数学和代码生成基准上取得了显著改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈