policy-gradient

标签

Cards List
#policy-gradient

响应条件化的并行到序列编排用于多智能体系统

arXiv cs.CL · 2026-05-18 缓存

介绍Nexa,一种可训练的响应条件化策略,结合了多智能体系统中的并行和串行执行,使用轻量级Transformer预测稀疏通信图,在最小化延迟的同时提高准确性。

0 人收藏 0 人点赞
#policy-gradient

@probablynotaz9: ICML 单作者论文警报:是否曾想用经典策略梯度对扩散 LLM 进行后训练,而无需……

X AI KOLs Following · 2026-05-09 缓存

这篇 ICML 单作者论文介绍了摊销式组相对策略优化(AGRPO),旨在为扩散语言模型实现高效的强化学习后训练。

0 人收藏 0 人点赞
#policy-gradient

@jiqizhixin:太棒了!关于推理型LLM的强化学习现状 https://aweers.de/blog/2026/rl-for-llms/…

X AI KOLs Timeline · 2026-05-08 缓存

一篇全面回顾推理型LLM强化学习现状的博文,涵盖从REINFORCE、PPO到GRPO乃至更多方法,并与InstructGPT、DeepSeek-R1等关键模型相联系。

0 人收藏 0 人点赞
#policy-gradient

列表式策略优化:基于分组的 RLVR 作为 LLM 响应单纯形上的目标投影

Hugging Face Daily Papers · 2026-05-07 缓存

本文介绍了列表式策略优化(LPO),这是一种用于 RLVR 的方法,通过在响应单纯形上进行散度最小化来显式处理目标投影,从而提高大语言模型(LLM)的训练稳定性和性能。

0 人收藏 0 人点赞
#policy-gradient

GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调

Hugging Face Daily Papers · 2026-04-15 缓存

# 论文页面 - GFT:基于无偏群组优势与动态系数修正,从模仿迈向奖励微调 来源:[https://huggingface.co/papers/2604.14258](https://huggingface.co/papers/2604.14258) ## 摘要 Group Fine-Tuning 通过利用多样化的回复群组和自适应权重边界来解决监督微调的局限性,从而提升训练稳定性与效率。大语言模型通常在后训练中使用[监督微调](https://hug

0 人收藏 0 人点赞
#policy-gradient

平衡聚合:理解与修复 GRPO 中的聚合偏差

Hugging Face Daily Papers · 2026-04-14 缓存

本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。

0 人收藏 0 人点赞
#policy-gradient

Spinning Up in Deep RL

OpenAI Blog · 2018-11-08 缓存

# Spinning Up in Deep RL 来源:[https://openai.com/index/spinning-up-in-deep-rl/](https://openai.com/index/spinning-up-in-deep-rl/) 在 OpenAI,我们相信深度学习——特别是深度强化学习——将在强大 AI 技术的发展中扮演核心角色。虽然有很多资源可以让人们快速入门深度学习,但深度强化学习的学习曲线更陡峭。我们设计了 Spinning Up 来帮助人们

0 人收藏 0 人点赞
#policy-gradient

使用动作相关分解基线的策略梯度方差缩减

OpenAI Blog · 2018-03-20 缓存

# 使用动作相关分解基线的策略梯度方差缩减 来源: [https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/](https://openai.com/index/variance-reduction-for-policy-gradient-with-action-dependent-factorized-baselines/) OpenAI## 摘要 策略梯度方法在深度强化学习中取得了巨大成功,但梯度估计的方差很高。高方差问题特别

0 人收藏 0 人点赞
#policy-gradient

具有对手学习感知的学习

OpenAI Blog · 2017-09-13 缓存

OpenAI 提出了 LOLA (Learning with Opponent-Learning Awareness),一种多智能体强化学习方法,其中智能体能够塑造其他智能体的预期学习过程。该方法展示了在重复囚徒困境中合作的涌现现象,以及在博弈论设置中收敛到纳什均衡。

0 人收藏 0 人点赞
#policy-gradient

近端策略优化

OpenAI Blog · 2017-07-20 缓存

# 近端策略优化 来源: [https://openai.com/index/openai-baselines-ppo/](https://openai.com/index/openai-baselines-ppo/) OpenAI 我们推出了一类新的强化学习算法——近端策略优化(PPO),其性能与最先进的方法相当或更优,同时实现和调优都要简单得多。由于易用性和良好的性能,PPO 已成为 OpenAI 的默认强化学习算法。[策略梯度

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈