@tengyuma:我一直认为 GRPO 式的 RL 无法达到最优。既然有数十亿美元投入自我对弈与 RSI,底层的 RL 方法需要……
摘要
Tengyu Ma 介绍了 AC2(带动作分块的 Actor-Critic),这是一种利用学习到的 critic 为 token 分块打分的强化学习方法,支持部分 rollout,训练速度比 GRPO 更快,适用于大语言模型。
查看缓存全文
缓存时间: 2026/10/03 04:52
一直觉得 GRPO 那类 RL 做法不太可能达到最优。既然有数十亿美元投入自我对弈和 RSI,底层的 RL 方法本身就得足够高效才行。
非常令人兴奋的项目 🔥:
- 用 critic 来监督 policy
- 充分利用 LLM 的“易重置“特性
- Q 网络与 policy 之间共享参数
Kaiyue Wen (@wen_kaiyue): 在 LLM 的 RL 里,你真的需要把每一条 rollout 都跑完吗?只要把 critic 训得更好——然后信任它就行了!
我们提出了带动作分块的 Actor-Critic(AC2):用学习到的 critic 来为 token 块打分 ⇒ 只需要跑部分 rollout ⇒ 训练速度比 GRPO 更快!
相似文章
@neural_avb: 用我的 SLM 在本地生成类似 GRPO 的 rollout,并用这个微型 RM 作为评分标准。接下来我将在…
Neural_avb 发布了一个轻量级的 Answer-eq 奖励模型,用于问答任务的强化学习训练,声称与外部评判 LM 的一致性达到 80%,且比 F1/ROUGE/BertScore 更快。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
@lateinteraction: 确实如此。但比GRPO更具可扩展性的强化学习范式的下一个突破已经到来:训练你的自教师……
介绍了教学强化学习(Pedagogical RL),这是一种新范式,模型学会利用特权信息主动采样成功且易于遵循的轨迹,从而成为自我教师,相比GRPO和同策略蒸馏方法,实现了高达40%的相对提升。
面向可扩展强化学习的简单Actor与深度Critic
本文提出LAC(LightActor,deepCritic),一种离线强化学习方法,通过将模型容量分配给critic以提高推理效率,在匹配复杂生成Actor性能的同时实现更低延迟。
@cwolferesearch: 智能体强化学习需要新的算法改进。在GRPO中,用于训练的“群体”开始发生变化……
本线程讨论了针对智能体强化学习对GRPO的改进,重点介绍了不同层级的优势归一化(提示层级、任务层级、环境层级),以应对多任务、多轮次环境中的高奖励方差。