@tengyuma:我一直认为 GRPO 式的 RL 无法达到最优。既然有数十亿美元投入自我对弈与 RSI,底层的 RL 方法需要……

X AI KOLs Timeline 论文

摘要

Tengyu Ma 介绍了 AC2(带动作分块的 Actor-Critic),这是一种利用学习到的 critic 为 token 分块打分的强化学习方法,支持部分 rollout,训练速度比 GRPO 更快,适用于大语言模型。

我一直认为 GRPO 式的 RL 无法达到最优。既然有数十亿美元投入自我对弈(self-play)与 RSI,底层的 RL 方法必须足够高效。 非常令人兴奋的项目 🔥: 1. 用 critic 来监督策略 2. 利用大语言模型易于 reset 的特性 3. Q 网络与策略之间共享参数
查看原文
查看缓存全文

缓存时间: 2026/10/03 04:52

一直觉得 GRPO 那类 RL 做法不太可能达到最优。既然有数十亿美元投入自我对弈和 RSI,底层的 RL 方法本身就得足够高效才行。

非常令人兴奋的项目 🔥:

  1. 用 critic 来监督 policy
  2. 充分利用 LLM 的“易重置“特性
  3. Q 网络与 policy 之间共享参数

Kaiyue Wen (@wen_kaiyue): 在 LLM 的 RL 里,你真的需要把每一条 rollout 都跑完吗?只要把 critic 训得更好——然后信任它就行了!

我们提出了带动作分块的 Actor-Critic(AC2):用学习到的 critic 来为 token 块打分 ⇒ 只需要跑部分 rollout ⇒ 训练速度比 GRPO 更快!

相似文章

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。