value-gradient

标签

Cards List
#value-gradient

RL用于LLM的价值梯度假说

arXiv cs.LG · 2026-05-22 缓存

本文提出了价值梯度假说,用以解释为何像PPO和GRPO这类无评论家(critic-free)的RL方法在LLM上表现良好,揭示了演员网络的反向传播携带了类似价值梯度的信号。本文还推导出一个预测性准则,用于判断在预训练轨迹中何时RL最为有效。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈