预测性GRPO:训练动力学的闭式模型
摘要
提出一个GRPO训练动力学的闭式降阶模型,将其简化为阻尼振荡器,并推导出关于稳定性、组大小不变性和损失曲率的预测。在多个模型和基准上进行了验证。
arXiv:2606.30789v1 公告类型:新
摘要:Group Relative Policy Optimization (GRPO) 已成为提升大语言模型推理能力的标准工具,但其训练动力学仍通过经验方式描述:奖励轨迹通过低参数函数形式拟合,这些函数的常数缺乏机制性意义,超参数选择仍依赖试错。我们基于第一性原理开发了这些动力学的降阶模型。该简化有三个后果。首先,它通过过阻尼极限囊括了经验单指数饱和律,将拟合的平台、时间尺度和规模指数重新解释为底层势函数的固定点、逆刚度和曲率缩放指数,并通过保留的惯性项增加了单指数无法表示的慢启动阶段。其次,它产生了与独立可测量量而非拟合量相关的预测:确定性轨迹的组大小不变性(伴随 $1/G$ 平稳波动)、刷新间隔中的尖锐稳定性阈值以及过阻尼到振荡的转变。第三,它提供了诊断方法,能够区分奖励曲线单独混淆的失败模式——奖励黑客、优势退化、策略集中和动态不稳定性。在三个模型和两种组大小上,闭式轨迹以 $R^2 \geq 0.91$ 拟合训练奖励,预测的组大小不变性在奖励曲线以及到八个数学基准的分布外迁移中均成立。在平均场假设严格成立的受控精确简化场景中验证了稳定性和振荡预测:softmax-赌博机简化复现了预测的过阻尼到振荡转变,并在独立测量的刚度处定位了刷新间隔稳定性阈值,深度网络演示留待未来工作。
查看缓存全文
缓存时间: 2026/07/01 05:32
# 可预测的 GRPO:训练动力学的闭式模型 **来源:** https://arxiv.org/html/2606.30789 \name Datta Nimmaturi \email [email protected] \addr Unsloth 海得拉巴,印度 Datta Nimmaturi 在 Nutanix 工作期间对初步构思和早期验证做出了贡献。 \name Aryan Singhal \email [email protected] \addr Nutanix 圣何塞,美国 \name Vaishnavi Bhargava \email [email protected] \addr Nutanix 圣何塞,美国 \name Henry Wong \email [email protected] \addr Nutanix 圣何塞,美国 \name Johnu George \email [email protected] \addr Nutanix 班加罗尔,印度 \name Debojyoti Dutta \email [email protected] \addr Nutanix 圣何塞,美国 ###### 摘要 群体相对策略优化(GRPO)已成为提升大语言模型推理能力的标准工具,然而其训练动力学仍然主要依靠经验描述:奖励轨迹通过低参数函数形式进行拟合,这些函数的常数缺乏机制性含义,且超参数的选择仍主要依赖试错。我们开发了一个基于第一性原理的降阶模型来描述这些动力学。在一个将策略总结为其期望奖励的平均场假设下,我们将GRPO更新简化为一个受随机噪声驱动的阻尼振荡器,其质量、阻尼和刚度由优化器超参数以及一个测量得到的曲率尺度以闭式形式确定——动量提供惯性,离策略滞后削弱阻尼,而组大小仅作为噪声温度出现。该降阶模型产生三个后果。第一,它将经验性的单指数饱和律作为其过阻尼极限,将拟合的平台值、时间尺度和规模指数重新解释为底层势能场的固定点、逆刚度和曲率缩放指数,并通过保留的惯性项增加了单指数无法表示的慢启动阶段。第二,它产生与独立可测量量相关的预测,而非基于拟合参数:确定性轨迹的组大小不变性(伴随 \(1/\sqrt{G}\) 的稳态波动)、刷新间隔的尖锐稳定阈值以及从过阻尼到振荡的转变。第三,它提供了能够区分奖励曲线本身混淆的多种失效模式的诊断——奖励破解、优势退化、策略集中和动力学不稳定性。在三个模型和两个组大小上,闭式轨迹对训练奖励的拟合达到 \(R^{2}\geq 0.91\),并且预测的组大小不变性在奖励曲线和到八个数学基准的分布外迁移上都成立。稳定性和振荡预测在一个精确降阶的设定中得到验证,其中平均场假设精确成立:一个softmax-bandit降阶重现了预测的过阻尼到振荡转变,并将刷新间隔的稳定性阈值定位于独立测量的刚度上,而深层网络的演示留待未来工作。 **关键词:** GRPO,可预测性 ## 1 引言 大语言模型(LLMs)在经过强化学习(RL)后训练后展现出显著的推理能力 (Shao et al., 2024 (https://arxiv.org/html/2606.30789#bib.bib1); Guo et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib2)),然而它们获取这些能力的机制在很大程度上仍然不透明 (Yue et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib3); Wang et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib4); Yan et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib5))。扩展RL计算是推进LLM能力前沿的关键范式。例如,Deepseek-R1-Zero在RL后训练中使用了100,000个H800 GPU小时——占其预训练计算量的3.75% (Guo et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib2))。此外,前沿LLM中RL后训练计算量的趋势正在放大——从o1到o3增加了超过10倍 (OpenAI, 2025 (https://arxiv.org/html/2606.30789#bib.bib6)),从Grok-3到Grok-4也有类似的跳跃 (xAI, 2025 (https://arxiv.org/html/2606.30789#bib.bib7))。尽管RL计算规模巨大,但对该领域的普遍理解仍然更像一门艺术而非科学。最近的RL计算突破通常由少数前沿实验室以新颖算法 (Yu et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib8); Zheng et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib9)) 和训练报告 (MiniMax et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib10); Mistral-AI et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib11)) 的形式驱动。这些研究提供了具体的解决方案,但缺乏对RL计算扩展的普遍科学理解。这导致RL后训练陷入永久的试错模式,既非最优也成本过高。 我们的贡献如下: 1. **GRPO训练的降阶模型。** 在一个单一的平均场假设(假设1 (https://arxiv.org/html/2606.30789#Thmtheorem1))下,我们将GRPO更新(公式3 (https://arxiv.org/html/2606.30789#S3.E3))简化为一个受随机噪声驱动的阻尼振荡器(定理7 (https://arxiv.org/html/2606.30789#Thmtheorem7)),其系数 \(M_{\mathrm{eff}}, C_{\mathrm{eff}}, K_{\mathrm{eff}}\) 以闭式形式给出(公式9 (https://arxiv.org/html/2606.30789#S3.E9))。除了此假设和在步长与刷新滞后上的受控二阶截断外,该降阶是机械推导的:动量将梯度流提升至二阶(引理4 (https://arxiv.org/html/2606.30789#Thmtheorem4)),离策略滞后提供惯性同时削弱阻尼(引理5 (https://arxiv.org/html/2606.30789#Thmtheorem5)),而组大小作为噪声温度进入(引理6 (https://arxiv.org/html/2606.30789#Thmtheorem6))。 2. **对经验饱和律的机制性解释。** 我们证明先前工作中拟合的单指数奖励律(公式13 (https://arxiv.org/html/2606.30789#S3.E13))是我们模型的过阻尼极限(推论13 (https://arxiv.org/html/2606.30789#Thmtheorem13)),这将它的平台、时间尺度和规模指数重新解释为动力学的固定点、逆刚度和曲率缩放指数,而非拟合常数(公式15 (https://arxiv.org/html/2606.30789#S3.E15))。保留惯性项产生了单指数形式无法表示的慢启动拐点(命题14 (https://arxiv.org/html/2606.30789#Thmtheorem14))。 3. **绑定量可测量量的可证伪预测。** 由于系数与独立可观测的斜率相关联,该模型产生预测而非拟合:确定性轨迹的组大小不变性(伴随 \(1/\sqrt{G}\) 的稳态波动)(命题10 (https://arxiv.org/html/2606.30789#Thmtheorem10)),一个尖锐的稳定性阈值 \(K_{\mathrm{ref}} > 1-\mu\)(命题9 (https://arxiv.org/html/2606.30789#Thmtheorem9)),以及刷新间隔扫描下的过阻尼到振荡转变(第3.5节 (https://arxiv.org/html/2606.30789#S3.SS5))。 4. **区分不同失效模式的诊断。** 我们将该模型具体化为四个奖励曲线本身无法区分的指标——训练-评估解耦、优势退化、策略集中和动力学不稳定性——从而区分平均场前提(假设1 (https://arxiv.org/html/2606.30789#Thmtheorem1))的弱化与动力学(定理7 (https://arxiv.org/html/2606.30789#Thmtheorem7))稳定性的丧失。 5. **经验验证。** 在三个模型和两个组大小上,三阶段律(公式16 (https://arxiv.org/html/2606.30789#S3.E16))对训练奖励轨迹的拟合达到 \(R^{2}\geq 0.91\),并且命题10 (https://arxiv.org/html/2606.30789#Thmtheorem10) 预测的组大小不变性在均值轨迹和到八个基准的分布外迁移上都得到验证。稳定性和振荡预测在过阻尼的GSM8K运行上无法测试,因此在一个精确降阶的设定(第5.6节 (https://arxiv.org/html/2606.30789#S5.SS6))中进行验证:一个softmax-bandit降阶(其中假设1 (https://arxiv.org/html/2606.30789#Thmtheorem1) 精确成立)重现了过阻尼到振荡转变,并将命题9 (https://arxiv.org/html/2606.30789#Thmtheorem9) 的刷新间隔阈值定位于独立测量的刚度上,而深层网络的演示留待未来工作。 ## 2 相关工作 #### GRPO和RLVR的理论。 越来越多的工作尝试解释*为什么*基于可验证奖励的强化学习能够提升推理能力,而不仅仅是证明它确实有效。 Mroueh (2025 (https://arxiv.org/html/2606.30789#bib.bib12)) 刻画了GRPO的有效损失并建立了“成功放大”性质——存在一个期望奖励超过参考策略的稳定不动点——以及控制趋近该不动点的一步压缩。 Vojnovic and Yun (2025 (https://arxiv.org/html/2606.30789#bib.bib13)) 分析了GRPO诱导的对齐目标,并为KL锚定项识别出一个 \(\beta\sigma(\pi_{\theta})\) 的有效正则化形式。我们将这两个结果作为输入而非重新推导:假设1 (https://arxiv.org/html/2606.30789#Thmtheorem1) 从 Mroueh (2025 (https://arxiv.org/html/2606.30789#bib.bib15)) 引入了不动点 \(p^{\star}\) 和压缩 \(h'(p^{\star})\),而引理3 (https://arxiv.org/html/2606.30789#Thmtheorem3) 从 Vojnovic and Yun (2025 (https://arxiv.org/html/2606.30789#bib.bib13)) 的有效正则化形式继承了刚度尺度。 另一条平行线询问RLVR是否赋予新能力还是增强现有能力 (Yue et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib3); Wang et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib4); Yan et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib5));这个问题与我们的问题正交,我们关注的是优化固定奖励信号所沿的*轨迹*,而非奖励本身的来源。 #### 经验缩放和饱和律。 另一组互补的工作用低参数函数形式拟合GRPO奖励轨迹。 Nimmaturi et al. (2025 (https://arxiv.org/html/2606.30789#bib.bib15)) 提出了GRPO训练的预测性缩放定律,而 Ghosh et al. (2026 (https://arxiv.org/html/2606.30789#bib.bib14)) 报告称,跨模型家族和规模,奖励遵循公式13 (https://arxiv.org/html/2606.30789#S3.E13) 的饱和律,具有与模型规模 \(M\) 相关的时间尺度 \(M^{0.3}\)。这些定律准确且有助于计算规划,但其参数是拟合常数,缺乏机制性指代:平台、时间尺度和规模指数是从数据中读取而非预测得到。我们的降阶模型是吸纳而非竞争这些工作。推论13 (https://arxiv.org/html/2606.30789#Thmtheorem13) 表明单指数律(公式13 (https://arxiv.org/html/2606.30789#S3.E13))正是定理7 (https://arxiv.org/html/2606.30789#Thmtheorem7) 的过阻尼极限,而公式15 (https://arxiv.org/html/2606.30789#S3.E15) 将 \(M^{0.3}\) 指数重新解释为底层势能场的曲率缩放指数。当保留惯性项时,命题14 (https://arxiv.org/html/2606.30789#Thmtheorem14) 进一步预测了单指数无法表示的慢启动阶段,恢复了这些拟合未能解释的完整三阶段形状。 #### 算法和训练报告。 近年来RL后训练的大部分进展以新颖算法 (Yu et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib8); Zheng et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib9)) 和大规模训练报告 (MiniMax et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib10); Mistral-AI et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib11)) 的形式出现。这些贡献推动了实际前沿,并报告了具体且来之不易的配置,但它们并非旨在提供训练曲线如何依赖其超参数的通用解释;它们提供的建议是针对特定环境校准的,本身并无法预测其外部的行为。我们的目标是互补的:不是提供一个新的优化器或一次新的运行,而是在训练配置 (\(\beta, \eta, \mu, G, K_{\mathrm{ref}}\)) 与结果轨迹之间建立一个闭式关系,并产生命题10 (https://arxiv.org/html/2606.30789#Thmtheorem10) 的组大小不变性和命题9 (https://arxiv.org/html/2606.30789#Thmtheorem9) 的稳定性阈值作为可证伪的后果。 #### 定位。 因此,我们贡献的边界是清晰的。我们从 Mroueh (2025 (https://arxiv.org/html/2606.30789#bib.bib12)) 引入了不动点和压缩,从 Vojnovic and Yun (2025 (https://arxiv.org/html/2606.30789#bib.bib13)) 引入了正则化尺度;新颖之处在于将由此产生的一阶松弛推广为二阶系统,其中的惯性和阻尼由动量(引理4 (https://arxiv.org/html/2606.30789#Thmtheorem4))和离策略滞后(引理5 (https://arxiv.org/html/2606.30789#Thmtheorem5))机械地提供,并最终将经验饱和律 (Nimmaturi et al., 2025 (https://arxiv.org/html/2606.30789#bib.bib15); Ghosh et al., 2026 (https://arxiv.org/html/2606.30789#bib.bib14)) 作为单一方程的过阻尼极限吸纳其中。该降阶模型以平均场假设为条件(注12 (https://arxiv.org/html/2606.30789#Thmtheorem12)),并非GRPO的无条件解释;相反,它是将拟合的奖励曲线转变为导出曲线所需的最小动力学模型。 ## 3 形式框架 ### 3.1 设置 对于一个提示 \(q\),GRPO采样一组 \(G\) 个补全 \(\{o_i\}_{i=1}^G \sim \pi_{\theta_{\mathrm{old}}}(\cdot \mid q)\),用奖励 \(r_i = R(q, o_i)\) 对其进行评分,并形成群体相对优势: \[ A_i = \frac{r_i - \bar{r}}{\operatorname{std}(r)}, \quad \bar{r} = \frac{1}{G} \sum_j r_j. \] (1) (未裁剪的)目标函数,带有KL锚定权重 \(\beta > 0\) 到参考策略 \(\pi_{\mathrm{ref}}\),为: \[ J(\theta) = \mathbb{E}_q \, \mathbb{E}_{\{o_i\} \sim \pi_{\theta_{\mathrm{old}}}} \left[ \frac{1}{G} \sum_{i=1}^G \frac{\pi_\theta(o_i \mid q)}{\pi_{\theta_{\mathrm{old}}}(o_i \mid q)} A_i \right] - \beta \, \mathbb{E}_q \left[ D_{\mathrm{KL}} \big( \pi_\theta \,\|\, \pi_{\mathrm{ref}} \big) \right]. \] (2) 参数通过具有学习率 \(\eta\) 和动量系数 \(\mu \in [0,1)\)(相当于Adam中的 \(\beta_1\))的随机梯度上升进行更新,并且采样策略每 \(K_{\mathrm{ref}}\) 步刷新一次: \[ \theta_{k+1} = \theta_k + \eta \widehat{\nabla J}(\theta_k; \theta_{\mathrm{old}}) + \mu (\theta_k - \theta_{k-1}), \qquad \theta_{\mathrm{old}} = \theta_{k - K_{\mathrm{ref}}}. \] (3) 我们使用 \(\delta\) 表示从步长到时间的转换。离散映射 [3 (https://arxiv.org/html/2606.30789#S3.E3)] 是我们关注的对象;连续时间方程
相似文章
LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。
UDM-GRPO:面向均匀离散扩散模型的稳定高效群体相对策略优化
UDM-GRPO 为均匀离散扩散模型提出了一种稳定的强化学习训练框架,将 GenEval 准确率从 69% 提升至 96%,OCR 基准准确率从 8% 提升至 57%。
GRPO、Dr. GRPO 和 DAPO 是对同一数值的三种操作:组标准差恒等式
本文证明 GRPO、Dr. GRPO 和 DAPO 是同一底层机制的三种表述:调整一组采样答案中奖励的标准差。组标准差恒等式表明,一致的组不提供任何学习信号,而分裂的组驱动学习,揭示了训练语言模型推理的统一旋钮。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
GCPO:诊断并约束大语言模型Rollout强化学习中的子空间几何
本文提出GCPO,一种用于诊断和约束基于rollout的大语言模型强化学习中的子空间几何的方法,在推理、编程和工具使用任务上相较于GRPO及其变体提升了稳定性和性能。