GCPO:诊断并约束大语言模型Rollout强化学习中的子空间几何
摘要
本文提出GCPO,一种用于诊断和约束基于rollout的大语言模型强化学习中的子空间几何的方法,在推理、编程和工具使用任务上相较于GRPO及其变体提升了稳定性和性能。
arXiv:2608.11674v1 公告类型:新
摘要:GRPO等基于策略的rollout方法是大语言模型后训练的核心,但它们经常遭遇训练不稳定、跨任务能力下降和响应长度膨胀等问题。尽管先前的工作已经刻画了聚合更新的子空间几何,但该几何的逐步变化及其与模型性能的关系仍不清楚。我们引入了主子空间重叠(Principal-Subspace Overlap),这是一种相对于预训练权重的主奇异子空间、对单个rollout更新进行维度校正的度量。尽管平均重叠度较低,但瞬态尖峰往往先于性能退化出现。为了解决这个问题,我们提出了GCPO(几何约束策略优化,Geometrically Constrained Policy Optimization),它应用硬双边正交投影将更新限制在互补子空间中,从而从结构上防止此类偏移。在Qwen3-8B和GLM4-9B上的数学推理、代码生成和工具使用任务中,GCPO始终优于GRPO以及包括DAPO和GSPO在内的近期变体,相对于基础模型和最强基线分别最多提升27.69和2.37个百分点。此外,GCPO保留了一般能力,消除了响应长度膨胀,并使策略熵保持稳定。我们的发现为稳定的强化学习后训练提供了新的诊断视角和原则性设计观点。
查看缓存全文
缓存时间: 2026/08/13 15:38
# GCPO:诊断与约束面向 LLM 的 Rollout 强化学习中的子空间几何
来源:https://arxiv.org/html/2608.11674
Jingwei Xu,Wanyu Wang,Kai\-Yuan Guo,Zhenbo Yu\corresponding,Yi Wang\corresponding\thanks{贡献完成于上海人工智能实验室。},Yu Qiao\corresponding
###### 摘要
基于 on\-policy rollout 的方法(如 GRPO)是大语言模型后训练的核心。然而,它们常常遭遇训练不稳定、跨任务能力下降和响应长度膨胀等问题。尽管已有工作刻画了聚合更新的子空间几何,但该几何的逐步变化及其与模型性能之间的关系仍不清楚。我们提出 *主子空间重叠(Principal\-Subspace Overlap)*,一种对单个 rollout 更新相对于预训练权重主奇异子空间的维度校正度量。尽管平均重叠较低,但瞬时尖峰往往先于性能下降。为解决这一问题,我们提出 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化),它施加硬性双侧正交投影,将更新约束到互补子空间,从而在构造上阻止此类越界。在 Qwen3-8B 和 GLM4-9B 上的数学推理、代码生成和工具使用任务中,GCPO 始终优于 GRPO 及最近的变体(包括 DAPO 和 GSPO),相对于基座模型和最强基线分别最高提升 27.69 和 2.37 个百分点。此外,GCPO 保留了一般能力,消除了响应长度膨胀,并稳定了策略熵。我们的发现为稳定强化学习后训练提供了新的诊断视角和原则性设计视角。
代码与数据集——https://github.com/Icarus1411/GCPO
## 1 引言
基于 rollout 的强化学习(RL)已成为改进大语言模型(LLMs)在数学推理、代码生成和工具使用方面能力的广泛使用的后训练机制\(21 (https://arxiv.org/html/2608.11674#bib.bib1);28 (https://arxiv.org/html/2608.11674#bib.bib25);6 (https://arxiv.org/html/2608.11674#bib.bib8)\)。然而,它的优化数据是由不断演化的策略自身生成的:每次更新都会同时改变策略以及用于构建下一次更新的 rollout 分布。这种反馈回路可能导致训练不稳定、优化任务之外的能力下降,以及响应长度膨胀\(11 (https://arxiv.org/html/2608.11674#bib.bib30);18 (https://arxiv.org/html/2608.11674#bib.bib9)\)。
现有的大多数补救措施通过目标层面或策略层面的控制来稳定 RL。KL 正则化约束与参考策略的散度,裁剪限制大的似然比变化,奖励设计修改优化信号\(34 (https://arxiv.org/html/2608.11674#bib.bib13);32 (https://arxiv.org/html/2608.11674#bib.bib12);33 (https://arxiv.org/html/2608.11674#bib.bib11)\)。虽然有效,但这些方法可能将策略层面统计相似的不同更新视为相同,即使它们在参数空间中的方向不同。由于相似量级的更新可能与预训练模型的结构化参数空间产生不同交互,我们质疑它们的逐步方向是否能提供对训练动态的互补诊断。
我们关注每个预训练线性权重矩阵的主奇异子空间。前 \(k\) 个右奇异向量和左奇异向量分别识别主导输入方向和输出方向。它们共同定义了预训练变换的最优秩-\(k\) 近似\(8 (https://arxiv.org/html/2608.11674#bib.bib28)\)。因此,重叠这些子空间的更新可能改变预训练变换中结构上显著的分量。我们并不把这些方向解释为语义知识的字面分解,而是将它们视为一个功能上特殊但易于处理的结构参考。先前的分析还表明,RL 更新在训练平均意义上主要位于主方向之外\(23 (https://arxiv.org/html/2608.11674#bib.bib3);31 (https://arxiv.org/html/2608.11674#bib.bib20);19 (https://arxiv.org/html/2608.11674#bib.bib34)\)。这种聚合规律留下了一个重要问题:单个更新是否表现出瞬时的主子空间重叠,以及这种重叠与训练性能有何关系?
我们的逐步分析揭示了单个更新会瞬时进入预训练主子空间。我们根据每个实际更新与该子空间的左侧和右侧重叠,将其分解为四个块,并减去各向同性零假设下期望的重叠。尽管大部分更新能量位于双正交块中,但聚合统计掩盖了*超额主子空间重叠*的间歇性尖峰。在我们检查的训练中,持续或重复的尖峰与验证准确率下降同时出现,且往往先于下降。因此,我们将重叠视为不稳定阶段的几何相关信号,这促使我们通过将更新保持在所选预训练映射的双侧正交补中来保留这些映射。
我们将该假设实例化为 GCPO(Geometrically Constrained Policy Optimization,几何约束策略优化),它通过一种对有效策略更新的硬几何约束来增强基于 rollout 的策略优化。在每个 rollout 迭代中,GCPO 优化底层策略目标,同时要求每个被适配层的更新都位于所选预训练主子空间的双侧正交补中。因此,GCPO 改变的是策略改进的可允许方向,而不是引入另一个策略层面惩罚。该约束与 KL 正则化互补:KL 在输出空间中控制策略变化,而 GCPO 控制参数变化的可行方向。它还具有精确的层层面保证:对于位于所选主子空间输入子空间中的输入,适配层的响应保持不变。剩余的补空间很大,保留了高维的可行补空间用于任务适配。
在 Qwen3-8B 和 GLM4-9B 上的综合评估涵盖了数学推理、代码生成和工具使用。在所有任务上,GCPO 均取得最佳准确率,比最强基线高出 1.02–2.37 个百分点(3 个种子的 ±标准差),比对应的指令微调模型高出 7.09–27.69 个百分点。当在数学上训练并在其他任务上评估时,它获得了最强的最坏情况保留能力。它还表现出更平滑的准确率和策略熵轨迹,并抑制了响应长度膨胀。
总之,我们的主要贡献有三点:
- •我们引入了一种维度校正、逐步的主子空间重叠度量,并表明升高的重叠是与 rollout RL 中验证性能下降相关的预警信号。
- •我们将 rollout RL 形式化为一个受约束的策略优化问题,并提出 GCPO,对每次有效策略更新强制执行双侧正交性,从而保留预训练主映射,同时保留一个大的互补更新空间。
- •在两个模型家族和三个任务域上,GCPO 优于所有评估的基线,更好地保留跨任务能力,并表现出更稳定的准确率、策略熵和响应长度动态。
## 2 相关工作
#### 面向 LLM 对齐的 Rollout 强化学习。
基于 rollout 的强化学习已成为提升 LLM 推理能力的主导范式。在 PPO\(21 (https://arxiv.org/html/2608.11674#bib.bib1)\) 的基础上,最近的进展如 GRPO\(22 (https://arxiv.org/html/2608.11674#bib.bib2)\)、GSPO\(34 (https://arxiv.org/html/2608.11674#bib.bib13)\)、GMPO\(33 (https://arxiv.org/html/2608.11674#bib.bib11)\) 和 DAPO\(32 (https://arxiv.org/html/2608.11674#bib.bib12)\) 显著改善了优势估计和扩展效率。尽管有这些创新,自生成 rollout 的动态特性经常使策略陷入优化不稳定、响应长度膨胀和通用能力下降\(30 (https://arxiv.org/html/2608.11674#bib.bib14)\)。关键在于,现有方法主要通过目标或可观测的策略行为进行干预,而对实际参数更新的几何结构探索较少。这凸显了从新的视角诊断这些不稳定的根源,而不是在输出空间进行表象修补的必要性。
#### RL 中的正则化与稳定性。
RL 后训练通常通过目标层面或策略层面的控制来稳定。KL 惩罚不鼓励偏离参考策略,裁剪限制大的似然比变化,奖励塑形调整标量优化信号以减少奖励黑客或长度膨胀等不良行为\(24 (https://arxiv.org/html/2608.11674#bib.bib10);15 (https://arxiv.org/html/2608.11674#bib.bib29)\)。这些技术有效,但它们仍是软控制:它们不鼓励不稳定更新,而非排除它们。其有效性往往依赖于仔细调参的惩罚系数,并且可能被基于 rollout 的 RL 的高方差反馈削弱\(1 (https://arxiv.org/html/2608.11674#bib.bib32);9 (https://arxiv.org/html/2608.11674#bib.bib33)\)。这些局限性促使我们超越目标层面的控制,设计一种直接约束可行更新空间的互补方法。
#### 策略优化的几何分析。
近期研究表明,参数更新的几何在基于 RL 的后训练中起着关键作用。这些研究不是将策略更新视为无结构扰动,而是表明 RL 诱导的更新相对于预训练权重表现出系统性的几何模式。特别是,最近的分析发现,成功的 RL 更新平均而言更集中在预训练算子主奇异子空间之外\(23 (https://arxiv.org/html/2608.11674#bib.bib3);2 (https://arxiv.org/html/2608.11674#bib.bib4)\)。这种离主方向趋势表明,有效的策略适配可能优先利用与预训练期间学到的主要结构干扰较小的方向,这为理解参数空间几何在基于 rollout 的 RL 中的重要性提供了基础。然而,现有分析主要刻画聚合更新行为,尚未回答逐步偏离这种几何如何在训练中出现,以及是否与优化不稳定有关。
## 3 主子空间重叠与不稳定
见图注。图 1:逐步更新重叠与验证性能。红色曲线是超额主子空间重叠的 5相似文章
超越欧几里得裁剪:通过黎曼等距策略优化克服LLM强化学习中的探索崩溃
本文揭示了PPO-Clipping使用欧几里得度量导致LLM强化学习中的探索崩溃,并提出了黎曼等距策略优化(RIPO)以确保几何一致的策略更新,在AIME24上比GRPO提升了高达60%。
LC-GRPO:利用朗之万校正弥合基于流的GRPO训练-推理差距
本文介绍了LC-GRPO,一种带有朗之万校正的基于流的GRPO框架,通过将随机训练轨迹与确定性ODE采样对齐来弥合训练与推理之间的差距,从而在SD3.5、FLUX.1-Dev和HunyuanVideo等模型上提升奖励优化效果。
面向强化学习后训练的跨轮次自适应展开优化
本文提出了CERO,一种用于LLM强化学习后训练的跨轮次自适应展开优化方法。该方法利用贝叶斯后验方差,在提示和轮次之间分配固定的展开预算,以最大化样本效率,实现了理论遗憾界,并在数学推理任务上优于GRPO。
GraphPO:面向推理模型的基于图策略优化
GraphPO 是一种新颖的基于图的强化学习框架,它将轨迹表示为一个有向无环图,合并语义等价的推理路径,以减少冗余探索并改进大型推理模型的信用分配。
已知事实导致的推理错误:Step-Level Self-Consistency Group Relative Policy Optimization for LLM
本文介绍了SSC-GRPO,一种步级奖励优化方法,通过多次 rollout 中的自一致性分数来减少大语言模型推理中上下文敏感的事实幻觉,在数学推理和幻觉基准测试上达到了最先进的性能。