平衡聚合:理解与修复 GRPO 中的聚合偏差
摘要
本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。
查看缓存全文
缓存时间: 2026/05/08 06:53
论文页 - 平衡聚合:理解并修复 GRPO 中的聚合偏差
来源: https://huggingface.co/papers/2605.04077 作者:
,
,
,
,
,
,
,
,
,
摘要
平衡聚合(Balanced Aggregation)通过解决令牌级策略梯度聚合中的优化偏差问题,提升了基于可验证奖励的强化学习训练稳定性与性能。
基于可验证奖励的强化学习(https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards)(RLVR)已成为提升大语言模型推理和代码生成能力的核心范式,而 GRPO 风格训练(https://huggingface.co/papers?q=GRPO-style%20training)因其简洁高效而被广泛采用。然而,一个重要的设计选择尚未得到充分探索:在每个采样组内,如何对令牌级策略梯度(https://huggingface.co/papers?q=token-level%20policy%20gradient)项进行聚合。标准 GRPO 使用序列聚合(https://huggingface.co/papers?q=sequence%20aggregation),而近期研究则提倡令牌聚合(https://huggingface.co/papers?q=token%20aggregation)作为更优的替代方案。我们指出,这两种规则会导致不同的优化偏差(https://huggingface.co/papers?q=optimization%20biases):令牌聚合(https://huggingface.co/papers?q=token%20aggregation)引入了符号-长度耦合(sign-length coupling),而序列聚合(https://huggingface.co/papers?q=sequence%20aggregation)则通过序列级等权重隐式地降低了长响应的权重。为了解决这一矛盾,我们提出了平衡聚合(https://huggingface.co/papers?q=Balanced%20Aggregation)(BA),这是一种简单的即插即用替换方案,它分别在正负子集中计算令牌级均值,然后通过基于序列数量的权重进行组合。在 DAPO-17k 和 Polaris 数据集上,使用 Qwen2.5-Math-7B 和 Qwen3-1.7B 进行的实验,并在六个推理和编码基准上评估,结果表明 BA 在训练稳定性(https://huggingface.co/papers?q=training%20stability)和最终性能(https://huggingface.co/papers?q=final%20performance)上均持续优于标准的令牌和序列聚合(https://huggingface.co/papers?q=sequence%20aggregation)。我们的进一步分析表明,令牌和序列聚合(https://huggingface.co/papers?q=sequence%20aggregation)的相对有效性主要受响应长度变化和正负长度差距的影响,这凸显了聚合作为 GRPO 风格 RLVR 中关键设计维度重要性。
查看 arXiv 页面 (https://arxiv.org/abs/2605.04077)查看 PDF (https://arxiv.org/pdf/2605.04077)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.04077)
在您的 Agent 中获取这篇论文:
hf papers read 2605\.04077
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.04077 即可从此页面链接。
引用该论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.04077 即可从此页面链接。
引用该论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.04077 即可从此页面链接。
包含该论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)即可从此页面链接。
相似文章
BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
GRPO 下基于梯度的 LoRA 秩分配:一项实证研究
本研究通过实证表明,在监督微调中有效的基于梯度的 LoRA 秩分配,在基于 GRPO 的强化学习中会导致性能下降,原因在于梯度景观更为平缓以及存在梯度放大效应。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
驾驭极端 Token:基于高斯核优势重权重的协方差感知 GRPO
本文提出了一种协方差感知的组相对策略优化(GRPO)变体,该方法利用高斯核优势重权重技术来稳定训练熵,并提升大语言模型的推理性能。