平衡聚合:理解与修复 GRPO 中的聚合偏差

Hugging Face Daily Papers 论文

摘要

本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。

基于可验证奖励的强化学习(RLVR)已成为提升大语言模型推理和代码生成能力的核心范式,其中 GRPO 风格的训练因其简单高效而被广泛采用。然而,一个重要的设计选择仍未得到充分探索:即在每个采样组内如何聚合 token 级策略梯度项。标准的 GRPO 使用序列聚合,而近期研究则主张使用 token 聚合作为更优的替代方案。我们证明,这两种规则会引发不同的优化偏差:token 聚合引入了符号-长度耦合,而序列聚合则通过序列级的等权重隐式地降低了长回复的权重。为了解决这一矛盾,我们提出了平衡聚合(BA)方法。这是一种即插即用的替代方案,它在正负子集内部分别计算 token 级均值,然后基于序列数量的权重将二者结合。在 DAPO-17k 和 Polaris 数据集上,使用 Qwen2.5-Math-7B 和 Qwen3-1.7B 进行的实验,并在六个推理和编码基准测试进行评估,结果显示 BA 在训练稳定性和最终性能上始终优于标准的 token 聚合和序列聚合。我们的进一步分析表明,token 聚合和序列聚合的相对有效性主要受回复长度变化和正负样本长度差异的影响,凸显了聚合机制在 GRPO 风格 RLVR 中作为关键设计维度的重要性。
查看原文
查看缓存全文

缓存时间: 2026/05/08 06:53

论文页 - 平衡聚合:理解并修复 GRPO 中的聚合偏差

来源: https://huggingface.co/papers/2605.04077 作者:

,

,

,

,

,

,

,

,

,

摘要

平衡聚合(Balanced Aggregation)通过解决令牌级策略梯度聚合中的优化偏差问题,提升了基于可验证奖励的强化学习训练稳定性与性能。

基于可验证奖励的强化学习(https://huggingface.co/papers?q=Reinforcement%20learning%20with%20verifiable%20rewards)(RLVR)已成为提升大语言模型推理和代码生成能力的核心范式,而 GRPO 风格训练(https://huggingface.co/papers?q=GRPO-style%20training)因其简洁高效而被广泛采用。然而,一个重要的设计选择尚未得到充分探索:在每个采样组内,如何对令牌级策略梯度(https://huggingface.co/papers?q=token-level%20policy%20gradient)项进行聚合。标准 GRPO 使用序列聚合(https://huggingface.co/papers?q=sequence%20aggregation),而近期研究则提倡令牌聚合(https://huggingface.co/papers?q=token%20aggregation)作为更优的替代方案。我们指出,这两种规则会导致不同的优化偏差(https://huggingface.co/papers?q=optimization%20biases):令牌聚合(https://huggingface.co/papers?q=token%20aggregation)引入了符号-长度耦合(sign-length coupling),而序列聚合(https://huggingface.co/papers?q=sequence%20aggregation)则通过序列级等权重隐式地降低了长响应的权重。为了解决这一矛盾,我们提出了平衡聚合(https://huggingface.co/papers?q=Balanced%20Aggregation)(BA),这是一种简单的即插即用替换方案,它分别在正负子集中计算令牌级均值,然后通过基于序列数量的权重进行组合。在 DAPO-17k 和 Polaris 数据集上,使用 Qwen2.5-Math-7B 和 Qwen3-1.7B 进行的实验,并在六个推理和编码基准上评估,结果表明 BA 在训练稳定性(https://huggingface.co/papers?q=training%20stability)和最终性能(https://huggingface.co/papers?q=final%20performance)上均持续优于标准的令牌和序列聚合(https://huggingface.co/papers?q=sequence%20aggregation)。我们的进一步分析表明,令牌和序列聚合(https://huggingface.co/papers?q=sequence%20aggregation)的相对有效性主要受响应长度变化和正负长度差距的影响,这凸显了聚合作为 GRPO 风格 RLVR 中关键设计维度重要性。

查看 arXiv 页面 (https://arxiv.org/abs/2605.04077)查看 PDF (https://arxiv.org/pdf/2605.04077)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.04077)

在您的 Agent 中获取这篇论文:

hf papers read 2605\.04077

没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.04077 即可从此页面链接。

引用该论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.04077 即可从此页面链接。

引用该论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.04077 即可从此页面链接。

包含该论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)即可从此页面链接。

相似文章

面向进度与可靠性的智能体强化学习组策略优化

arXiv cs.AI

ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。

GAGPO:广义优势分组策略优化

arXiv cs.AI

GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。