BiasGRPO:通过群体相对策略优化稳定高方差奖励环境中的偏见缓解
摘要
BiasGRPO 提出了一种利用群体相对策略优化(GRPO)的框架,通过对采样补全结果的奖励进行归一化,稳定 LLM 中社会偏见的缓解过程,在多个基准测试上优于 DPO 和 PPO。作者还发布了一个计算高效的偏见奖励模型,可无缝集成到多目标 RLHF 流水线中。
arXiv:2606.04807v1 公告类型:新论文
摘要:缓解大型语言模型(LLMs)中的社会偏见是一项独特的对齐挑战:与可验证的任务不同,偏见缺乏单一的基准真相,从而形成高方差、主观性强的奖励环境。此前基于偏好的微调方法存在明显的权衡取舍:直接偏好优化(DPO)受限于离线训练固有的探索不足,而近端策略优化(PPO)则可能因评论模型估计不可靠而导致训练不稳定。在本文中,我们提出 BiasGRPO,这是一种利用群体相对策略优化(GRPO)的框架,通过对一组采样补全结果的奖励进行归一化来稳定对齐过程。通过用群体相对基线替代价值函数,我们的方法在降低训练不稳定性的同时,保留了在线训练的探索优势。实验表明,BiasGRPO 在多个基准测试上均优于 DPO 和 PPO,验证了其有效性。为适配 GRPO,我们对一个涵盖多领域和多场景的数据集进行了合成扩展。此外,我们还创建并发布了一个自定义偏见奖励模型,该模型能有效引导文本生成,同时具备高计算效率、避免知识退化的特点,可作为宝贵资源无缝集成到多目标 RLHF 流水线中。
查看缓存全文
缓存时间: 2026/06/05 02:09
# BiasGRPO:通过组相对策略优化稳定高方差奖励景观中的偏见缓解
来源:https://arxiv.org/html/2606.04807
Saket Reddy、Ke Yang、ChengXiang Zhai,伊利诺伊大学厄巴纳-香槟分校,\{saketr3, key4, czhai\}@illinois\.edu
###### 摘要
缓解大型语言模型(LLMs)中的社会偏见是一项独特的对齐挑战:与可验证任务不同,偏见缺乏唯一的基准答案,由此形成了高方差、主观性强的奖励景观。现有的基于偏好的微调方法存在重大权衡:直接偏好优化(DPO)受限于离线训练固有的探索不足,而近端策略优化(PPO)则可能因批评模型估计不可靠而导致训练不稳定。本文提出 BiasGRPO,这是一个利用组相对策略优化(GRPO)的框架,通过对一组采样补全的奖励进行归一化来稳定对齐过程。通过用组相对基线替代价值函数,我们的方法在保持在线训练探索优势的同时降低了训练不稳定性。实验表明,BiasGRPO 在多个基准测试上优于 DPO 和 PPO,验证了其有效性。为适配 GRPO,我们对跨多个领域和情境的数据集进行了合成扩展。我们还创建并发布了一个自定义偏见奖励模型,该模型能有效引导生成过程,同时具有极高的计算效率,并能避免知识退化,为多目标 RLHF 流水线提供了宝贵的即插即用资源,可无缝集成而不与其他目标冲突或增加额外计算开销。
BiasGRPO:通过组相对策略优化稳定高方差奖励景观中的偏见缓解
Saket Reddy、Ke Yang、ChengXiang Zhai,伊利诺伊大学厄巴纳-香槟分校,\{saketr3, key4, czhai\}@illinois\.edu
## 1 引言
在预训练阶段,大型语言模型(LLMs)会从训练所用的大规模文本语料库中继承社会偏见。Navigli 等人(2023 (https://arxiv.org/html/2606.04807#bib.bib1))将其定义为针对特定群体的偏见、刻板印象和歧视性态度,涵盖种族、性别、社会经济地位等方面的偏见。这种内化的偏见带来了重大的伦理和技术风险,可能导致在简历筛选和内容审核等关键下游应用中出现歧视性行为,从而加剧边缘群体所面临的不平等(Guo 等人,2024b (https://arxiv.org/html/2606.04807#bib.bib2);Liu 等人,2025 (https://arxiv.org/html/2606.04807#bib.bib3))。由于数据过滤等临时性解决方案往往不够充分或难以跨任务泛化,学界对将偏见缓解直接整合到模型优化过程中、使训练目标与期望行为约束相一致的方法兴趣日益增长(Gallegos 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib4))。
基于偏好的微调已成为解决 LLMs 偏见问题的一种方案,因为它能够在多种情境下引导 LLM 的生成行为。然而,目前针对偏见缓解研究的基于偏好的技术——直接偏好优化(DPO)(Allam,2024 (https://arxiv.org/html/2606.04807#bib.bib5))和近端策略优化(PPO)(Faal 等人,2022 (https://arxiv.org/html/2606.04807#bib.bib6))——存在重大权衡。DPO 是一种离线算法,依赖于对静态成对样本的优化,导致泛化能力较弱(Lin 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib7))。PPO 具有更强的泛化能力,但需要训练单独的批评模型来引导训练过程中的模型更新,在噪声奖励景观中可能导致训练不稳定(Huang 等人,2025 (https://arxiv.org/html/2606.04807#bib.bib8))。目前尚无针对偏见缓解研究的基于偏好的微调技术能够平衡这些权衡(Gallegos 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib4))。
由 DeepSeek 提出的组相对策略优化(GRPO)是一种能够平衡 DPO 和 PPO 权衡的优选技术(Shao 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib9))。它保留了 PPO 的在线探索能力,从而实现更强的泛化。它与 PPO 的不同之处在于摒弃了批评模型,转而基于一组补全的平均奖励来引导模型更新,从而产生更稳定的更新。然而,GRPO 目前主要在数学和编程等可验证领域得到研究和应用,在偏见缓解等主观领域的应用尚不充分(Jia 等人,2025 (https://arxiv.org/html/2606.04807#bib.bib10))。
在本工作中,我们提出 BiasGRPO,这是一个利用组相对策略优化来解决现有基于偏好的偏见缓解策略局限性的应用框架。我们将 BiasGRPO 定义为由三个组件构成的流水线:合成扩展的数据集、自定义的偏见专用奖励模型以及基础 GRPO 算法。我们表明,BiasGRPO 的成功源于组相对优化的内在机制与偏见缓解任务特性之间的高度契合。我们的贡献体现在以下两个方面:
- • 首先,我们证明基础 GRPO 算法相比 DPO 和 PPO,**更适合偏见缓解的高方差景观**。
- • 其次,我们引入了一个稳健的 GRPO 框架。我们在 Hugging Face 上发布了跨越 11 个领域的多样化数据集以及**自定义偏见奖励模型**([数据集](https://huggingface.co/datasets/SaketR1/bias-grpo-data),[奖励模型](https://huggingface.co/SaketR1/bias-reward-model))。通过设计一个计算效率极高(仅 0.1B 参数)且能避免知识退化的奖励模型,我们提供了一个**即插即用的资源**,可**无缝集成到复杂的多目标 RLHF 流水线中**,而不会与其他目标产生冲突或带来额外的计算开销。因此,该奖励模型**降低了使用门槛,使更多研究者能够**在不牺牲计算资源或模型能力的前提下,将稳健的偏见缓解方法集成到其 RLHF 流水线中。
参见图注图 1:针对一个明显带有偏见的提示,DPO、PPO 和 GRPO 训练设置的对比(在该提示下,策略模型更可能只生成带有偏见的补全)。在 DPO 中,策略模型不生成自己的文本,导致学习信号较弱。在 PPO 中,由于优势估计基于单一奖励和可能不可靠的批评模型,方差较高,同样导致学习信号较弱。在 GRPO 中,基于相对归一化计算多个优势估计,从而产生更好的学习信号。
## 2 背景与相关工作
### 2\.1 直接偏好优化与近端策略优化
在 DPO 方法中,首先构建一个偏好对数据集,其中包含提示及对应的优选和非优选补全。DPO 随后训练语言模型,使其对数据集中每个提示的优选补全 token 的对数概率最大化,同时使非优选补全 token 的对数概率最小化(Rafailov 等人,2023 (https://arxiv.org/html/2606.04807#bib.bib12))。本文专门测试了 DPO 的身份偏好优化(IPO)变体,因为 Allam(2024 (https://arxiv.org/html/2606.04807#bib.bib5))已证明 IPO 是 DPO 各变体中在偏见缓解方面最有效的。IPO 与 DPO 的细微差别在于在 DPO 损失函数中添加了一个正则化项,通过控制优选与非优选补全对数似然比之间的差距来防止过拟合(Azar 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib13))。
由于模型不生成自己的补全,DPO 被认为是一种离线技术(Rafailov 等人,2023 (https://arxiv.org/html/2606.04807#bib.bib12))。使用预先收集的数据集使 DPO 不易出现与强化学习(RL)技术相关的奖励破解和训练不稳定问题(Allam,2024 (https://arxiv.org/html/2606.04807#bib.bib5))。然而,依赖固定数据集也导致较低的泛化能力,因为模型缺乏通过生成自己的补全来探索环境的能力(Lin 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib7))。
相比之下,PPO 方法是一种基于人类反馈的强化学习(RLHF)技术,即利用 RL 和偏好数据将模型与人类价值观对齐的过程。在 PPO 方法中,基于偏好数据训练一个奖励模型,该模型为提示补全分配奖励以表示其质量(Ouyang 等人,2022 (https://arxiv.org/html/2606.04807#bib.bib14))。在训练过程中,被训练的语言模型(称为策略模型)为每个提示生成自己的补全,由奖励模型进行评分。与策略模型联合训练的批评模型(也称价值模型)随后计算补全的价值。然后利用奖励和价值,通过广义优势估计(GAE)(Schulman 等人,2016 (https://arxiv.org/html/2606.04807#bib.bib34))计算优势,即衡量生成的补全相比平均补全好坏程度的指标。策略模型随后根据优势估计进行更新。
类似于 IPO 对于 DPO 的作用,KL 散度(Kullback-Leibler 散度)通常在 PPO 中用于防止模型过拟合于奖励模型(Ouyang 等人,2022 (https://arxiv.org/html/2606.04807#bib.bib14))。具体而言,衡量新策略与旧策略差异程度的 KL 散度项被作为惩罚项添加到每个奖励中。
由于策略模型被允许生成自己的补全,PPO 被认为是一种在线方法。这种在线特性通常带来更好的泛化能力,因为策略模型能够通过生成自己的补全更充分地探索环境(Ouyang 等人,2022 (https://arxiv.org/html/2606.04807#bib.bib14))。然而,批评模型的价值估计可能不可靠,尤其是在偏见缓解等细微差别丰富的领域,这可能导致训练不稳定和性能不可靠(Huang 等人,2025 (https://arxiv.org/html/2606.04807#bib.bib8))。
### 2\.2 组相对策略优化
DeepSeek 提出的另一种 RLHF 技术是 GRPO(Shao 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib9))。GRPO 的工作方式与 PPO 相同,但不使用批评模型或价值估计。取而代之的是,对于每个提示,策略模型生成一组补全。优势是一个归一化分数,将组中每个补全的奖励与整组的平均奖励进行比较,从而为训练提供更清晰、更直接的信号(Shao 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib9))。本文测试了常用的组大小为四的设置。
优势计算如下所示。其中,$\hat{A}_{i,t}$ 是第 $i$ 个补全中所有 token 的优势估计,通过对奖励 $r_i$ 归一化计算得出。$\mathbf{r}$ 表示该组补全的奖励集合。
$$\hat{A}_{i,t}=\widetilde{r}_{i}=\frac{r_{i}-\text{mean}(\mathbf{r})}{\text{std}(\mathbf{r})},\tag{1}$$
GRPO 能够兼具 DPO 的稳定性优势和 PPO 的泛化优势。GRPO 通过允许策略模型生成自己的补全来实现泛化,从而对环境进行灵活探索。与此同时,GRPO 还通过基于一组补全的均值和标准差计算优势(而非依赖独立的批评模型)来提供稳定性,从而创造更清晰、更可靠的信号(Shao 等人,2024 (https://arxiv.org/html/2606.04807#bib.bib9))。
近期,GRPO 的变体(如 SR-GRPO(Tang and Yang,2025 (https://arxiv.org/html/2606.04807#bib.bib35))和 DaGRPO(Xie 等人,2025 (https://arxiv.org/html/2606.04807#bib.bib36)))相继涌现,旨在改进基础算法。尽管这些方法提供了令人期待的改进,但我们的工作专注于 GRPO 的基础公式。我们的首要目标是证明组相对优化技术这一基础方法族从根本上比传统的 DPO 或 PPO 方法更适合偏见缓解这一主观、高方差的景观。将 GRPO 与 DPO 和 PPO 进行比较,能够孤立地证明这一算法优势,而引入更复杂的 GRPO 变体则会模糊这一主要贡献,使工作重心偏离强调组相对优化本身优势的核心目标。
## 3 方法
### 3\.1 组相对信号在偏见缓解中的优势
除了平衡 DPO 和 PPO 的权衡之外,我们认为 GRPO 的组相对机制特别适合社会偏见的主观性和多变性。在客观领域,一个提示通常只有一个正确答案。相比之下,偏见缓解需要在潜在响应的广谱中导航,从高度有害的内容到微妙的微侵犯,再到安全的拒绝回答。从语义上看,策略模型在 GRPO 下生成的一组补全代表了对这一安全景观的局部探索。通过为同一敏感提示生成多种变体响应,策略模型无需识别出一个"完美"的无偏见响应(这本身就难以定义),而是可以学会识别其潜在输出中哪些相对而言偏见较少、更为尊重。
例如,假设一个特别带有偏见的提示使策略模型更可能生成带有偏见的补全。DPO、PPO 和 GRPO 训练流水线的示意图如图 1 (https://arxiv.org/html/2606.04807#S1.F1) 所示。在 DPO 流水线中,策略模型不会生成自己的补全,导致学习信号较弱。在 PPO 流水线中,策略模型很可能为该提示生成一个有偏见的补全并受到惩罚,但没有关于如何更好处理该提示的明确信号。相比之下,在 GRPO 流水线中,策略模型会生成一组补全。即使所有生成的补全都带有偏见,相对归一化也能确保偏见最少的补全(在图 1 (https://arxiv.org/html/2606.04807#bib.bib1) 中为补全 $o_4$)获得正优势,使策略模型即便在生成了有偏见的补全的情况下仍能提取到学习信号。
参见图注图 2:使用 5% 滚动窗口比较 PPO 和 BiasGRPO 训练过程中奖励标准差的对比。BiasGRPO 的标准差远低于 PPO,体现了其稳定性。为了从实证角度验证这一优势,我们可以观察 PPO 和 BiasGRPO 训练运行过程中的训练动态。在高方差、主观性强的景观中,传统批评模型难以建立可靠的基线。这一现象在我们的 PPO 训练中得到了印证——批评模型的价值损失仅从 0.2507 小幅下降至 0.2134。由于批评模型难以对期望回报建模,优势估计变得嘈杂,导致策略更新不稳定。这种不稳定性体现在 PPO 奖励的标准差上——如图 2 (https://arxiv.org/html/2606.04807#S3.F2) 所示,其标准差仅从 0.1703 下降至 0.1279(平均值为 0.1434)。
相比之下,通过移除批评模型……相似文章
平衡聚合:理解与修复 GRPO 中的聚合偏差
本文指出了 GRPO 风格的大语言模型强化学习中存在的聚合偏差问题,并提出了平衡聚合(Balanced Aggregation, BA)方法。该方法通过对正负子集分别计算 token 级均值,从而提高了训练稳定性和最终性能。
多模块 GRPO:组合策略梯度与提示优化的语言模型程序方法
本文提出 mmGRPO,一种多模块扩展的群体相对策略优化(GRPO)方法,通过优化语言模型调用和提示来提升模块化 AI 系统的准确率。实验表明,该方法在各类任务上平均带来 11% 的准确率提升,并在 DSPy 中提供了开源实现。
面向进度与可靠性的智能体强化学习组策略优化
ProGPO是一种免学习评论器的方法,用于LLM智能体基于组的RL中的步骤级优势估计,它使用精确前缀动作比较和基于rollout的状态势,以改善长视界任务上的信用分配。在ALFWorld和WebShop上使用Qwen2.5模型的实验表明,它优于现有的智能体RL基线。
GAGPO:广义优势分组策略优化
GAGPO提出了一种无评论家的强化学习方法,在多方交互的自主任务中,利用非参数分组价值代理进行步级信用分配,在ALFWorld和WebShop上超越了强基线模型。
F-GRPO: 分解式组相对策略优化用于统一候选生成与排序
F-GRPO 提出了一种分解式组相对策略优化框架,将候选生成与排序统一在单个自回归LLM中,解决了信用分配问题,并在序列推荐和多跳问答基准上提升了顶级性能。