聚焦于剩余优化空间,而非已掌握目标:多奖励策略优化中的饱和感知优势重加权

Hugging Face Daily Papers 论文

摘要

SA-MRPO 引入了一种饱和感知的优势重加权技术,用于强化学习中的多奖励策略优化,通过聚焦于未优化目标,提高了在数学推理、自适应推理和编程基准测试上的性能。

基于组相对优势的强化学习(RL)已成为训练后语言模型推理器的事实标准。然而,在优化多个奖励目标时,现有方法通常在组标准化之前,使用固定加权和将奖励向量标量化。我们证明了这种设计会导致两个根本问题:具有不同奖励分布的样本可能获得相同的优势值,并且所有目标都使用固定的相对权重进行优化,而不考虑它们当前的饱和度水平。因此,训练继续将梯度预算分配给已解决的目标,而不是关注那些有更大提升空间的目标。我们引入了用于多奖励策略优化的饱和感知优势重加权(SA-MRPO),它独立标准化每个奖励目标,并根据目标饱和度的批量级估计自适应地降低其贡献。这动态地将优化努力重新分配到未优化目标,同时在实践中保持那些已充分满足目标的性能。我们进一步证明,饱和感知重加权可以改变更新的方向,而不仅仅是缩放其幅度。在具有两目标和三目标奖励组合的数学推理中,SA-MRPO 在 15 个基准比较中有 12 个改进了较难的正确性目标,比 GDPO 更好,AIME24 上提升高达 5%。在自适应推理中,它在所有五个基准测试上提高了准确性,平均提升 3.8%,AMC23 上高达 9.2%,在编程基准测试中通过率提升高达 2.3%,同时在所有设置中将较容易的目标保持在已满足水平附近。
查看原文
查看缓存全文

缓存时间: 2026/08/18 07:50

论文页面 - 学习未掌握而非已精通:多奖励策略优化的饱和感知优势重加权

来源:https://huggingface.co/papers/2608.16072

摘要

SA-MRPO 独立标准化多目标奖励,并通过自适应降低饱和目标的权重,将优化方向重新引导至未充分优化的目标。

使用群体相对优势的强化学习已成为语言模型推理器后训练的实际标准。然而,在优化多个奖励目标时,现有方法通常在群体标准化之前,使用固定加权和对奖励向量进行标量化。我们证明这种设计导致两个根本问题:具有不同奖励概况的轨迹可能获得相同的优势值,并且无论目标当前的饱和程度如何,所有目标都使用固定的相对权重进行优化。结果,训练持续为已解决的目标分配梯度预算,而不是专注于仍有较大提升空间的目标。我们提出了用于多奖励策略优化的饱和感知优势重加权(SA-MRPO),它独立标准化每个奖励目标,并根据批量级别的目标饱和度估计自适应地调整其贡献权重。这种方法动态地将优化努力重新分配到未充分优化的目标,同时在经验上保持对已充分满足目标的性能。我们进一步表明,饱和感知重加权可以反转更新方向的符号,而不仅仅是调整其幅度。在涉及两目标和三目标奖励组合的数学推理中,SA-MRPO 在 15 个基准比较中的 12 个上改进了较困难的正确性目标(相比 GDPO),在 AIME24 上提升高达 5%。在自适应推理中,它在所有五个基准上提高了准确性,平均提升 3.8%,在 AMC23 上高达 9.2%。在编程基准测试中,它将通过率提高了高达 2.3%,同时在所有设置中,较易目标都保持在其已满足的水平附近。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16072) 查看 PDF (https://arxiv.org/pdf/2608.16072) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.16072)

在您的代理中获取此论文:

hf papers read 2608\.16072

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2608.16072 以从此页面链接。

引用本文的数据集 0

没有数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2608.16072 以从此页面链接。

引用本文的 Space 0

没有 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.16072 以从此页面链接。

包含本文的收藏集 0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

面向多模态推理的结构化角色感知策略优化

arXiv cs.AI

本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。

SLPO:通过代理策略扩展潜在推理

Hugging Face Daily Papers

介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。