聚焦于剩余优化空间,而非已掌握目标:多奖励策略优化中的饱和感知优势重加权
摘要
SA-MRPO 引入了一种饱和感知的优势重加权技术,用于强化学习中的多奖励策略优化,通过聚焦于未优化目标,提高了在数学推理、自适应推理和编程基准测试上的性能。
查看缓存全文
缓存时间: 2026/08/18 07:50
论文页面 - 学习未掌握而非已精通:多奖励策略优化的饱和感知优势重加权
来源:https://huggingface.co/papers/2608.16072
摘要
SA-MRPO 独立标准化多目标奖励,并通过自适应降低饱和目标的权重,将优化方向重新引导至未充分优化的目标。
使用群体相对优势的强化学习已成为语言模型推理器后训练的实际标准。然而,在优化多个奖励目标时,现有方法通常在群体标准化之前,使用固定加权和对奖励向量进行标量化。我们证明这种设计导致两个根本问题:具有不同奖励概况的轨迹可能获得相同的优势值,并且无论目标当前的饱和程度如何,所有目标都使用固定的相对权重进行优化。结果,训练持续为已解决的目标分配梯度预算,而不是专注于仍有较大提升空间的目标。我们提出了用于多奖励策略优化的饱和感知优势重加权(SA-MRPO),它独立标准化每个奖励目标,并根据批量级别的目标饱和度估计自适应地调整其贡献权重。这种方法动态地将优化努力重新分配到未充分优化的目标,同时在经验上保持对已充分满足目标的性能。我们进一步表明,饱和感知重加权可以反转更新方向的符号,而不仅仅是调整其幅度。在涉及两目标和三目标奖励组合的数学推理中,SA-MRPO 在 15 个基准比较中的 12 个上改进了较困难的正确性目标(相比 GDPO),在 AIME24 上提升高达 5%。在自适应推理中,它在所有五个基准上提高了准确性,平均提升 3.8%,在 AMC23 上高达 9.2%。在编程基准测试中,它将通过率提高了高达 2.3%,同时在所有设置中,较易目标都保持在其已满足的水平附近。
查看 arXiv 页面 (https://arxiv.org/abs/2608.16072) 查看 PDF (https://arxiv.org/pdf/2608.16072) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.16072)
在您的代理中获取此论文:
hf papers read 2608\.16072
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接本文
在模型的 README.md 中引用 arxiv.org/abs/2608.16072 以从此页面链接。
引用本文的数据集 0
没有数据集链接本文
在数据集的 README.md 中引用 arxiv.org/abs/2608.16072 以从此页面链接。
引用本文的 Space 0
没有 Space 链接本文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.16072 以从此页面链接。
包含本文的收藏集 0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
Don't Mix Rewards, Mix Policies: Policy Decomposition and Optimization for Multi-Reward RL
This paper proposes PRISM, a multi-reward RL framework that decomposes policy space rather than mixing rewards, improving multi-reward optimization and enabling inference-time controllability. Experiments on reasoning and alignment tasks show it outperforms existing baselines.
STARE:惊奇度引导的令牌级优势重加权实现策略熵稳定性
STARE 通过引入惊奇度引导的令牌级优势重加权和目标熵调节,解决了基于GRPO的大语言模型强化学习中的策略熵崩溃问题,在AIME基准上实现了4%-8%的准确率提升。
面向多模态推理的结构化角色感知策略优化
本文介绍了结构化角色感知策略优化(SRPO),该方法通过在大视觉-语言模型的强化学习框架内,根据感知和推理的不同角色分配令牌级信用,从而提升多模态推理能力。
SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation
SMOPD proposes a two-stage specialize-and-merge online policy distillation method to improve multi-reward reinforcement learning, addressing issues with sparse and dense reward signals where GDPO struggles. It outperforms GDPO across 1.5B, 3B, and 7B backbones in complementary and conflicting reward settings.
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。