同策略优化中验证器诱导的支持重塑

arXiv cs.LG 论文

摘要

本文介绍了验证器诱导的支持重塑,表明具有可验证奖励的同策略强化学习能够在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样。跨数学推理和指令跟随的实验表明,端点改进并不能保证未来的可训练性。

arXiv:2608.00220v1 公告类型:新 摘要:我们表明,基于可验证奖励的同策略强化学习(RLVR)可以在优化当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样和强化。我们将其称为验证器诱导的支持重塑,并将有效可奖励支持定义为在固定 rollout 预算内可到达的成功轨迹。在两个模型系列中,我们通过重复的验证器评分采样和在数学推理与受约束指令跟随上的双向训练(包括使用相反验证器的顺序训练)来研究这种效应。Math-RLVR 提高了平均指令跟随成功率,但减少了在重复采样下有任何成功响应的提示数量。在 IFEval 上使用 Qwen3-8B-Base 时,pass@1 上升了 6.5 个百分点,而 best@32 下降了 9.8 个百分点,同样的分歧出现在两个模型和 IF 基准上。相反,IF-RLVR 将数学响应从逐步开头转向直接答案,降低了各种采样预算下的 best@k,并减少了后续 Math-RLVR 的奖励变化。令牌分布分析和受控开头干预表明,这些变化集中在响应的前几个令牌。RLVR 主要对基础策略中已有的开头进行重新排序,且所选开头对数学可搜索性有因果影响。所测试的参考策略约束、路由先验和同策略蒸馏仅部分保留了跨任务支持;MathIF 和 ReasonIF 表明,边际收益仅部分转化为既正确又符合约束的响应。因此,在同策略优化下,端点改进并不能保证未来的可训练性或联合能力。代码可在 https://github.com/sylvain-wei/verifier-induced-support-reshaping 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:37

# 同策略优化中验证器引发的支持重塑
来源:https://arxiv.org/html/2608.00220
机构:北京大学
报告类型:PKU ICL 技术报告
报告编号:PKU-AI-TR-2026-001
报告日期:2026-07
报告版本:v1.0
PKU AI 标志文件:assets/pku-horizontal-logo.pdf
GitHub 页面:https://github.com/sylvain-wei/verifier-induced-support-reshaping
通讯作者:Houfeng Wang ([email protected]) 和 Shaohang Wei ([email protected])
作者:Zikun Su、Feifan Song、Wen Luo、Wei Li、Guangyue Peng、Houfeng Wang
1北京大学,2北京邮电大学

###### 摘要

我们证明,具有可验证奖励的同策略强化学习(RLVR)可以在提升当前目标的同时,使后续目标的成功行为变得过于稀少而难以采样和强化。我们将这一现象称为验证器引发的支持重塑(verifier-induced support reshaping),并将有效可奖励支持(effective rewardable support)定义为在固定 rollout 预算内可达到的成功轨迹。在两个模型家族上,我们通过重复的验证器评分采样和双向训练来研究这一效应,涵盖数学推理和受约束指令跟随,包括使用相反验证器的顺序训练。Math-RLVR 提高了平均指令跟随成功率,但减少了在重复采样下存在任何成功响应的提示数量。在 Qwen3-8B-Base 的 IFEval 上,pass@1 上升了 6.5 个百分点,而 best@32 下降了 9.8 个百分点;同样的分歧也出现在两个模型和 IF 基准上。相反,IF-RLVR 将数学响应从逐步展开的开头转向直接答案,降低了各采样预算下的 `best@k`,并减少了后续 Math-RLVR 的奖励变化。Token 分布分析和受控开头干预表明,这些变化集中在响应的前几个 token。RLVR 主要对基础策略中已有的开头进行重新排序,而所选择的开头对数学可搜索性有因果影响。所测试的参考策略约束、路由先验和同策略蒸馏只能部分保留跨任务支持;MathIF 和 ReasonIF 表明,边际收益只能部分转化为既正确又符合约束的响应。因此,端点改进并不保证同策略优化下的未来可训练性或联合能力。

## 1 引言

连续的后训练阶段将基础模型训练转变为一个持续学习问题。对齐和强化学习反复将共享策略适配到数学推理、代码生成和指令跟随等目标上(Ouyang et al.,2022 (https://arxiv.org/html/2608.00220#bib.bib17); Shao et al.,2024 (https://arxiv.org/html/2608.00220#bib.bib24); Guo et al.,2025a (https://arxiv.org/html/2608.00220#bib.bib5); Yang et al.,2024 (https://arxiv.org/html/2608.00220#bib.bib34); Pyatkin et al.,2025 (https://arxiv.org/html/2608.00220#bib.bib20); Li et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib13))。每个阶段都应既保留现有能力,也保留学习后续目标的能力(Kirkpatrick et al.,2017 (https://arxiv.org/html/2608.00220#bib.bib10); Parisi et al.,2019 (https://arxiv.org/html/2608.00220#bib.bib18))。近期研究发现,在目标任务性能相当的情况下,同策略强化学习通常比监督微调更能保留非目标性能(Shenfeld et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib25); Chen et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib2); Lai et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib12))。然而,这些证据主要是回顾性的,回答的是适配之后还剩多少性能。

图 1:验证器重塑了同策略训练下一步可以学习的内容。左图:灾难性遗忘回顾的是已保留性能;支持重塑前瞻的是未来可训练性。中图:在任务 A 上训练会改变任务 B 的起始支持(顶部)和提示结束时的隐藏状态(底部)。右图:我们使用 Math-RLVR 和 IF-RLVR 测试两种顺序。

持续 RLVR 因此有一个前瞻性要求:后续目标的成功行为必须在当前策略下仍然可以到达。具有可验证奖励的强化学习(RLVR)从当前策略采样的轨迹出发,并由验证器评分来更新策略(Schulman et al.,2017 (https://arxiv.org/html/2608.00220#bib.bib23); Shao et al.,2024 (https://arxiv.org/html/2608.00220#bib.bib24))。一个成功行为可能仍然存在,但在有限的 rollout 预算内变得过于稀少而无法出现,从而使后续目标几乎得不到正向训练信号。我们将这种变化称为*支持重塑*,并将*有效可奖励支持*定义为在指定预算下仍足够可能被采样的奖励为正的轨迹。这一视角不同于灾难性遗忘:遗忘衡量的是已学习任务上的性能能否在后续训练中存活,而支持重塑衡量的是未来任务的成功轨迹在该任务被优化之前是否仍可被发现。如图 1 所示,我们的问题不仅是一个验证器现在提升了什么,还包括它给下一步留下了什么可学习的内容。我们通过对数学推理和受约束指令跟随进行受控的双向比较来研究这一要求。两者都是核心的后训练目标,具有可编程检查的奖励,但使用不同的成功标准。数学验证器检查最终答案的正确性,同时保留解题路线的开放性;而 IF 验证器评估对显式响应约束的遵守情况(Shao et al.,2024 (https://arxiv.org/html/2608.00220#bib.bib24); Pyatkin et al.,2025 (https://arxiv.org/html/2608.00220#bib.bib20))。已有研究也观察到推理与指令跟随在评估时存在张力,这使得该任务对成为研究跨任务效应的有用场景(Fu et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib4); Li et al.,2025 (https://arxiv.org/html/2608.00220#bib.bib14))。我们从相同的基础策略出发,用一个分支进行 Math-RLVR 训练并测量 IF 支持,用另一个分支进行 IF-RLVR 训练并测量数学支持。然后,我们用相反的验证器继续训练每个分支,以检验第一阶段的支持迁移是否限制了后续学习。这种双向设计揭示了跨任务效应是否随训练方向而改变。我们的结果表明,优化一个验证器会改变另一个验证器仍能采样和强化的成功行为。Math-RLVR 提高了 IF 的 pass@1,但降低了 best@32,因为更多提示会走向一致成功或完全失败。IF-RLVR 降低了数学的 `best@k`,并约束了后续的 Math-RLVR,同时数学响应从逐步展开的开头转向直接答案。分布分析和受控干预进一步表明,主要变化发生在响应的前几个 token,其中开头的选择对数学可搜索性具有因果影响。在测试的设置中,顺序训练、参考策略约束、路由先验和同策略蒸馏(OPD)只能部分保留受影响的支持,或者以牺牲目标任务收益为代价来保留。MathIF(Fu et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib4)) 和 ReasonIF(Kwon et al.,2026 (https://arxiv.org/html/2608.00220#bib.bib11)) 上的结果进一步表明,数学或指令跟随的提升只能部分转化为同时满足两者的响应。我们做出以下贡献:

- •**RLVR 中的支持重塑。**我们从未来可训练性的角度来界定持续 RLVR,并通过重复的验证器评分采样来度量有效可奖励支持。在两个模型家族上,我们的双向 Math/IF 实验表明,Math-RLVR 使 IF 支持两极分化,而 IF-RLVR 降低了数学可搜索性并约束了后续 Math-RLVR。
- •**响应开头的因果作用。**我们将跨任务变化定位到响应的前几个 token,并发现 RLVR 主要对基础策略中已有的开头选项进行重新排序。受控路线干预表明,开头的选择对数学可搜索性具有因果影响,支持“路线选择变化”而非“推理能力广泛抹除”的解释。
- •**支持保留的局限性。**我们评估了顺序训练、参考策略约束、路由先验和 OPD,发现它们只能部分保留未来支持,或以牺牲目标任务收益为代价来保留。MathIF 和 ReasonIF 进一步表明,数学或指令跟随的提升并不会按比例转化为同时满足两者的响应。

## 2 相关工作

**可验证奖励与推理后训练。**具有可验证奖励的强化学习(RLVR)已成为在大语言模型上改进数学、编程和通用推理任务的重要后训练方法

相似文章

超越熵:通过对比策略优化的正确性感知优势塑造

Hugging Face Daily Papers

本文介绍了对比策略优化(CPO),该方法利用参考引导和普通生成分布之间的token级对比差异,在具有可验证奖励的强化学习中进行正确性感知的优势塑造。CPO在域内和域外基准测试中均优于基于熵的RLVR方法。

AgentV-RL:用智能体验证器扩展奖励建模

arXiv cs.CL

AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。

通过直接在线策略蒸馏实现弱到强泛化

Hugging Face Daily Papers

Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。