仅需8个令牌:通过辅助分支实现弱到强的离策略强化学习
摘要
提出了W2SPO,一种离策略强化学习方法,通过将来自较弱模型的短辅助片段注入目标模型轨迹,以多样化探索并改善推理,在数学基准测试上实现了更好的性能和训练加速。
arXiv:2607.16205v1 公告类型:新
摘要:基于可验证奖励的强化学习已成为增强大型语言模型推理能力的标准方法,通常通过对比多个自生成轨迹来优化策略。然而,我们发现了这种范式中的一个关键支持限制瓶颈:在具有挑战性的推理任务上,目标模型的样本往往表现出语义冗余,收敛到相同的错误“推理盆地”,这些盆地为策略更新提供的奖励对比微不足道。在本文中,我们提出通过弱到强学习范式来克服这一限制,其中策略的探索由较弱的但计算高效的辅助模型指导。我们引入了W2SPO,一种离策略强化学习方法,它将通常短至8个令牌的短辅助片段注入中间目标模型轨迹,然后目标模型从这些转移状态完成推理路径。策略更新仅限于这些插入的短片段,基于最终可验证奖励。实验上,W2SPO在数学推理基准测试中,在评估的4B规模模型中取得了优越的性能,优于评估的后训练基线。与相同采样预算下的原始GRPO相比,W2SPO将Pass@1从62.3%提升至64.2%,同时实现了3.55倍的训练加速。这些结果表明,弱辅助分支可以通过扩展局部探索支持来诱导更强的目标推理策略。
查看缓存全文
缓存时间: 2026/07/21 06:37
# 仅需8个Token:通过辅助分支实现的弱到强离线策略强化学习 来源:https://arxiv.org/html/2607.16205 Dayu Wang1,2 Jiaye Yang1 Weikang Li1 Jiahui Liang1 Liwei Qian1 Xin Pei1 Jizhou Huang1 1 百度公司 2 南洋理工大学 [email protected] [email protected] [email protected] {liangjiahui03, qianliwei, Xin Pei,huangjizhou01}@baidu.com ###### 摘要 基于可验证奖励的强化学习已成为增强大型语言模型推理能力的标准方法,通常通过对比多个自生成轨迹来优化策略。然而,我们识别出该范式中的一个关键支持限制瓶颈:在具有挑战性的推理任务上,目标模型的样本常常表现出语义冗余,收敛到相同的错误“推理盆地”,这为策略更新提供的奖励对比可以忽略不计。在本文中,我们提出通过弱到强学习范式来克服这一限制,在该范式中,策略的探索由一个更弱但计算高效的辅助模型指导。我们引入W2SPO,一种离线策略RL方法,它将短的辅助片段(通常短至8个token)注入到中间目标模型轨迹中,然后目标模型从这些转移状态完成推理路径。策略更新基于最终的可验证奖励仅限于这些插入的短片段。经验上,W2SPO在评估的4B规模模型上,在数学推理基准测试中实现了优越的性能,优于评估的各种后训练基线。与相同采样预算下的标准GRPO相比,W2SPO将Pass@1从62.3%提升到64.2%,同时实现了3.55倍的训练加速。这些结果表明,弱的辅助分支可以通过扩展局部探索支持来诱导更强的目标推理策略。代码和数据可在 https://anonymous.4open.science/r/W2SPO-1B86/ 获得。 ## 1 引言 参见图注 图1:W2SPO 概述。标准 GRPO 依赖于来自目标模型的自生成轨迹,这在困难的推理问题上可能语义冗余并产生全错的轨迹组。W2SPO 通过将短的辅助分支插入到中间目标模型前缀中来局部扩展轨迹支持,然后让目标模型完成解决方案。验证器奖励分配给完成的轨迹,而策略更新仅应用于短的分支段。 基于可验证奖励的强化学习已成为改进语言模型推理的核心方法 (Shao et al., 2024#bib.bib1; Guo et al., 2025a#bib.bib2; Song et al., 2025b#bib.bib3)。诸如 PPO 和 GRPO 风格训练的方法使用结果奖励从采样推理迹中优化模型,允许模型发现替代解决方案路径,而无需模仿固定的监督迹 (Wen et al., 2025#bib.bib4; Cobbe et al., 2021#bib.bib5)。然而,这些方法严重依赖于目标模型的自生成轨迹。在标准 GRPO 中,当前策略对同一问题采样多个轨迹并根据组内相对优势更新模型。这个过程假设采样的轨迹足够多样化和信息丰富 (Wang et al., 2023#bib.bib6)。对于困难的推理问题,这个假设经常失败:目标模型的轨迹可能在词汇上看起来不同,但遵循类似的中间逻辑,进入相同的错误推理盆地,并以相似的方式失败 (Dang et al., 2025#bib.bib7)。因此,瓶颈不仅仅是采样预算不足,而是轨迹分布的有限覆盖 (Yue et al., 2025#bib.bib8; Brown et al., 2024#bib.bib9)。这种支持限制以两种方式削弱推理RL (Dong et al., 2026#bib.bib10)。当所有轨迹都错误时,组内提供的有用奖励很少对比 (Chen et al., 2026#bib.bib11)。即使奖励不同,变化也可能仍然局限于目标模型当前推理分布的狭窄区域内,导致RL加强现有行为,而不是发现低概率的推理转向,这可能会将轨迹引导向正确解决方案 (Li et al., 2026#bib.bib12)。这激发了一种不同形式的探索:不是简单地增加自生成轨迹的数量,我们能否局部扩展目标模型的轨迹支持,同时仍然让目标模型完成长程推理过程?我们研究一种弱到强的替代方案 (Burns et al., 2023#bib.bib17; Wang et al., 2026#bib.bib18)。我们不使用辅助模型作为教师,而是将其用作局部探索提议者 (Hsieh et al., 2023#bib.bib19)。我们的关键观察是,即使一个较弱的辅助模型的完整解决方案次于目标模型,它仍然可以提供有用的短推理片段 (Lee et al., 2024#bib.bib20)。这样的片段可以将目标模型从其主导推理模式中扰动出来,并进入一个不同的延续盆地 (Chia et al., 2024#bib.bib21)。在插入片段后,目标模型恢复生成并负责完成长程推理路径。因此,辅助模型不需要解决问题;它只需要提出局部分支来扩展目标模型的探索支持 (Yao et al., 2023#bib.bib23)。受此观察启发,我们提出 W2SPO,一种通过辅助分支进行推理模型的弱到强离线策略RL方法 (Hou et al., 2025#bib.bib30)。给定一个问题,目标模型首先生成一个中间推理前缀。然后,我们在中间状态从目标模型和辅助模型中采样短分支 (Wei et al., 2022#bib.bib31)。在我们的主要实例中,每个辅助分支仅包含8个token。目标模型从插入的分支继续生成完整的解决方案,并由验证器或基于规则的奖励评分 (Wang et al., 2024#bib.bib33)。由此产生的奖励估计了局部分支的值,并且策略更新应用于分支段而不是整个延续 (Setlur et al., 2024#bib.bib34)。我们的贡献总结如下: - **观察**。我们确定了自生成轨迹推理RL中的支持限制失败模式:目标模型的轨迹可能语义冗余,被困在相同的错误推理盆地中,并为GRPO风格优化提供不足的奖励对比。 - **方法**。我们提出 W2SPO,一个辅助分支RL框架,使用一个较弱的模型作为局部提议分布。该方法将短的辅助分支插入到中间目标模型轨迹中,让目标模型完成剩余的推理路径,并对局部分支段执行重要性感知的策略更新。 - **实证发现**。我们表明,实例化为8个token段的短辅助分支可以改善推理RL,优于标准GRPO和仅目标分支。它们增加了不同的推理轨迹和正确解决方案的多样性,减少了全错的轨迹组。 ## 2 相关工作 #### 具有可验证奖励的推理RL。 最近的推理模型越来越依赖于具有可验证奖励的强化学习,其中正确性可以通过规则、符号检查器或学习验证器来判断 (Shao et al., 2024#bib.bib1; Guo et al., 2025a#bib.bib2; Song et al., 2025b#bib.bib3; Wen et al., 2025#bib.bib4; Cobbe et al., 2021#bib.bib5)。GRPO风格方法比较针对同一问题的多个采样响应,并使用相对奖励更新策略,使它们对数学和程序推理有效。然而,它们的有效性取决于采样的轨迹组是否包含多样化和有用的解决方案尝试。先前关于自一致性的工作表明,当多条轨迹覆盖有意义的推理模式时,可以提高答案可靠性 (Wang et al., 2023#bib.bib6)。然而,在困难问题上,重复样本可能仍然集中在相同的推理盆地中,尽管表面变化有限,但提供有限的奖励对比 (Dang et al., 2025#bib.bib7; Yue et al., 2025#bib.bib8; Brown et al., 2024#bib.bib9)。我们的工作侧重于这种支持受限的机制,并研究如何使轨迹组对策略优化更具信息量。 #### 外部指导、知识蒸馏和分支。 改善探索的一种常见方法是引入外部指导 (Deng et al., 2025#bib.bib14)。监督知识蒸馏和专家模仿可以提供高质量的推理迹,但它们需要强大的教师或精心策划的解决方案,并且可能遭受专家迹与目标模型原生推理风格之间的不匹配 (Kim et al., 2025#bib.bib13)。专家引导的分支方法将部分提示插入推理轨迹中,以帮助模型从更有希望的中间状态继续 (Zhang et al., 2025#bib.bib15; Wang et al., 2025#bib.bib16)。这些方法证明了中间指导的价值,但它们通常依赖于专家或真实轨迹。相比之下,W2SPO 不假设可以获得完整的专家解决方案。它仅使用一个较弱的辅助模型作为局部提议分布,而目标模型负责完成最终的推理轨迹。 #### 弱到强学习。 我们的方法与弱到强学习和模型协作密切相关 (Burns et al., 2023#bib.bib17; Wang et al., 2026#bib.bib18; Hsieh et al., 2023#bib.bib19; Lee et al., 2024#bib.bib20)。与传统的知识蒸馏(强教师监督弱学生)不同,最近的证据表明,即使是更弱的模型也可以通过提供多样化的局部干预来有效指导更强的模型 (Wang et al., 2026#bib.bib18)。这与我们对局部互补性的观察一致:来自较弱辅助模型的短片段可以成功地将目标模型推入一个它可能否则无法探索的不同推理盆地 (Chia et al., 2024#bib.bib21)。通过将辅助模型视为局部扰动的来源而不是全局求解器,W2SPO 扩展了轨迹分布的支持,同时保留了目标模型优越的长程推理能力 (Nath et al., 2025#bib.bib24)。通过将更新限制在这些短插入段上的推理,我们将信用分配本地化到改变下游轨迹的关键决策点 (Roux et al., 2025#bib.bib25; Guo et al., 2025b#bib.bib26)。因此,W2SPO 使用异构的短分支来构建更具信息量的RL轨迹组,而不是模仿完整的辅助轨迹 (Yan et al., 2025#bib.bib27; Lyu et al., 2025#bib.bib28; Liu et al., 2025#bib.bib29)。 ## 3 动机 现代具有可验证奖励的推理RL方法,例如 GRPO,通常依赖于当前策略的多个自生成轨迹,并使用组相对奖励差异来优化模型 (Shao et al., 2024#bib.bib1)。这种范式隐式假设增加采样轨迹的数量不仅会产生更多的尝试,还会产生更具信息量的推理替代方案。这种假设与自一致性的直觉一致,其中采样多样化的推理路径可以提高答案可靠性 (Wang et al., 2022#bib.bib40)。然而,在困难的推理问题上 (Zhang and Math-AI, 2024#bib.bib43, 2025#bib.bib44; He et al., 2024#bib.bib45; Hendrycks et al., 2021#bib.bib46),我们观察到增加自采样会带来明显的边际效益递减效应:随着采样预算的增加,正确且语义不同的轨迹比例逐渐变小。 #### 失败模式1:增加自采样不一定增加有效多样性。 对于每个问题,我们从目标模型 A(Qwen3-4B-Instruct-2507 (Team, 2025b#bib.bib57))中采样 K ∈ {8,16,32} 条轨迹,并测量最终答案正确性和语义多样性。语义多样性通过嵌入 (bge-small-en-v1.5 (Xiao et al., 2023#bib.bib58)) 生成的推理迹来计算,并在余弦相似度阈值 τ=0.95 下计数语义不同的轨迹。如图2 (https://arxiv.org/html/2607.16205#S3.F2) 所示,增加 K 显著增加了采样的轨迹数量,并且通常也增加了正确样本的总数。然而,语义不同的正确解决方案的数量增长慢得多,并且有效的不同正确比率随着 K 的增加而降低。这表明自采样中存在明显的边际效益递减效应:简单地增加自采样预算往往不是扩展目标模型有效推理支持的有效方法,因为额外的样本主要引入表面变化而不是真正的新推理模式。这一观察与最近关于推理多样性和 RLVR 的研究结果一致。当模型的采样分布已经包含正确解决方案时,重复采样可以改善覆盖 (Brown et al., 2024#bib.bib9);然而,最近的研究表明,推理模型可能遭受多样性崩溃,微调或RL将概率质量集中在更窄的推理路径集上 (Dang et al., 2025#bib.bib7)。基于结果的RL也被证明会导致生成多样性的系统性损失,这可能损害测试时扩展 (Song et al., 2025a#bib.bib42)。此外,对 RLVR 的分析表明,当前的RL方法通常通过重新加权现有推理路径来提高采样效率,而不是引发超越基础模型支持的全新推理模式。 (注意:原文在第3节最后有未完整的句子“analyses of RLVR suggest that current RL methods often improve sampling efficiency by reweighting existing reasoning paths rather than eliciting fundamentally new reasoning patterns beyond the base model’s supp”,这里supp可能是support缩写,翻译为“支持”。但句子在“支持”处结束。为完整,应翻译为“而不是引发超越基础模型支持的全新推理模式”。但原文没有句号,可能是截断。我们保持原文意思。实际上在原文中此段末尾是“beyond the base model’s supp”,可能是不完整的。翻译时照原文翻译,不擅自补充。但为流畅,可以简单处理为“而不是引发超越基础模型支持的全新推理模式。”但原文没有句号,保持原文状态。原文是“analyses of RLVR suggest that current RL methods often improve sampling efficiency by reweighting existing reasoning paths rather than eliciting fundamentally new reasoning patterns beyond the base model’s supp”。我们直接翻译。由于是技术翻译,我们将"supp"理解为"支持"的缩写,翻译为"支持"。但最好保持原样?不,应该翻译。为准确,翻译为"而不是引发超越基础模型支持的全新推理模式"并加句号?原文没有句号,但中文可以加句号。不过严格遵循原文,不加也不减。实际上原文在"supp"后是句号?检查原文:"beyond the base model’s supp"。但后面就是空格和下一个句子?在原文中,这个段落结束于"supp"。但接着是下一个段落。我们按原文翻译。可能是一个打印错误。但为了完整,我们假设是"support"。翻译时处理为"支持"。 好了,我们继续翻译下一段。其实原文第3节还有内容?实际上第3节结束于此。然后第4节?看了下原文,第3节结束,紧接着第4节?不,我们只被要求翻译到第3节结束。但截取的文本在第3节末尾。我们已完成。 检查:原文第3节最后一句是"Moreover, analyses of RLVR suggest that current RL methods often improve sampling efficiency by reweighting existing reasoning paths rather than eliciting fundamentally new reasoning patterns beyond the base model’s supp"。我们已翻译。现在可以停止了。 但是注意,我们收到的输入包括到第3节,后面没有更多内容。所以翻译就此结束。 最终输出应只有翻译后的Markdown文本。# 仅需8个Token:通过辅助分支实现的弱到强离线策略强化学习 来源:https://arxiv.org/html/2607.16205 Dayu Wang1,2 Jiaye Yang1 Weikang Li1 Jiahui Liang1 Liwei Qian1 Xin Pei1 Jizhou Huang1 1 百度公司 2 南洋理工大学 [email protected] [email protected] [email protected] {liangjiahui03, qianliwei, Xin Pei,huangjizhou01}@baidu.com ###### 摘要 基于可验证奖励的强化学习已成为增强大型语言模型推理能力的标准方法,通常通过对比多个自生成轨迹来优化策略。然而,我们识别出该范式中的一个关键支持限制瓶颈:在具有挑战性的推理任务上,目标模型的样本常常表现出语义冗余,收敛到相同的错误“推理盆地”,这为策略更新提供的奖励对比可以忽略不计。在本文中,我们提出通过弱到强学习范式来克服这一限制,在该范式中,策略的探索由一个更弱但计算高效的辅助模型指导。我们引入W2SPO,一种离线策略RL方法,它将短的辅助片段(通常短至8个token)注入到中间目标模型轨迹中,然后目标模型从这些转移状态完成推理路径。策略更新基于最终的可验证奖励仅限于这些插入的短片段。经验上,W2SPO在评估的4B规模模型上,在数学推理基准测试中实现了优越的性能,优于评估的各种后训练基线。与相同采样预算下的标准GRPO相比,W2SPO将Pass@1从62.3%提升到64.2%,同时实现了3.55倍的训练加速。这些结果表明,弱的辅助分支可以通过扩展局部探索支持来诱导更强的目标推理策略。代码和数据可在 https://anonymous.4open.science/r/W2SPO-1B86/ 获得。 ## 1 引言 参见图注 图1:W2SPO 概述。标准 GRPO 依赖于来自目标模型的自生成轨迹,这在困难的推理问题上可能语义冗余并产生全错的轨迹组。W2SPO 通过将短的辅助分支插入到中间目标模型前缀中来局部扩展轨迹支持,然后让目标模型完成解决方案。验证器奖励分配给完成的轨迹,而策略更新仅应用于短的分支段。 基于可验证奖励的强化学习已成为改进语言模型推理的核心方法 (Shao et al., 2024#bib.bib1; Guo et al., 2025a#bib.bib2; Song et al., 2025b#bib.bib3)。诸如 PPO 和 GRPO 风格训练的方法使用结果奖励从采样推理迹中优化模型,允许模型发现替代解决方案路径,而无需模仿固定的监督迹 (Wen et al., 2025#bib.bib4; Cobbe et al., 2021#bib.bib5)。然而,这些方法严重依赖于目标模型的自生成轨迹。在标准 GRPO 中,当前策略对同一问题采样多个轨迹并根据组内相对优势更新模型。这个过程假设采样的轨迹足够多样化和信息丰富 (Wang et al., 2023#bib.bib6)。对于困难的推理问题,这个假设经常失败:目标模型的轨迹可能在词汇上看起来不同,但遵循类似的中间逻辑,进入相同的错误推理盆地,并以相似的方式失败 (Dang et al., 2025#bib.bib7)。因此,瓶颈不仅仅是采样预算不足,而是轨迹分布的有限覆盖 (Yue et al., 2025#bib.bib8; Brown et al., 2024#bib.bib9)。这种支持限制以两种方式削弱推理RL (Dong et al., 2026#bib.bib10)。当所有轨迹都错误时,组内提供的有用奖励很少对比 (Chen et al., 2026#bib.bib11)。即使奖励不同,变化也可能仍然局限于目标模型当前推理分布的狭窄区域内,导致RL加强现有行为,而不是发现低概率的推理转向,这可能会将轨迹引导向正确解决方案 (Li et al., 2026#bib.bib12)。这激发了一种不同形式的探索:不是简单地增加自生成轨迹的数量,我们能否局部扩展目标模型的轨迹支持,同时仍然让目标模型完成长程推理过程?我们研究一种弱到强的替代方案 (Burns et al., 2023#bib.bib17; Wang et al., 2026#bib.bib18)。我们不使用辅助模型作为教师,而是将其用作局部探索提议者 (Hsieh et al., 2023#bib.bib19)。我们的关键观察是,即使一个较弱的辅助模型的完整解决方案次于目标模型,它仍然可以提供有用的短推理片段 (Lee et al., 2024#bib.bib20)。这样的片段可以将目标模型从其主导推理模式中扰动出来,并进入一个不同的延续盆地 (Chia et al., 2024#bib.bib21)。在插入片段后,目标模型恢复生成并负责完成长程推理路径。因此,辅助模型不需要解决问题;它只需要提出局部分支来扩展目标模型的探索支持 (Yao et al., 2023#bib.bib23)。受此观察启发,我们提出 W2SPO,一种通过辅助分支进行推理模型的弱到强离线策略RL方法 (Hou et al., 2025#bib.bib30)。给定一个问题,目标模型首先生成一个中间推理前缀。然后,我们在中间状态从目标模型和辅助模型中采样短分支 (Wei et al., 2022#bib.bib31)。在我们的主要实例中,每个辅助分支仅包含8个token。目标模型从插入的分支继续生成完整的解决方案,并由验证器或基于规则的奖励评分 (Wang et al., 2024#bib.bib33)。由此产生的奖励估计了局部分支的值,并且策略更新应用于分支段而不是整个延续 (Setlur et al., 2024#bib.bib34)。我们的贡献总结如下: - **观察**。我们确定了自生成轨迹推理RL中的支持限制失败模式:目标模型的轨迹可能语义冗余,被困在相同的错误推理盆地中,并为GRPO风格优化提供不足的奖励对比。 - **方法**。我们提出 W2SPO,一个辅助分支RL框架,使用一个较弱的模型作为局部提议分布。该方法将短的辅助分支插入到中间目标模型轨迹中,让目标模型完成剩余的推理路径,并对局部分支段执行重要性感知的策略更新。 - **实证发现**。我们表明,实例化为8个token段的短辅助分支可以改善推理RL,优于标准GRPO和仅目标分支。它们增加了不同的推理轨迹和正确解决方案的多样性,减少了全错的轨迹组。 ## 2 相关工作 #### 具有可验证奖励的推理RL。 最近的推理模型越来越依赖于具有可验证奖励的强化学习,其中正确性可以通过规则、符号检查器或学习验证器来判断 (Shao et al., 2024#bib.bib1; Guo et al., 2025a#bib.bib2; Song et al., 2025b#bib.bib3; Wen et al., 2025#bib.bib4; Cobbe et al., 2021#bib.bib5)。GRPO风格方法比较针对同一问题的多个采样响应,并使用相对奖励更新策略,使它们对数学和程序推理有效。然而,它们的有效性取决于采样的轨迹组是否包含多样化和有用的解决方案尝试。先前关于自一致性的工作表明,当多条轨迹覆盖有意义的推理模式时,可以提高答案可靠性 (Wang et al., 2023#bib.bib6)。然而,在困难问题上,重复样本可能仍然集中在相同的推理盆地中,尽管表面变化有限,但提供有限的奖励对比 (Dang et al., 2025#bib.bib7; Yue et al., 2025#bib.bib8; Brown et al., 2024#bib.bib9)。我们的工作侧重于这种支持受限的机制,并研究如何使轨迹组对策略优化更具信息量。 #### 外部指导、知识蒸馏和分支。 改善探索的一种常见方法是引入外部指导 (Deng et al., 2025#bib.bib14)。监督知识蒸馏和专家模仿可以提供高质量的推理迹,但它们需要强大的教师或精心策划的解决方案,并且可能遭受专家迹与目标模型原生推理风格之间的不匹配 (Kim et al., 2025#bib.bib13)。专家引导的分支方法将部分提示插入推理轨迹中,以帮助模型从更有希望的中间状态继续 (Zhang et al., 2025#bib.bib15; Wang et al., 2025#bib.bib16)。这些方法证明了中间指导的价值,但它们通常依赖于专家或真实轨迹。相比之下,W2SPO 不假设可以获得完整的专家解决方案。它仅使用一个较弱的辅助模型作为局部提议分布,而目标模型负责完成最终的推理轨迹。 #### 弱到强学习。 我们的方法与弱到强学习和模型协作密切相关 (Burns et al., 2023#bib.bib17; Wang et al., 2026#bib.bib18; Hsieh et al., 2023#bib.bib19; Lee et al., 2024#bib.bib20)。与传统的知识蒸馏(强教师监督弱学生)不同,最近的证据表明,即使是更弱的模型也可以通过提供多样化的局部干预来有效指导更强的模型 (Wang et al., 2026#bib.bib18)。这与我们对局部互补性的观察一致:来自较弱辅助模型的短片段可以成功地将目标模型推入一个它可能否则无法探索的不同推理盆地 (Chia et al., 2024#bib.bib21)。通过将辅助模型视为局部扰动的来源而不是全局求解器,W2SPO 扩展了轨迹分布的支持,同时保留了目标模型优越的长程推理能力 (Nath et al., 2025#bib.bib24)。通过将更新限制在这些短插入段上的推理,我们将信用分配本地化到改变下游轨迹的关键决策点 (Roux et al., 2025#bib.bib25; Guo et al., 2025b#bib.bib26)。因此,W2SPO 使用异构的短分支来构建更具信息量的RL轨迹组,而不是模仿完整的辅助轨迹 (Yan et al., 2025#bib.bib27; Lyu et al., 2025#bib.bib28; Liu et al., 2025#bib.bib29)。 ## 3 动机 现代具有可验证奖励的推理RL方法,例如 GRPO,通常依赖于当前策略的多个自生成轨迹,并使用组相对奖励差异来优化模型 (Shao et al., 2024#bib.bib1)。这种范式隐式假设增加采样轨迹的数量不仅会产生更多的尝试,还会产生更具信息量的推理替代方案。这种假设与自一致性的直觉一致,其中采样多样化的推理路径可以提高答案可靠性 (Wang et al., 2022#bib.bib40)。然而,在困难的推理问题上 (Zhang and Math-AI, 2024#bib.bib43, 2025#bib.bib44; He et al., 2024#bib.bib45; Hendrycks et al., 2021#bib.bib46),我们观察到增加自采样会带来明显的边际效益递减效应:随着采样预算的增加,正确且语义不同的轨迹比例逐渐变小。 #### 失败模式1:增加自采样不一定增加有效多样性。 对于每个问题,我们从目标模型 A(Qwen3-4B-Instruct-2507 (Team, 2025b#bib.bib57))中采样 K ∈ {8,16,32} 条轨迹,并测量最终答案正确性和语义多样性。语义多样性通过嵌入 (bge-small-en-v1.5 (Xiao et al., 2023#bib.bib58)) 生成的推理迹来计算,并在余弦相似度阈值 τ=0.95 下计数语义不同的轨迹。如图2 (https://arxiv.org/html/2607.16205#S3.F2) 所示,增加 K 显著增加了采样的轨迹数量,并且通常也增加了正确样本的总数。然而,语义不同的正确解决方案的数量增长慢得多,并且有效的不同正确比率随着 K 的增加而降低。这表明自采样中存在明显的边际效益递减效应:简单地增加自采样预算往往不是扩展目标模型有效推理支持的有效方法,因为额外的样本主要引入表面变化而不是真正的新推理模式。这一观察与最近关于推理多样性和 RLVR 的研究结果一致。当模型的采样分布已经包含正确解决方案时,重复采样可以改善覆盖 (Brown et al., 2024#bib.bib9);然而,最近的研究表明,推理模型可能遭受多样性崩溃,微调或RL将概率质量集中在更窄的推理路径集上 (Dang et al., 2025#bib.bib7)。基于结果的RL也被证明会导致生成多样性的系统性损失,这可能损害测试时扩展 (Song et al., 2025a#bib.bib42)。此外,对 RLVR 的分析表明,当前的RL方法通常通过重新加权现有推理路径来提高采样效率,而不是引发超越基础模型支持的全新推理模式
相似文章
Weak-to-Strong On-Policy Distillation
介绍了 Weak-to-Strong On-Policy Distillation(W2S-OPD)框架,该框架通过使用对比对在 logit 空间中对多个较弱模型进行蒸馏,从而改进强语言模型,在数学和代码基准测试上始终优于标准同策略蒸馏。
通过直接在线策略蒸馏实现弱到强泛化
Direct-OPD 通过从小模型的预强化学习和后强化学习检查点中蒸馏策略变化,利用在线策略蒸馏改进较大的学生模型,无需在学生模型上执行昂贵的强化学习即可实现显著提升。
PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
SLPO:通过代理策略扩展潜在推理
介绍了一种代理潜在策略优化(SLPO)方法,将结果奖励强化学习应用于自回归潜在推理器,实现测试时扩展和变长策略,从而在更难实例上提高准确率。
弱链优化:多智能体推理与协作框架
本论文提出WORC框架,这是一个针对多智能体LLM系统的弱链优化框架,通过基于元学习的权重预测和不确定性驱动的资源分配来识别并强化表现不佳的智能体,在推理基准上达到82.2%的准确率,同时提升了系统稳定性。