RL后训练构建组合推理策略
摘要
本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。
arXiv:2607.07646v1 公告类型: cross \n摘要:RL后训练是否仅仅放大了基础模型中已蕴含的原始技能,还是能够将原始技能组合成新的更高层次的策略?我们在一个完全可观测的重写语法环境中研究这一问题,该环境的预训练分布已知,且每次生成的重写都可审计。一个Transformer在原始符号重写链上进行预训练,并在一个基于轨迹的推理任务上进行后训练,该任务仅提供二元的最终答案奖励。RL解决了那些即使在更大采样预算下预训练模型仍很少解决的保留问题,而拒绝微调则在早期有所改进但随后停滞不前。轨迹分析表明,RL通过分阶段的组合机制重新组织原始能力:首先强化原始归约,然后发现有效的组合过程。这些包括顺序组合(即折叠有序的原始收缩链)和并行组合(即在单步中合并独立的原始收缩)。组合过程并非孤立样本;它们被重复使用并巩固为稳定的技能库。比较RL与拒绝微调发现,关键差异不在于探索量,而在于选择性:RFT产生许多捷径式重写,其中大部分无效,而RL则将探索集中在有效的可重用结构上。预训练消融实验表明,组合策略的出现并非仅由原始暴露决定,而是取决于预训练是否将原始能力组织成RL后续可以压缩的归约过程。基础模型提供了弱的过程成分;RL将其构建为可靠的高层策略。
查看缓存全文
缓存时间: 2026/07/09 07:53
# RL Post-Training Builds Compositional Reasoning Strategies Source: https://arxiv.org/html/2607.07646 ###### 摘要
强化学习后训练仅仅是被动地放大基础模型中已存在的原始技能,还是能够将这些原始技能组合成更高级的策略?我们在一个完全可观测的重写语法环境中研究这一问题,其中预训练分布是已知的,且每一步生成的重写都可以被审计。Transformer 在原始符号重写链上进行预训练,然后在一个基于追踪的推理任务上进行后训练,仅使用二元最终答案奖励。强化学习解决了一些即使在更大采样预算下预训练模型也难以解决的保留问题,而拒绝微调则早期虽有提升但随后停滞。追踪分析显示,强化学习通过分阶段的组合机制重组原始能力:它首先增强原始归约,然后发现有效的组合过程。这些过程包括顺序组合(将有序的原始收缩链折叠)和平行组合(在单步中合并独立的原始收缩)。这些组合过程并非孤立样本,而是被重用并固化为稳定的行为库。对比强化学习与拒绝微调发现,关键区别不在于探索量,而在于选择性:RFT 生成了许多类似捷径的重写,其中大部分无效;而强化学习则将探索集中在有效的可重用结构上。预训练消融实验表明,组合策略的出现并非仅取决于原始暴露程度,而是取决于预训练是否将原始能力组织成强化学习后续可压缩的归约过程。基础模型提供了较弱的程序性成分;强化学习将它们构建为可靠的高级策略。
强化学习,组合推理,后训练
## 1 引言
强化学习后训练仅仅是被动地放大基础模型中已存在的潜在行为,还是能够组合原始技能形成更高级的策略?近期研究已使这一问题成为活跃的辩论焦点。Yue 等人(Yue et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib1))认为,带可验证奖励的强化学习常能改善小 k 的成功率,但并未扩展大 k 的能力前沿;ProRL(Liu et al., 2025a (https://arxiv.org/html/2607.07646#bib.bib3))和 Yuan 等人(Yuan et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib5))提供的证据表明,长时间强化学习或受控组合任务可以揭示在基础模型广泛采样下仍无法达到的行为;而诸如拒绝微调这类模仿类基线有时也出人意料地具有竞争力(Chu et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib4); Xiong et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib6))。一个核心障碍是相关机制在预训练语言模型中难以观察。当后训练模型展现出新行为时,通常不清楚该行为在基础模型中是否原本不存在、仅仅是低概率存在,还是已在预训练数据中存在。诸如 pass@k 之类的聚合指标留下了三个未解问题:实际使用了哪些策略、它们的出现反映了更广泛的探索还是选择性过滤、以及何种预训练结构使它们一开始就能被触及。我们在完全可观测的重写语法环境中研究这些问题。该任务抽象了逐步推理中的常见结构:复杂解决方案可以通过将局部变换组合成可重用过程来构建。Transformer 从零开始在原始重写链上进行预训练,然后进行目标导向的收缩任务后训练。由于每一步生成的重写都可以对照语法进行审计,我们可以将行为分解为原始规则使用、有效组合策略和虚假无效重写。有效的组合策略有两种形式:**顺序组合**(将有序的原始收缩链折叠)和**平行组合**(在单步中合并独立的原始收缩)。这使得通常不透明的后训练行为变成可精确分类的轨迹,从而让我们能够探究强化学习是否将原始能力重组为可重用的高级策略。
#### 贡献
1. 一个完全可观测的重写语法测试平台。我们引入了一个环境,其中原始规则、预训练历史以及生成的重写均可精确检查,从而实现四分类:原始、宏、平行和虚假。
2. 分阶段的程序性分块。我们展示了强化学习首先增强原始归约,然后发现、重用并巩固原始收缩的有效组合。
3. 有限预算前沿扩展。我们展示了强化学习解决了预训练模型即使在更大采样预算下也极少解决的保留问题,这些提升出现较晚,并随难度增加而增强。
4. 选择性而非探索量。我们展示了 RFT 也尝试了许多类似捷径的重写,但这些行为大部分是虚假的;强化学习则将探索集中在有效的可重用结构上。通过 GRPO 的有限群视角可以解释同类提示的对比如何抑制 RFT 所克隆的虚假乘客行为。
5. 预训练作为程序性基质。我们展示了策略的出现取决于预训练如何将原始能力组织成强化学习后续可压缩和重用的归约过程。
## 2 相关工作
#### RL 超越基础模型
在带可验证奖励的强化学习中,一个核心问题是后训练是否扩展了模型的有效能力前沿,还是主要重新权化基础策略中已存在的潜在行为。Yue 等人(Yue et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib1))认为 RLVR 常能改善小 k 的成功率,但未扩展大 k 前沿;而基于支持的分析则强调,在线策略 RL 无法放大零概率补全(Wu et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib13))。相反,ProRL(Liu et al., 2025a (https://arxiv.org/html/2607.07646#bib.bib3))认为长时间 RL 可以使一些在基础模型广泛采样下无法达到的问题变得可达。最接近我们设定的是 Yuan 等人(Yuan et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib5))在受控合成任务中研究的 RL 诱导组合。我们的工作在一个机制可直接观察的设定中研究这一问题:预训练分布由已知语法生成,且每个发出的解步骤都可以对照该语法进行检查。我们将在第 8 节(https://arxiv.org/html/2607.07646#S8)回到与先前组合实验的比较。
#### RL 与模仿式后训练的比较
在推理后训练中,拒绝和监督基线通常很强。STaR 通过答案正确性过滤的自我生成推理过程进行自举(Zelikman et al., 2022 (https://arxiv.org/html/2607.07646#bib.bib14)),而近期工作表明,拒绝式或极简监督方法在某些 RLVR 设定中可与策略梯度 RL 竞争(Xiong et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib6); Chu et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib4))。因此,我们将拒绝微调视为强在线策略比较对象而非弱基线:RL 和 RFT 在相同提示上训练,并在相同最终答案监督下分别优化。
#### 过程有效性、探索与预训练基质
仅结果奖励可能隐藏无效的中间推理(Uesato et al., 2022 (https://arxiv.org/html/2607.07646#bib.bib19); Lightman et al., 2023 (https://arxiv.org/html/2607.07646#bib.bib20); Cobbe et al., 2021 (https://arxiv.org/html/2607.07646#bib.bib21))。这在自然语言任务中难以衡量,因为有效的中间步骤通常不可枚举。在我们的环境中,过程有效性可通过机械方式检查,从而让我们能够完善近期关于 RLVR 中探索和负样本的讨论(Wang et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib24); Tang et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib23))。我们还与相关工作进行了连接,这些工作认为后训练依赖于预训练期间塑造的能力和偏差(Zhao et al., 2025 (https://arxiv.org/html/2607.07646#bib.bib11); Liu et al., 2025b (https://arxiv.org/html/2607.07646#bib.bib25));由于预训练是受控的,我们可以探究基础分布如何决定 RL 后续可以选择、压缩和巩固哪些高级策略。
## 3 重写语法与原始动作
语法定义在字母表 $\mathcal{A}$ 上,其中每个源符号映射到一个或多个全局唯一的多字符右侧字符串(图 1 (https://arxiv.org/html/2607.07646#S3.F1)a)。全局唯一性使得原始收缩明确无误:任何匹配右侧的子字符串都唯一地映射回一个源符号。环境支持两种逆原始操作:**扩展**(用某个右侧替换一个符号)和 **收缩**(用其源符号替换一个匹配子字符串)。每一步序列化为 `lhs_word|action|rhs_word`,其中动作指定位置和扩展规则,或跨度和收缩规则(图 1 (https://arxiv.org/html/2607.07646#S3.F1)c)。由于原始规则集已知,每一步生成的重写都可以对照语法进行审计:它可以是原始规则应用、有效的非原始捷径或无效重写。这正是实现轨迹级策略分析的关键。
图 1:受控环境与训练流程。(a) 每个源字符映射到一个或多个全局唯一右侧字符串。(b) 预训练数据由多步序列组成,其中一步的输出成为下一步的输入。(c) 每个训练三元组编码单个原始扩展或收缩。(d) RL 提示通过从目标符号重复向前扩展生成。(e) 难度级别由超出模型 256 令牌生成预算的最优收缩步骤数定义。
### 3.1 原始重写链上的预训练
模型从零开始在链式重写轨迹上进行预训练。从初始单词开始,数据生成器重复采样一个有效的原始扩展或收缩,附加相应的序列化三元组,并将得到的单词作为下一步的输入。因此,预训练使模型暴露于局部语法一致的重写动态,但并未暴露于本文后续分析的非原始捷径。我们使用收缩权重 $\rho$ 控制预训练分布,该权重在两者都可用时局部提升收缩动作相对于扩展动作的权重。因此 $\rho$ 会影响实现的收缩频率和收缩链的数量,但并不直接指定这些统计量。除非另有说明,我们使用 $\rho=4$。第 7 节(https://arxiv.org/html/2607.07646#S7)稍后将对该参数进行消融,以测试预训练分布的属性是否影响 RL 能够解锁的策略。完整的语法生成和优化细节见附录 A (https://arxiv.org/html/2607.07646#A1)。
### 3.2 基于追踪的推理任务
预训练后,模型在基于追踪的推理任务上进行后训练。提示通过从目标符号 $c^\star$ 开始,重复应用原始扩展以得到一个更长的单词 $w_{\mathrm{prompt}}$ 来生成。在后训练时,模型只看到 $w_{\mathrm{prompt}}$,并且必须生成一个逐步收缩追踪,其最终发出的符号等于 $c^\star$。难度由序列化动作格式下最优原始收缩解的长度定义。难度 1 的问题有一个在 256 令牌生成预算内的最优原始解。难度 2 的问题需要比预算多一步原始收缩,难度 3 需要多两步。RL 训练混合包含 60% 难度 1、20% 难度 2 和 20% 难度 3 的样本。对于评估,我们使用涵盖难度 1–6 的保留问题,包括训练分布之外的桶。这个难度定义很重要:更高难度并不意味着语法不同,而是直接的原始收缩追踪对于生成预算来说太长。因此,解决更难的桶需要更短的、有效的推理过程,类似于使用简化捷径而不是一步一步地执行每个局部变换。
### 3.3 RL 与 RFT 后训练
后训练奖励是二元的且仅基于结果:如果轨迹由上述格式的良好形式动作三元组组成,并且最终发出的符号等于目标 $c^\star$,则为 1;否则为 0。中间重写没有任何监督——只关心输出的格式和最终符号的身份。任何有效的非原始策略的出现必须来自于后训练动态,而非直接奖励塑造。这类似于数学推理中的 RLVR,其中最终答案的正确性是唯一的训练信号(Shao et al., 2024 (https://arxiv.org/html/2607.07646#bib.bib7))。我们的 RL 方法是组相对策略优化 (GRPO)(Shao et al., 2024 (https://arxiv.org/html/2607.07646#bib.bib7))。作为模仿基线,我们使用拒绝微调 (RFT),它保留成功的在线策略 rollout 并在其上执行下一个令牌预测。因此 RFT 是一个强比较对象:任何 RL 与 RFT 之间的差距都不能归因于数据或提示不匹配。完整的 GRPO 和 RFT 细节见附录 B (https://arxiv.org/html/2607.07646#A2)。
## 4 利用组合超越基础模型
由于语法完全已知,成功轨迹中的每一步生成重写都可以通过比较其左右两侧来审计。**原始收缩** 将语法规则中的右侧替换为其源符号;例如,当语法包含 $b \rightarrow \texttt{dff}$ 时,`dff` 收缩为 `b`。**宏收缩** 是一种非原始重写,等价于原始收缩的“顺序组合”,例如通过组合 `ae → c` 和 `bc → a` 将 `bae` → `a`。**平行收缩** 同时应用原始收缩的“平行组合”,例如将 `dffae` → `bc`。这两种动作类型——宏和平行——实例化了第 1 节中介绍的程序性块:可压缩的多步过程,能够替代原始操作链或组合。任何既非宏亦非平行的非原始重写都被分类为 **虚假**。
图 2:RL 经历了从原始收缩到压缩有效捷径的延迟转变。宏收缩在大约 12500 次迭代时加速并超越原始收缩;平行收缩出现得更晚。底部示例展示了与代数简化的结构类比:原始收缩对应局部简化,宏收缩对应可重用的多步操作,平行收缩对应同时应用独立简化。
因此,RL 首先增强原始归约行为,然后才转向从未作为原始训练动作出现的有效组合过程。这种轨迹级阶段转变解释……(原文在这里好像截断了,但根据上下文应该是解释这种转变的意义。我们按现有内容翻译。)相似文章
从预训练到后训练的推理理解
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
理解从预训练到后训练的推理
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
课程学习推理II:组合泛化
本文从理论上分析了课程学习通过将复杂问题分解为更简单的子问题并组合解决方案,如何显著降低学习模拟顺序计算(半自动机)的样本复杂度——相较于直接方法,在监督微调中实现次多项式监督需求,并在可验证奖励的强化学习中实现指数级更弱的覆盖条件。
后训练如何塑造生物学推理模型
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。
训练数据教会强化学习记忆代理什么:记忆增强问答中课程效果的实证研究
本文实证研究了训练数据的组成(课程)如何影响基于强化学习的记忆代理在多会话问答中学到的技能。研究发现,课程组成作为专业化的细粒度杠杆,混合基准测试在整体性能上表现最佳,而狭窄的域外数据集则传递了有针对性的时间推理技能。