预训练期间的RL探索:重新审视LLM训练的策略优化
摘要
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。
arXiv:2606.04272v1 公告类型:新
摘要:标准的LLM训练流程仅在预训练和监督微调(SFT)之后应用强化学习(RL)。我们对这一现状提出质疑,从头开始训练一个LLM,并直接对中间预训练检查点应用RL、SFT以及SFT后接RL。我们发现RL在早期就很有效,并且通常也能与完整的SFT$\to$RL流程早期相匹配。通过在更难的问题上进行实验,我们发现针对性的预训练数据组成是影响RL有效性的重要杠杆,甚至比模型规模更重要。除了推理准确性之外,直接将RL应用于基础检查点可以扩展模型的分布;最近工作中报告的锐化效应仅在RL紧随SFT之后出现时才会发生。模型的通用能力基本不受RL影响,而在SFT之后则会下降。最后,我们通过并行平均合并了RL和SFT目标,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。这些结果表明,LLM训练可能会受益于更广泛地使用RL。
查看缓存全文
缓存时间: 2026/06/05 02:24
# 重新审视LLM训练中的策略优化
来源:https://arxiv.org/html/2606.04272
## 预训练期间的RL探索:重新审视LLM训练中的策略优化
Rachit Bansal Clara Mohri¹ ¹Tian Qin¹ ¹David Alvarez-Melis Sham Kakade² ² 哈佛大学 \{rachitbansal,cmohri,tqin\}@g.harvard.edu
###### 摘要
标准的LLM训练流程仅在预训练和监督微调(SFT)之后应用强化学习(RL)。我们对这一现状提出质疑,从头开始训练一个LLM,并直接将RL、SFT以及SFT后跟RL应用于中间预训练检查点。我们发现RL在很早期就有效,并且在早期阶段通常能与完整的SFT→RL流程相媲美。通过在更难的问题上进行实验,我们发现针对性的预训练数据组成是影响RL有效性的重要因素,甚至比模型规模更重要。除了推理准确性之外,将RL直接应用于基础检查点会扩展模型的分布;近期工作中报告的锐化效应仅在RL跟在SFT之后出现。模型的通用能力在RL下基本保持不变,而在SFT后则会下降。最后,我们通过并行平均合并RL和SFT目标,在所有讨论的其他训练方法中取得了最佳效果,同时保持了通用能力。这些结果共同表明,LLM训练可能会从RL的扩展使用中受益。
## 1 引言
直到最近,大型语言模型(LLM)的训练方法完全使用基于交叉熵损失的下一个词预测(NTP)目标。然而,随着语言模型RL的出现(Ouyang等,2022(https://arxiv.org/html/2606.04272#bib.bib4);Shao等,2024(https://arxiv.org/html/2606.04272#bib.bib9)),一个较新的进展是现在标准的后训练阶段,它顺序地使用监督微调(SFT)后跟RL。预训练和SFT的NTP目标通常是在静态的外部数据集上使用,即离线策略。相反,对于RL目标,模型从其自身的在线策略生成中学习。
在这种标准训练体制下,RL训练仅在大量的NTP训练之后进行。目前尚不清楚这是RL训练的本质需求还是仅仅是一个设计选择(Foster等,2025(https://arxiv.org/html/2606.04272#bib.bib12))。人们也越来越有兴趣改变这一标准,扩大RL在预训练中的使用(Hatamizadeh等,2026(https://arxiv.org/html/2606.04272#bib.bib2);Li等,2025(https://arxiv.org/html/2606.04272#bib.bib1);Xing等,2025(https://arxiv.org/html/2606.04272#bib.bib14))。在这项工作中,我们试图回答一个更基本的问题:
*何时以及如何在LLM训练中使用RL目标?*
虽然已有广泛观察表明后训练显著提升了模型的推理能力,但RL对模型能力的影响一直是近期争论的焦点。例如,越来越多的研究认为RL主要锐化了模型现有的输出分布(Yue等,2025(https://arxiv.org/html/2606.04272#bib.bib28);Wu等,2025(https://arxiv.org/html/2606.04272#bib.bib30);Karan和Du,2025(https://arxiv.org/html/2606.04272#bib.bib41);Qin等,2025(https://arxiv.org/html/2606.04272#bib.bib49))。尚不清楚这些发现是RL目标固有的,还是标准训练体制的产物。通过全面研究预训练各个阶段的训练目标,我们揭示了第二个基本问题:
*RL对模型能力有何影响?*
为了回答这些问题,我们对LLM训练的在线策略学习进行了一项大规模严谨研究。我们从头开始在高质量、推理密集型语料库上预训练一个LLM,并在整个过程中保存检查点。对于每个基础模型检查点,我们进行各种不同的训练运行:(直接RL)在基础模型检查点上进行RL;(SFT)使用每个示例单个真实答案进行SFT;(SFT-Gold)使用每个示例多个真实答案进行SFT;以及(SFT→RL)在SFT模型之上进行RL,包括SFT和SFT-Gold,这代表了标准的LLM训练流程。
参照图注
图1:概述。我们比较了几种应用于中间预训练检查点 \(M_t\) 的后训练方法:直接RL(\(M_t^{RL}\))、每个问题一个解法的SFT(\(M_t^{SFT}\))、每个问题多个解法的SFT(\(M_t^{SFT-Gold}\))、RL在SFT之后的标准流程(\(M_t^{SFT→RL}\)),以及RL和SFT梯度的并行平均(\(M_t^{Parallel}\))。
1️⃣ RL在低至40亿预训练token的检查点上同时提高了pass@1和pass@32(第3.1节(https://arxiv.org/html/2606.04272#S3.SS1))。
2️⃣ 当真实答案稀少时,RL是更有效的后训练目标:\(M_t^{RL}\) 在pass@1上显著优于 \(M_t^{SFT}\),但与 \(M_t^{SFT-Gold}\) 相当(第3节(https://arxiv.org/html/2606.04272#S3.F3))。
3️⃣ SFT降低了通用(非推理)基准测试的性能,而RL则基本保持这些能力不变(第4.2节(https://arxiv.org/html/2606.04272#S4.SS2))。
4️⃣ RL和SFT梯度的并行平均结合了两者的优势:\(M_t^{Parallel}\) 在每个预训练检查点上取得了最强的pass@32(第5节(https://arxiv.org/html/2606.04272#S5)),持续优于标准SFT→RL流程(\(M_t^{SFT→RL}\))。
我们提出了全面的发现,回答了关于LLM训练中RL的基本问题:
**RL何时有效?**(第3节(https://arxiv.org/html/2606.04272#S3))我们发现RL在预训练的早期就出奇地有效。在仅看到40亿token的检查点上进行直接RL训练,显著提升了GSM8K和MATH上的性能,其增益通常与标准的SFT→RL流程相当(第3.1节(https://arxiv.org/html/2606.04272#S3.SS1))。此外,我们发现当目标答案有限(SFT)时,RL比SFT有效得多(第3节(https://arxiv.org/html/2606.04272#S3.F3))。RL的有效性随任务难度变化:在更难的MATH型问题上,RL的增益较弱。在这种情况下,我们发现向预训练语料中添加针对性数据是有效的,并且是比扩大模型规模更好的策略(第3.3节(https://arxiv.org/html/2606.04272#S3.SS3))。
**RL做了什么?**(第4节(https://arxiv.org/html/2606.04272#S4))与近期关于RL主要锐化输出分布的说法相反(Yue等,2025(https://arxiv.org/html/2606.04272#bib.bib28);Wu等,2025(https://arxiv.org/html/2606.04272#bib.bib30)),我们发现直接应用于基础检查点的RL*扩展*了分布:pass@1*和*pass@k都显著提高(第4.1节(https://arxiv.org/html/2606.04272#S4.SS1))。我们确实复现了锐化效应,但仅当RL跟在SFT之后应用时才出现。这表明是SFT,而不是RL本身,限制了探索。此外,我们发现SFT持续降低通用(非推理)能力,而RL则保持不变(第4.2节(https://arxiv.org/html/2606.04272#S4.SS2))。
**RL应如何使用?**(第5节(https://arxiv.org/html/2606.04272#S5))最后,我们研究在单个训练步骤中交错使用SFT和RL梯度是否能捕捉两种目标的互补优势。我们提出了一种并行平均更新,结合了SFT和直接RL的更新。我们发现,这个简单的目标在pass@32上优于所有其他每个问题仅使用单个答案的方法,包括SFT→RL,这表明同时使用RL和NTP目标可能是有益的。
总的来说,我们的发现有助于理解RL与其他训练目标相比的特点。通过在预训练不同阶段进行受控实验,我们发现许多关于RL目标的假设都是当前训练体制的产物。我们的结果表明,将目标从环境中孤立出来,会揭示RL作为LLM训练目标的令人惊讶的方面。我们将实验集中在数学推理能力上,以保持受控的训练和评估环境。我们认为我们的结果证明,在LLM训练流程中更早、更核心地引入RL是可行的,而且在几个方面优于当前标准。
## 2 方法与实验设计
为了回答围绕LLM训练的RL目标的基本问题,超越标准训练流程,我们首先建立了一个受控实验环境。我们的设置集中在一个自定义训练的1B模型上,从而可以精确控制数据暴露。在本节中,我们详细说明预训练检查点,定义三种后训练流程,并描述数据和评估。虽然我们探索RL作为一个通用目标,但我们将实现重点放在使用GRPO算法(Shao等,2024(https://arxiv.org/html/2606.04272#bib.bib9))的基于可验证奖励的强化学习(RLVR)上。
### 2.1 预训练检查点
#### 基础模型与数据。
我们基于OLMo2(OLMo团队等,2025b(https://arxiv.org/html/2606.04272#bib.bib16))的架构和训练基础设施预训练了一个1B参数模型。我们使用基于OLMo2预训练混合数据的高质量子集DOLMino(OLMo团队等,2025b(https://arxiv.org/html/2606.04272#bib.bib16))¹¹¹ allenai/dolmino-mix-1124,从头开始进行预训练。DOLMino混合数据包含500亿token,包括通用领域如Wikipedia(7%)、高质量网络数据(60%来自DCLM(Li等,2024(https://arxiv.org/html/2606.04272#bib.bib18))和FLAN(Wei等,2022(https://arxiv.org/html/2606.04272#bib.bib19)))、高质量数学数据(20%),以及其他推理或代码数据如StackExchange(2%)和STEM论文(5%)。
#### 预训练细节。
我们在500亿token(约2.5倍Chinchilla最优token)上预训练我们的1B参数模型。我们使用AdamW(Loshchilov和Hutter,2019(https://arxiv.org/html/2606.04272#bib.bib23))配合余弦学习率衰减,峰值学习率为4×10⁻⁴。我们以序列长度4096和批次大小512训练模型。对于第3.3节(https://arxiv.org/html/2606.04272#S3.SS3)的实验,我们进行了两次额外的预训练实验。第一次,我们保持模型架构和大小固定,但在整个训练过程中额外添加来自DOLMino-3混合数据(OLMo团队等,2025a(https://arxiv.org/html/2606.04272#bib.bib33))²²² allenai/dolma3_dolmino_mix-100B-1125的100亿token。第二次,我们使用相同的500亿token进行预训练,但将模型规模扩大到4B参数。
### 2.2 训练流程
令 \(M_t\) 表示在步骤 \(t\) 的预训练模型检查点,\(M_T\) 表示最终完全预训练模型。下面描述我们比较的三种方法。
- **直接RL(\(M_t^{RL}\))**:我们从 \(M_t\) 开始,使用RL目标进行训练。
- **仅SFT(\(M_t^{SFT}\))**:我们从 \(M_t\) 开始,使用真实答案进行SFT。
- **标准流程(\(M_t^{SFT→RL}\))**:我们在相同的问题集上对 \(M_t^{SFT}\) 使用RL进行训练。
通过比较 \(M_t^{RL}\) 与 \(M_t^{SFT}\),我们隔离训练目标(RL vs. SFT),以确定RL是否提供了更优的训练信号。通过比较 \(M_t^{RL}\) 与 \(M_t^{SFT→RL}\),我们隔离RL单独是否比标准流程提供更优的训练信号。
在这项工作中,我们感兴趣的是了解,如果有足够的计算资源,每种方法的表现如何。因此,我们将所有RL和SFT运行训练至收敛,并在附录B.3(https://arxiv.org/html/2606.04272#A2.SS3)和附录B.5(https://arxiv.org/html/2606.04272#A2.SS5)中确认了训练的收敛性。
### 2.3 数据与评估
#### 训练数据。
我们使用OpenMathInstruct(Toshniwal等,2024(https://arxiv.org/html/2606.04272#bib.bib17)),它包含数学问题,每个问题配对了多个真实答案。对于SFT,默认情况下,我们从每个问题中随机选取一个答案用于训练(SFT),因为这是一种更现实的SFT设置——为每个问题获取多个真实推理轨迹通常不可行。不过,为了完整性,我们也考虑使用所有答案进行训练(SFT-Gold)。对于RL,我们只考虑每个问题的最终答案,并根据模型生成是否达到相同最终答案定义一个二元奖励。
#### 难度划分。
OpenMathInstruct包含两类问题:大多数灵感来自MATH数据集(Hendrycks等,2021(https://arxiv.org/html/2606.04272#bib.bib27))(竞赛级别),少数灵感来自GSM8K(Cobbe等,2021(https://arxiv.org/html/2606.04272#bib.bib26))(小学级别)。我们考虑两种实验设置来探究RL训练的不同方面:使用完整的OpenMathInstruct训练,以及使用OpenMathInstruct中灵感来自GSM8K的子集训练。在GSM8K子集上,基础预训练检查点已经达到非平凡的性能。相反,完整的以MATH为主的训练集包含的问题即使对较晚的预训练检查点也是具有挑战性的,这使我们能够考察不同流程能将模型的推理能力推到多远。
#### 评估。
我们分别在GSM8K和MATH上进行评估,报告pass@k(Chen等,2021(https://arxiv.org/html/2606.04272#bib.bib25)),该指标估计在生成k个响应时至少得到一个正确响应的概率,其中k=1, 8, 32,温度T=0.6。
## 3 RL在预训练早期有效
参照图注
图2:RL在预训练早期有效。对于GSM8K的pass@k,展示了 \(M_t\)、\(M_t^{SFT}\)、\(M_t^{SFT→RL}\) 和 \(M_t^{RL}\) 在不同预训练token数 \(t\) 上的表现,所有SFT基线均在SFT集上训练(每个问题一个真实答案)。\(M_t^{RL}\) 从仅40亿token开始就比 \(M_t\) 有所改进。到100亿token时,\(M_t^{RL}\) 达到了标准 \(M_t^{SFT→RL}\) 流程的水平,并且优于单独的 \(M_t^{SFT}\)。
在本节中,我们研究RL在预训练不同阶段的效果,并与训练目标进行对比。在GSM8K上,对于我们的1B参数模型,我们发现RL从预训练token仅40亿起就有效,并且通常与完整的SFT→RL流程相当(第3.1节(https://arxiv.org/html/2606.04272#S3.SS1))。当真实答案稀少时,RL也是更有效的目标。相似文章
ExpRL:面向LLM中期训练的探索式强化学习
ExpRL是一种新的基于强化学习的中期训练方法,它使用人工编写的参考答案作为密集奖励支架(从未向策略展示),从而提升LLM推理能力,在AIME-2026等困难数学基准上取得了显著提升。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。
LLMZero:通过LLM智能体发现强化学习后训练的自适应训练策略
LLMZero利用LLM智能体通过树搜索在训练轨迹中进行搜索,发现用于强化学习后训练的自适应多参数过渡策略,该策略在多种任务中优于固定调度和网格搜索。
近期LLM的进步主要来自预训练还是后训练?
一个讨论问题,探讨近期LLM的进步更多是由预训练还是后训练技术(如RL和微调)驱动,因为两者都需要大量计算资源。
重新思考大语言模型推理中的强化学习:关键在于稀疏策略选择,而非能力学习
本文挑战了强化学习(RL)能为大语言模型(LLM)教授新推理能力的假设,论证其作用实则是在高熵决策点进行稀疏策略选择。本文提出了 ReasonMaxxer,这是一种无需强化学习的方法,以显著更低的训练成本实现了与完整强化学习相当的性能。