从预训练到后训练的推理理解

arXiv cs.CL 论文

摘要

本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。

arXiv:2607.16097v1 Announce Type: cross 摘要:强化学习(RL)已成为提升大型语言模型(LLMs)在复杂推理任务上表现的核心手段,然而RL后训练通常与其之前的预训练分开研究。因此,两个基本问题仍然悬而未决:(1)预训练选择(模型大小、数据)如何影响RL计算带来的收益,以及(2)RL实际上对模型做了什么?这些问题在标准的LLM设置中难以研究:预训练语料库庞大且不受控,难以将行为归因于预训练还是RL,且系统性地跨两个阶段进行计算扫描成本过高。为了解决这些挑战,我们使用国际象棋作为受控测试平台,研究从预训练到后训练整个流程中的推理。我们遵循标准的LLM训练流程,在人类棋谱上预训练5M到1B参数的语言模型,在合成推理轨迹上进行监督微调,并在具有可验证奖励的国际象棋谜题上运行RL。利用这一框架,我们发现给定RL计算水平下的后RL性能能很好地由预训练损失预测,且RL奖励曲线的斜率大致随预训练token数线性提高。除了缩放定律,我们还发现RL并非简单锐化SFT策略:在简单谜题上,它放大了SFT策略已偏好的正确走法;而在困难谜题上,它浮现出SFT下几乎不存在的正确走法。我们进一步测试了这些发现是否超越国际象棋,通过在数学领域文本上训练1B语言模型,出现了相同的预测模式:预训练更长的检查点在后RL阶段达到更高性能,并在RL下提升更快。总之,我们提供了预训练与RL接口的量化描述,以及一个用于研究从预训练到后训练整个流程中推理科学的受控测试平台。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:37

# 从预训练到后训练的推理理解  
来源:https://arxiv.org/html/2607.16097  
\\contribution  
\[⋆\\⋆\]同等贡献,通讯作者:jingyan\.s@nyu\.edu, al6843@nyu\.edu, pi390@nyu\.edu  
♠\{\\color\[rgb\]\{0\.33984375,0\.0234375,0\.55078125\}\\definecolor\[named\]\{pgfstrokecolor\}\{rgb\}\{0\.33984375,0\.0234375,0\.55078125\}\\spadesuit\}\]纽约大学  
▲\\blacktriangle\]Modal Labs  
♣\{\\color\[rgb\]\{0\.15234375,0\.453125,0\.68359375\}\\definecolor\[named\]\{pgfstrokecolor\}\{rgb\}\{0\.15234375,0\.453125,0\.68359375\}\\clubsuit\}\]加利福尼亚大学洛杉矶分校  
★\{\\color\[rgb\]\{0\.8359375,0\.4140625,0\.10546875\}\\definecolor\[named\]\{pgfstrokecolor\}\{rgb\}\{0\.8359375,0\.4140625,0\.10546875\}\\bigstar\}\]伊利诺伊大学厄巴纳-香槟分校  
◆\{\\color\[rgb\]\{0,0\.62109375,1\}\\definecolor\[named\]\{pgfstrokecolor\}\{rgb\}\{0,0\.62109375,1\}\\blacklozenge\}\]哥伦比亚大学  
Ang Li、Salman Rahman、Yifan Sun、Micah Goldblum、Matus Telgarsky、Pavel Izmailov  

\\[\[\[\[  
###### 摘要  
强化学习(RL)已成为提升大语言模型(LLM)在复杂推理任务上的核心手段,然而RL后训练通常独立于其前的预训练进行研究。因此,两个基本问题仍不明确:(1)预训练的选择(模型大小、数据)如何影响RL计算带来的收益;(2)RL究竟对模型做了什么?在常规LLM设置下研究这些问题困难重重:预训练语料庞大且不可控,难以将行为归因于预训练还是RL;同时对两个阶段进行系统性计算扫描也成本高昂。为应对这些挑战,我们利用国际象棋作为受控测试平台,研究从预训练到后训练全流程中的推理。我们遵循标准LLM训练流程:先在人类对弈棋局上预训练500万到10亿参数的模型,再对合成推理轨迹进行监督式微调,最后在可验证奖励函数的棋谜上运行RL。借助这一框架,我们建立了连接预训练与RL的缩放定律:在给定RL计算量下,后RL性能可通过预训练损失准确预测,且RL奖励曲线的斜率大致随预训练token数线性提升。在缩放规律之外,我们发现RL并非简单强化SFT策略:在简单谜题上,它放大SFT策略已偏好的正确走法;在困难谜题上,则浮现出SFT下近乎不存在的正确走法。我们进一步将发现拓展至国际象棋之外,在数学领域训练了一个1B语言模型,同样观察到类似预测模式:预训练更长的检查点在RL后性能更高,且RL下提升更快。总之,我们量化描述了预训练与RL的接口关系,并提供了一个可控测试平台,用于研究从预训练到后训练全流程的推理科学。

\\coloremojicode 1F917  
模型与数据集:[huggingface\.co/pavelslab\-nyu/pre2post\-chess](https://huggingface.co/collections/pavelslab-nyu/pre2post-chess)  
代码:[github\.com/pavelslab\-nyu/pre2post\-chess](https://github.com/pavelslab-nyu/pre2post-chess)  

## 1 引言  
大语言模型(LLM)的标准训练流程包括大规模预训练,随后进行后训练——通常是监督式微调(SFT)和基于可验证奖励的强化学习(RL)(guo2025deepseek; lambert2024tulu; yu2025dapo; zeng2025simplerl)。随着LLM持续扩展,关于额外计算能力应投入何方的观点开始分化。一方强调预训练先验:通过扩展模型规模、数据和计算量,从人类文本中产生更强的基模型(kaplan2020scaling; hoffmann2022training)。另一方强调经验:利用RL从环境交互和基于结果的反馈中学习,从而引出或发展超出直接模仿的能力。这一观点体现在“经验时代”的论述中(silver2025welcome),并以AlphaZero为代表——它去除了早期AlphaGo使用的模仿冷启动,仅凭自我对弈就学到了更强的策略(silver2016mastering; silver2017mastering)。对于LLM推理而言,纯经验方法尚不现实,因为其动作空间巨大,随机初始化的策略奖励初始时极其稀疏。因此,RL总是从预训练先验初始化,所以关键问题不是是否使用先验,而是先验需要多好。具体来说,固定计算预算应如何分配,以兼顾改进预训练模型和通过RL进一步优化?先前工作已为预训练建立了定量缩放定律(kaplan2020scaling; hoffmann2022training),并分别研究了后训练RL的缩放与配方(olmo2025olmo; khatri2025art),但尚无定量刻画预训练如何与RL缩放相互作用的成果。

参见图注  
图1:概览。(a) 我们引入了一个合成框架,用于在国际象棋领域研究从预训练到后训练的推理。 (b) 借助这一框架,我们建立了联合预训练–RL缩放定律,表明在固定计算预算下,预训练性能为RL性能提供了预测信号。 (c) 通过对策略演化的机制分析,我们展示RL能浮现出SFT策略下近乎不存在的走法。

一个相关问题是,RL实际上对其继承的预训练策略做了什么。近期工作显现出截然不同的观点。yue2025does认为RL主要强化基模型已偏好的推理模式,观察到基模型在pass@k(k较大时)上匹配甚至超越RL调优模型。yuan2025far持相反观点,认为RL将预训练技能组合成新技能。sun2025rl报告了两种行为,在某些问题上出现“顿悟”转变,在其他问题上则完全失败。这些竞争性观点对计算分配有直接影响:如果RL主要是强化,则应更多投入预训练计算;如果RL能真正发现,则应更多投入RL。

在训练于自然语言的推理LLM中直接研究这些问题颇具挑战性。对前沿规模的语言模型进行预训练和RL计算量的系统扫描成本过高,同时庞大且异质的预训练语料使得难以将行为归因于预训练或RL。此外,评估通常仅提供最终答案正确性,使得策略在单步推理中的行为大多不透明。这些障碍使得孤立研究预训练与RL的相互作用变得困难。

因此,我们利用国际象棋作为受控测试平台来研究这些问题,其训练流程设计为模仿标准LLM训练:在人类对弈棋局的token化序列上预训练,对合成推理轨迹进行监督式微调,以及基于可验证奖励的RL。国际象棋具有紧凑且显式的动作空间,走法质量可通过对局结果或强引擎精确验证,从而在推理轨迹的每一步提供真实标签。人类对弈数据丰富且可控:我们可以通过过滤玩家Elo等方式改变预训练语料的量、质量和构成,而无需复杂的数据混合选择。任务特化的小模型已能达到非平凡的棋力(ruoss2024amortized; zhang2024human; silver2017mastering),使得在预训练和RL上进行计算扫描既经济又信息量丰富:模型足够敏感,规模和RL计算量的变化能在性能和策略行为上产生可测量的差异。我们的目标不是构建最强棋类模型,而是利用国际象棋作为可操作的设置,孤立研究预训练规模与可验证RL的相互作用。

利用这一框架(图1),我们预训练了500万到10亿参数的模型,并扫描了36种预训练–RL组合。这使我们能够量化预训练选择如何塑造后续RL缩放,并在单步走法层面检查RL如何改变继承策略。我们进一步在数学领域文本训练的1B语言模型上检验了相同模式是否迁移。我们的贡献总结如下:

- • **用于预训练到后训练研究的受控国际象棋测试平台**。我们在国际象棋中实例化了标准LLM训练流程:对人类对弈进行预训练,对推理轨迹进行SFT,以及基于可验证奖励的RL。该设置支持对预训练和RL计算量进行系统扫描,并对策略推理轨迹进行详细分析(第2节)。
- • **联合预训练–RL缩放定律**。我们发现预训练损失能预测后RL的下游性能(以pass@1衡量),而本地RL斜率大致随预训练token数的对数线性增长。将此定律与Chinchilla式预训练损失缩放定律结合,我们可以评估由模型参数N、预训练token数T以及分配给强化学习的计算量C_RL所定义的各种假设配方。我们绘制了计算最优前沿,发现随着总计算量增长,最优分配会向更大的RL份额转移(第3节)。
- • **RL策略变化的机制**。我们分析了策略演化和推理动态。发现在简单谜题上,RL主要放大SFT策略已偏好的正确走法;在困难谜题上,它能浮现出近乎不存在的正确走法,但也会强化错误走法。这些异质性效应与RL提升pass@1但未能一致提升pass@k的观察相联系(第4节)。
- • **超越国际象棋的迁移证据**。对于一个固定1B语言模型(预训练于100亿–2000亿token的数学领域文本),更长的预训练与固定RL计算量下更高的性能以及更陡的本地RL缩放斜率相关联(第5节)。

总之,我们定量研究了预训练与后训练的接口,并提供了一种实用方法,用于在两个阶段之间推理计算分配。

## 2 框架:国际象棋作为推理测试平台  
我们的测试平台如图1所示,它镜像了标准语言模型训练流程,包含三个组件:在大规模人类对弈语料上的预训练(§2.1)、用于监督式微调的合成推理轨迹生成器(§2.2),以及基于可验证国际象棋谜题的RL环境(§2.3)。

**国际象棋表示**。遵循先前工作(zhang2024human),我们将每局棋表示为双方走法的交替序列,并序列化为token。借鉴SAN和UCI约定,我们将每步走法编码为四个token:`⟨piece⟩;⟨source⟩;⟨destination⟩;⟨flag⟩`,其中`⟨flag⟩`标记特殊情形,如升变、王车易位、吃过路兵、将军或将死。所得序列的任意有效前缀可唯一确定一个棋盘状态,完整词汇表大小为|V|=81。图1提供了示例。

### 2.1 人类对弈轨迹上的预训练  
在预训练阶段,模型从大规模人类对弈中学习合理走法序列的分布。我们从Lichess¹收集对弈轨迹,获得一个涵盖广泛玩家强度和结局的语料。该语料可沿玩家Elo、对弈长度等维度进行子采样,从而对数据组成进行精细控制。在此语料上,我们使用标准下一token预测目标,对token化对弈进行自回归策略训练。

### 2.2 基于合成推理轨迹的监督式微调  
在后训练中,我们在国际象棋谜题上训练模型:求解器需在每步选择唯一最佳走法,且每步走法可依据真实解法线精确验证。

**可验证的国际象棋谜题环境**。如图1所示,每个谜题指定初始棋盘状态s₀以及一条真实解法线,将谜题求解建模为一个多步交互决策问题,其中模型仅作为求解者行动,而非为双方生成走法。在每一步t,模型观察当前求解者状态sₜ并输出候选走法aₜ。环境然后将aₜ与真实最佳走法比较:不匹配则立即终止回合;匹配则要么完成谜题,要么触发相应对手回应,产生下一求解者状态sₜ₊₁。因此,模型每次只走一步:正确走法后,环境将对手的回应oₜ附加到上下文中,模型在生成aₜ₊₁时以此条件。遵循ruoss2024amortized,只有当模型在每步都选择正确求解者走法且完成完整解法线时,轨迹才被认为是成功的。我们在图7中展示了一个示例谜题对局。

在预训练期间,模型仅观察走法序列,未看到显式推理轨迹。先前的棋类模型通过MCTS和波束搜索等测试时搜索算法增强这些基策略,以在测试时恢复规划行为(silver2017mastering; zhang2024human)。我们转而采用镜像语言模型推理方式的方法:并非附加外部搜索程序,而是在上下文中引出推理,训练模型在提交走法前产生自己的推理轨迹。我们强调,对于我们的模型,推理发生在国际象棋走法token内,不依赖自然语言。

**合成推理轨迹构建**。受先前关于CoT生成工作启发(long2023large),我们将CoT综合为对局可能演变的序列化(图1)。直观上,推理轨迹是从预训练模型采样的一组合理对局演变,稍作重排以遵循树遍历结构。给定输入棋盘s₀,我们从提议策略中采样K条演变τ₁,…,τ_K。由于这些演变共享起始走法,我们通过共同前缀将它们合并为一棵以s₀为根的位置树,每个共享前缀只存一次。树有m≤K个叶子,对应不同的演变,并记τ̃₁,…,τ̃_m为相应的根到叶路径。我们按深度优先顺序序列化该树,形成推理轨迹:r = `<think>` τ̃₁ <sep> τ̃₂ <sep> ... τ̃_m `</think>`,其中<sep>分隔连续路径,`<think>`和`</think>`是界定推理的思考标签。提议策略p_θ_prop本身是来自第2.1节的预训练模型,因此生成的轨迹仍接近模型自身分布,而非来自外部搜索过程。

相似文章

理解从预训练到后训练的推理

Hugging Face Daily Papers

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。

重新审视后训练中的完整推理轨迹

Hugging Face Daily Papers

本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。

解密语言模型的强化学习后训练

arXiv cs.LG

本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。

后训练如何塑造生物学推理模型

Hugging Face Daily Papers

本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。