理解从预训练到后训练的推理

Hugging Face Daily Papers 论文

摘要

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。

强化学习(RL)已成为在复杂推理任务上改进大型语言模型(LLM)的核心方法,然而,后训练阶段的强化学习通常与之前的预训练相孤立地研究。因此,两个基本问题仍未解决:(1)预训练选择(模型大小、数据)如何影响强化学习计算资源的回报,以及(2)强化学习到底对模型做了什么?这些问题在标准的大语言模型设置中难以研究:预训练语料库庞大且不受控制,使得很难将行为归因于预训练还是强化学习,同时两个阶段的系统性计算扫描成本过高。为了解决这些挑战,我们使用国际象棋作为受控测试平台来研究从预训练到后训练整个流程中的推理。我们遵循标准的大语言模型训练流程,在人类对弈数据上预训练参数从500万到10亿的语言模型,在合成推理轨迹上进行监督微调(SFT),并对具有可验证奖励的国际象棋谜题运行强化学习。利用这一框架,我们发现,在给定的强化学习计算量下,后训练性能可以通过预训练损失很好地预测,并且强化学习奖励曲线的斜率大致随预训练令牌数量线性改善。在规模扩展之外,我们还发现强化学习并非简单地强化了SFT策略:在简单谜题上,它放大了SFT策略已经偏好的正确走法,而在困难谜题上,它揭示了SFT下几乎不存在的正确走法。我们进一步测试了这些发现是否迁移到国际象棋之外,通过在一个数学领域文本上训练一个10亿参数的语言模型,结果出现了相同的预测模式:预训练更长的检查点在强化学习后达到更高的性能,并且在强化学习下改进更快。总之,我们提供了预训练到强化学习接口的定量描述,以及一个用于研究从预训练到后训练整个流程中推理科学的受控测试平台。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:41

论文页面 - 从预训练到后训练理解推理

来源: https://huggingface.co/papers/2607.16097

摘要

强化学习(RL)已成为提升大语言模型(LLM)复杂推理能力的核心手段,然而目前对 RL 后训练的研究大多独立于其前的预训练。因此,两个基本问题仍未解决:(1) 预训练选择(模型规模、数据)如何影响 RL 计算的回报,(2) RL 实际上对模型做了什么?这些问题在标准 LLM 设置中难以研究:预训练语料庞大且不可控,使得行为归因于预训练还是 RL 变得困难,而同时在两个阶段进行系统计算量扫描的成本高昂。为应对这些挑战,我们采用国际象棋作为受控测试平台,研究从预训练到后训练全流程的推理。我们遵循标准 LLM 训练流程:在人类对弈棋局上预训练 5M 到 1B 参数的語言模型,对合成推理轨迹进行监督微调(SFT),并在可验证奖励的国际象棋谜题上运行 RL。利用这一框架,我们发现给定 RL 计算水平下的后 RL 性能可通过预训练损失良好预测,且 RL 奖励曲线的斜率随预训练 token 数近似线性提升。超越缩放规律,我们发现 RL 并非简单地锐化 SFT 策略:在简单谜题上,它放大了 SFT 策略已倾向的正确走法;而在困难谜题上,它浮现了在 SFT 下几乎不存在的正确走法。我们进一步测试了发现是否超越国际象棋:在数学领域文本上训练一个 1B 语言模型,相同的预测模式出现——预训练更长的检查点在 RL 后达到更高性能,并且在 RL 下提升更快。总之,我们提供了预训练到 RL 接口的定量说明,以及一个受控测试平台,用于研究从预训练到后训练全流程的推理科学。

查看 arXiv 页面 (https://arxiv.org/abs/2607.16097) 查看 PDF (https://arxiv.org/pdf/2607.16097) GitHub1 (https://github.com/pavelslab-nyu/pre2post-chess) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16097)

在您的智能体中获取本文:

hf papers read 2607.16097

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 2

pavelslab-nyu/Chess-SFT-Models 文本生成• 约7小时前更新 (https://huggingface.co/pavelslab-nyu/Chess-SFT-Models)

pavelslab-nyu/Chess-Pretrain-Models 文本生成• 约8小时前更新 (https://huggingface.co/pavelslab-nyu/Chess-Pretrain-Models)

引用本文的数据集 2

pavelslab-nyu/pretrain_v1_54B 约8小时前更新 • 1.01k • 1 (https://huggingface.co/datasets/pavelslab-nyu/pretrain_v1_54B)

pavelslab-nyu/chess_puzzle_benchmark 查看器• 约7小时前更新 • 2.36k • 387 (https://huggingface.co/datasets/pavelslab-nyu/chess_puzzle_benchmark)

引用本文的 Spaces 1

包含本文的收藏 2

相似文章

从预训练到后训练的推理理解

arXiv cs.CL

本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。

后训练如何塑造生物学推理模型

Hugging Face Daily Papers

本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。

重新审视后训练中的完整推理轨迹

Hugging Face Daily Papers

本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。