理解从预训练到后训练的推理
摘要
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
查看缓存全文
缓存时间: 2026/07/20 09:41
论文页面 - 从预训练到后训练理解推理
来源: https://huggingface.co/papers/2607.16097
摘要
强化学习(RL)已成为提升大语言模型(LLM)复杂推理能力的核心手段,然而目前对 RL 后训练的研究大多独立于其前的预训练。因此,两个基本问题仍未解决:(1) 预训练选择(模型规模、数据)如何影响 RL 计算的回报,(2) RL 实际上对模型做了什么?这些问题在标准 LLM 设置中难以研究:预训练语料庞大且不可控,使得行为归因于预训练还是 RL 变得困难,而同时在两个阶段进行系统计算量扫描的成本高昂。为应对这些挑战,我们采用国际象棋作为受控测试平台,研究从预训练到后训练全流程的推理。我们遵循标准 LLM 训练流程:在人类对弈棋局上预训练 5M 到 1B 参数的語言模型,对合成推理轨迹进行监督微调(SFT),并在可验证奖励的国际象棋谜题上运行 RL。利用这一框架,我们发现给定 RL 计算水平下的后 RL 性能可通过预训练损失良好预测,且 RL 奖励曲线的斜率随预训练 token 数近似线性提升。超越缩放规律,我们发现 RL 并非简单地锐化 SFT 策略:在简单谜题上,它放大了 SFT 策略已倾向的正确走法;而在困难谜题上,它浮现了在 SFT 下几乎不存在的正确走法。我们进一步测试了发现是否超越国际象棋:在数学领域文本上训练一个 1B 语言模型,相同的预测模式出现——预训练更长的检查点在 RL 后达到更高性能,并且在 RL 下提升更快。总之,我们提供了预训练到 RL 接口的定量说明,以及一个受控测试平台,用于研究从预训练到后训练全流程的推理科学。
查看 arXiv 页面 (https://arxiv.org/abs/2607.16097) 查看 PDF (https://arxiv.org/pdf/2607.16097) GitHub1 (https://github.com/pavelslab-nyu/pre2post-chess) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.16097)
在您的智能体中获取本文:
hf papers read 2607.16097
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 2
pavelslab-nyu/Chess-SFT-Models 文本生成• 约7小时前更新 (https://huggingface.co/pavelslab-nyu/Chess-SFT-Models)
pavelslab-nyu/Chess-Pretrain-Models 文本生成• 约8小时前更新 (https://huggingface.co/pavelslab-nyu/Chess-Pretrain-Models)
引用本文的数据集 2
pavelslab-nyu/pretrain_v1_54B 约8小时前更新 • 1.01k • 1 (https://huggingface.co/datasets/pavelslab-nyu/pretrain_v1_54B)
pavelslab-nyu/chess_puzzle_benchmark 查看器• 约7小时前更新 • 2.36k • 387 (https://huggingface.co/datasets/pavelslab-nyu/chess_puzzle_benchmark)
引用本文的 Spaces 1
包含本文的收藏 2
相似文章
从预训练到后训练的推理理解
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
后训练如何塑造生物学推理模型
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。
Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models
This paper investigates internal representational differences between RL and SFT fine-tuned models on mathematical reasoning, finding that RL models exhibit more linearly separable hidden states and hierarchical layer importance. Token allocation variability under repeated sampling suggests training pipeline dependence rather than RL vs SFT alone.
@DeFiMinty: 强化学习能否弥补弱预训练的不足?研究人员通过国际象棋谜题进行了测试,其中每个提议…
研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。
重新审视后训练中的完整推理轨迹
本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。