@DeFiMinty: 强化学习能否弥补弱预训练的不足?研究人员通过国际象棋谜题进行了测试,其中每个提议…

X AI KOLs Timeline 论文

摘要

研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。

强化学习能否弥补弱预训练的不足? 研究人员通过国际象棋谜题对此进行了测试,其中每个提出的走法都可以对照已知解法进行验证。 他们在人类棋局上预训练了参数规模从5M到1B的模型,然后应用监督微调和RL。 预训练更好的模型在接收相同RL计算量后表现更优,并且随着RL持续训练,提升速度更快。弱预训练模型的收益有限,这表明在此设置下RL无法完全弥补预训练不足。 RL的行为因谜题难度而异。对于较容易的谜题,它主要提升了模型原本就倾向的正确走法的置信度。对于较难的谜题,它有时会使之前被忽略的正确走法变得更为可能,但也可能增加错误走法的置信度。 一项使用1B数学模型的较小规模实验发现了相同模式:预训练时间更长的检查点在RL下表现更好。 RL似乎能从一个强大的基础中获得更大的杠杆作用。
查看原文
查看缓存全文

缓存时间: 2026/07/22 14:31

强化学习能否弥补预训练的不足?

研究人员用国际象棋谜题对此进行了测试——每一步提议的走法都可以对照已知解法进行验证。

他们在人类对局数据上预训练了从5M到1B参数的模型,随后进行了监督微调和强化学习。

预训练更好的模型在获得相同强化学习计算量后表现更优,且随着强化学习的持续进行,提升速度更快。预训练较弱的模型收益有限,这表明在此场景中,强化学习无法完全弥补预训练的不足。

强化学习的行为因谜题难度而异。在较简单的谜题上,它主要增加了模型原本就倾向的正确走法的置信度。在较难的谜题上,它有时会大幅提高之前被忽视的正确走法的出现概率,但也可能提高错误走法的置信度。

一个规模较小的实验使用1B数学模型发现了相同的规律:预训练更久的检查点在强化学习下表现更好。

强化学习似乎更能从扎实的基础上获得杠杆效应。

Pavel Izmailov (@Pavel_Izmailov): 新论文:理解从预训练到后训练中的推理过程!

我们研究了从预训练到后训练的完整LLM训练流程,发现了一个联合扩展定律,弄清楚了计算资源应如何分配,并研究了强化学习对策略的影响。

🧵

相似文章

从预训练到后训练的推理理解

arXiv cs.CL

本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。

理解从预训练到后训练的推理

Hugging Face Daily Papers

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。