@DeFiMinty: 强化学习能否弥补弱预训练的不足?研究人员通过国际象棋谜题进行了测试,其中每个提议…
摘要
研究人员研究了强化学习(RL)与预训练质量之间的相互作用,表明预训练更强的模型从RL中获益更多,且RL无法完全弥补弱预训练的不足。还确定了预训练和后训练计算分配的联合缩放定律。
查看缓存全文
缓存时间: 2026/07/22 14:31
强化学习能否弥补预训练的不足?
研究人员用国际象棋谜题对此进行了测试——每一步提议的走法都可以对照已知解法进行验证。
他们在人类对局数据上预训练了从5M到1B参数的模型,随后进行了监督微调和强化学习。
预训练更好的模型在获得相同强化学习计算量后表现更优,且随着强化学习的持续进行,提升速度更快。预训练较弱的模型收益有限,这表明在此场景中,强化学习无法完全弥补预训练的不足。
强化学习的行为因谜题难度而异。在较简单的谜题上,它主要增加了模型原本就倾向的正确走法的置信度。在较难的谜题上,它有时会大幅提高之前被忽视的正确走法的出现概率,但也可能提高错误走法的置信度。
一个规模较小的实验使用1B数学模型发现了相同的规律:预训练更久的检查点在强化学习下表现更好。
强化学习似乎更能从扎实的基础上获得杠杆效应。
Pavel Izmailov (@Pavel_Izmailov): 新论文:理解从预训练到后训练中的推理过程!
我们研究了从预训练到后训练的完整LLM训练流程,发现了一个联合扩展定律,弄清楚了计算资源应如何分配,并研究了强化学习对策略的影响。
🧵
相似文章
从预训练到后训练的推理理解
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
理解从预训练到后训练的推理
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
@sebkrier: 用强化学习训练模型常常会导致奖励信号被操纵;例如,当你用LLM评判者处理模糊任务时……
辩论训练可以通过使用辩论对手来提高模糊任务的真实性准确度,从而减轻来自AI反馈的强化学习(RLAIF)中的奖励操纵。
预训练期间的RL探索:重新审视LLM训练的策略优化
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。
@ickma2311:CMU 高级 NLP:强化学习 我一直好奇 RL 如何作用于大模型,而这门 CMU 课程让我豁然开朗……
CMU 高级 NLP 课程讲清了强化学习如何优化整个输出的奖励(正确性、有用性、安全性),而非预训练/微调阶段的下一个 token 预测。