近期LLM的进步主要来自预训练还是后训练?
摘要
一个讨论问题,探讨近期LLM的进步更多是由预训练还是后训练技术(如RL和微调)驱动,因为两者都需要大量计算资源。
根据我读到的内容,近期前沿LLM似乎普遍采用类似的Transformer架构,而许多可见的改进(推理、编码和代理行为)似乎来自后训练技术,例如监督微调、RL、偏好优化和工具使用训练。与此同时,实验室继续在预训练上投入大量计算资源,使用更大、更高质量的数据集,因此我认为预训练仍然承担了大部分重活。是否有任何研究、消融实验或行业经验可以揭示每个阶段对近期能力提升的贡献程度?是否存在一种日益增长的共识,即后训练现在是前沿模型之间的主要区分因素,还是预训练仍然负责大部分改进?
相似文章
预训练期间的RL探索:重新审视LLM训练的策略优化
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。
LLM预预训练的不稳定性:并非总是有帮助——一项跨多语言的研究
本文研究了在多种自然语言上使用人工语言对LLM进行预训练(预预训练)是否始终能提升token效率,发现其收益高度依赖于实验设置和随机种子,尽管对于使用Llama分词器的小模型,稳定收益在多数语言中出现。
为什么不能训练LLMs用一种优化的AI语言而非英语来思考?
一个推测性的讨论,质疑为什么LLMs没有被训练使用优化的内部语言而非自然语言来思考,以及这是否能提高效率。
@LakshyAAAgrawal: 从丰富的文本反馈(错误、轨迹、部分推理)中学习,对于LLM优化来说,优于仅使用标量奖励。…
快速-慢速训练(FST)将上下文优化(通过GEPA)与通过强化学习进行的模型权重更新交替进行,在数学、代码和物理推理上实现了比单独使用RL高3倍的样本效率,同时保持了可塑性并实现了持续学习。
后训练能否使LLM成为优秀的医疗编码员?生成式ICD编码的实证研究
这项实证研究探讨了后训练(监督微调和强化学习)能否提升LLM在自动化ICD编码上的表现,引入了一种名为PHI的诊断课程,扩展了GRPO以改进遗漏编码案例。结果表明,仅使用提示评估低估了LLM的潜力,SFT提供了主要的能力跃升,而RL进一步提升了性能。