近期LLM的进步主要来自预训练还是后训练?

Reddit r/ArtificialInteligence 新闻

摘要

一个讨论问题,探讨近期LLM的进步更多是由预训练还是后训练技术(如RL和微调)驱动,因为两者都需要大量计算资源。

根据我读到的内容,近期前沿LLM似乎普遍采用类似的Transformer架构,而许多可见的改进(推理、编码和代理行为)似乎来自后训练技术,例如监督微调、RL、偏好优化和工具使用训练。与此同时,实验室继续在预训练上投入大量计算资源,使用更大、更高质量的数据集,因此我认为预训练仍然承担了大部分重活。是否有任何研究、消融实验或行业经验可以揭示每个阶段对近期能力提升的贡献程度?是否存在一种日益增长的共识,即后训练现在是前沿模型之间的主要区分因素,还是预训练仍然负责大部分改进?
查看原文

相似文章

预训练期间的RL探索:重新审视LLM训练的策略优化

arXiv cs.LG

哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。

后训练能否使LLM成为优秀的医疗编码员?生成式ICD编码的实证研究

arXiv cs.CL

这项实证研究探讨了后训练(监督微调和强化学习)能否提升LLM在自动化ICD编码上的表现,引入了一种名为PHI的诊断课程,扩展了GRPO以改进遗漏编码案例。结果表明,仅使用提示评估低估了LLM的潜力,SFT提供了主要的能力跃升,而RL进一步提升了性能。