@NielsRogge: 什么是中间训练?预训练与后训练之间的阶段 一个基础模型在更小、精选的数据集上继续训练……
摘要
解释中间训练作为预训练和后训练之间的一个阶段,基础模型在精选数据上继续训练,以增强特定能力,然后再进行指令微调。
查看缓存全文
缓存时间: 2026/06/02 15:43
什么是中期训练?
介于预训练和后训练之间的阶段
基础模型会在一个更小、经过精心策划的数据混合集上继续训练,这些数据旨在增强原始预训练过程中未充分涵盖的能力,例如多语言能力、领域知识或长上下文扩展。
它通常保持类似于预训练的目标,但使用更高质量或更有针对性的数据,以便后续的指令微调、偏好微调或强化学习可以在更强的能力基础上塑造行为。
了解更多:https://paperswithcode.co/methods/mid-training…
相似文章
Anthropic 研究人员详细介绍“模型规范中期训练”,该训练在预训练和微调之间增加一个阶段,以提升对齐训练的泛化能力
Anthropic 研究人员提出模型规范中期训练(MSM),这是一种介于预训练和微调之间的新训练阶段,旨在改善模型从对齐训练中泛化的能力,并减少代理性对齐失误。
UltraX:通过自适应程序化编辑大规模优化预训练数据
UltraX 提出了一种面向大规模预训练数据的函数调用式优化框架,在删除和修改之外引入插入操作,补全了编辑函数空间,从而实现细粒度的实例级编辑。该框架构建了可靠的程序监督生成流水线,在从头训练 1B 模型时,展示了更优的数据效率和模型性能。
@anyscalecompute: LLM 后训练是新的基线。选择错误的方法或 GPU 配置会导致浪费 36 小时的运行。推出…
Anyscale 推出了一款新的 LLM 后训练 Agent Skill,可自动选择最优的微调方法(SFT、DPO、GRPO 等)并生成可随时启动的配置,帮助避免 GPU 运行浪费。
后训练如何塑造生物学推理模型
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。
早期数据暴露提高后续微调的鲁棒性
本文表明,将后训练数据混合到预训练中(早期暴露)可以提高模型在后续微调后保留能力的鲁棒性,挑战了即时后训练性能预测保留的观点。对135M和1B模型的受控实验表明,早期暴露一致地改善了上游保留和下游性能之间的权衡。