LLM预训练中的领域数据重复扩展研究
摘要
本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。
随着大型语言模型的扩展,其训练令牌预算也必须增加,以维持适当的每参数令牌数比(\(TPP\))。然而,高质量领域数据比一般网络数据更难扩展。随着模型大小和训练令牌预算的增加,其在训练混合数据中的比例趋于减少。重复可用的高质量数据提供了一种有效的方式来抵消这种稀释,但过度重复可能导致过拟合。我们在实际LLM扩展中研究这种权衡,其中训练令牌预算与模型大小成比例增长。对于固定领域,我们首先发现,在固定 \(TPP\) 下,最佳重复次数随模型大小轻微增加,这令人惊讶。在不同领域中,我们发现最佳重复次数与领域的最终验证损失强烈负相关:损失较低的领域通常可以从更多重复中受益。相比之下,唯一领域数据的数量与最佳重复次数仅弱相关。这些发现表明,在具有相同 \(TPP\) 的较小代理模型上调整的重复次数可以为较大模型提供实用的估计。
相似文章
数据约束下的混合预训练缩放定律
本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。
LLM持续预训练中最佳超参数的可预测缩放规律
本文发现了LLM持续预训练中最佳超参数(学习率、批量大小)的可预测缩放规律,提出了一个两阶段框架,可将超参数搜索开销降低高达90%,同时保持性能。
内部数据重复破坏语言模型
本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。
数据受限训练的规定性缩放定律
一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。
数据受限的语言模型预训练:改进的正则化与缩放定律
本文研究数据受限的语言模型预训练,提出了掩码输入正则化(MIR)以改进验证损失和下游性能,以及SoftQ,一种更好地捕捉重复数据下模型与数据交互的缩放定律。