LLM预训练中的领域数据重复扩展研究

Hugging Face Daily Papers 论文

摘要

本文研究了在LLM预训练中重复高质量领域数据以在模型扩展时维持性能的权衡,发现最佳重复次数随模型大小增加,并与领域验证损失呈负相关。

随着大型语言模型的扩展,其训练令牌预算也必须增加,以维持适当的每参数令牌数比(\(TPP\))。然而,高质量领域数据比一般网络数据更难扩展。随着模型大小和训练令牌预算的增加,其在训练混合数据中的比例趋于减少。重复可用的高质量数据提供了一种有效的方式来抵消这种稀释,但过度重复可能导致过拟合。我们在实际LLM扩展中研究这种权衡,其中训练令牌预算与模型大小成比例增长。对于固定领域,我们首先发现,在固定 \(TPP\) 下,最佳重复次数随模型大小轻微增加,这令人惊讶。在不同领域中,我们发现最佳重复次数与领域的最终验证损失强烈负相关:损失较低的领域通常可以从更多重复中受益。相比之下,唯一领域数据的数量与最佳重复次数仅弱相关。这些发现表明,在具有相同 \(TPP\) 的较小代理模型上调整的重复次数可以为较大模型提供实用的估计。
查看原文

相似文章

数据约束下的混合预训练缩放定律

arXiv cs.LG

本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。

内部数据重复破坏语言模型

arXiv cs.LG

本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。