揭秘数据受限语言模型预训练中的训练时数据增强
摘要
本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。
查看缓存全文
缓存时间: 2026/06/23 17:43
论文页面 - 揭秘数据受限语言模型预训练中的训练时数据增强
来源:https://huggingface.co/papers/2606.16246
摘要
训练时数据增强技术有助于缓解自回归语言模型预训练中的过拟合问题,通过在固定数据集上进行多轮训练时,延迟性能恶化并提升最终模型质量。
随着人工智能实验室接近数据天花板——计算能力已超过高质量新文本的生成速度——语言模型预训练正转向一种数据受限、计算资源丰富的模式,这需要在固定语料库上进行高效的多轮训练(https://huggingface.co/papers?q=multi-epoch%20training)。标准自回归(AR)预训练在这种设置下严重过拟合,过早达到最优值后持续恶化。我们研究训练时数据增强(https://huggingface.co/papers?q=data%20augmentation)作为正则化手段,以缓解这种过拟合(https://huggingface.co/papers?q=overfitting),从而允许在相同数据上进行数百轮的有效训练。我们引入了三种正交的数据增强类别,用于自回归预训练:词元级噪声(https://huggingface.co/papers?q=token-level%20noise)(掩码、随机替换)、序列排列(https://huggingface.co/papers?q=sequence%20permutations)(从右到左预测、填空式预测)以及目标偏移预测(https://huggingface.co/papers?q=target%20offset%20prediction)(对于 i > 1 预测 x_{t+i})。通过系统性消融实验,我们发现各单项增强手段相对于基准线都能延迟过拟合(https://huggingface.co/papers?q=overfitting)并降低验证损失(https://huggingface.co/papers?q=validation%20loss),其中随机词元替换在单项方法中达到了最佳的最小损失。组合多个增强类别可进一步降低最小验证损失(https://huggingface.co/papers?q=validation%20loss)。我们的实验表明,数据增强(https://huggingface.co/papers?q=data%20augmentation)能够缓解自回归预训练的数据效率低下问题,并为数据受限场景(https://huggingface.co/papers?q=data-constrained%20regime)提供了一种有前景的解决方案~\footnote{所有代码和数据可在 https://github.com/michaelchen-lab/data-augmentations-for-pretraining 获取。}
查看 arXiv 页面(https://arxiv.org/abs/2606.16246) 查看 PDF(https://arxiv.org/pdf/2606.16246) GitHub3(https://github.com/michaelchen-lab/data-augmentations-for-pretraining) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.16246)
将该论文集成到您的 agent 中:
hf papers read 2606.16246
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.16246 以便在此页面建立链接。
引用此论文的数据集 0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.16246 以便在此页面建立链接。
引用此论文的 Spaces 0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.16246 以便在此页面建立链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)以便在此页面建立链接。
相似文章
数据受限的语言模型预训练:改进的正则化与缩放定律
本文研究数据受限的语言模型预训练,提出了掩码输入正则化(MIR)以改进验证损失和下游性能,以及SoftQ,一种更好地捕捉重复数据下模型与数据交互的缩放定律。
随机分词法提高模型鲁棒性
本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。
高效训练语言模型执行中间填充任务
OpenAI 提出了一种简单的数据增强技术,使自回归语言模型能够执行填充中间(FIM)文本生成任务,同时不损害从左到右的性能。文章还提供了广泛的消融研究和训练此类模型的最佳实践。
翻译作为数据增强:翻译数据对难度评估的影响
本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。
通过字节级模拟解耦子词分词对语言模型训练的益处
本文通过进行受控的字节级预训练实验,研究了子词分词对LLM训练效率和性能的影响。它揭示了关键因素,如训练吞吐量以及将子词边界作为语言先验的整合。