揭秘数据受限语言模型预训练中的训练时数据增强

Hugging Face Daily Papers 论文

摘要

本文研究了在数据受限、算力充足的场景下,为缓解自回归语言模型预训练中的过拟合而采用训练时数据增强技术,发现结合词元级噪声、序列排列和目标偏移预测可以改善验证损失。

随着AI实验室接近数据天花板,计算能力超过新高质量文本生成速度,语言模型预训练正在转向数据受限、算力充足的场景,这要求在固定语料库上进行高效的多轮训练。标准自回归(AR)预训练在此设置下严重过拟合,早期达到最优后持续恶化。我们研究了训练时数据增强作为正则化器来缓解过拟合,并实现在相同数据上进行数百轮的高效训练。我们引入了三类正交的AR预训练增强方法:词元级噪声(掩码、随机替换)、序列排列(从右到左预测、填充中间)和目标偏移预测(x_{t+i},其中i>1)。通过系统消融实验,我们发现单个增强方法能延迟过拟合并降低验证损失(相比基线),其中随机词元替换在单项方法中达到了最佳最低损失。组合增强类别进一步降低了最低验证损失。我们的实验表明,数据增强缓解了AR预训练的数据低效问题,并为数据受限场景提供了一个有前景的解决方案~\footnote{所有代码和数据可在 https://github.com/ michaelchen-lab/ data-augmentations-for-pretraining 获取。}
查看原文
查看缓存全文

缓存时间: 2026/06/23 17:43

论文页面 - 揭秘数据受限语言模型预训练中的训练时数据增强

来源:https://huggingface.co/papers/2606.16246

摘要

训练时数据增强技术有助于缓解自回归语言模型预训练中的过拟合问题,通过在固定数据集上进行多轮训练时,延迟性能恶化并提升最终模型质量。

随着人工智能实验室接近数据天花板——计算能力已超过高质量新文本的生成速度——语言模型预训练正转向一种数据受限、计算资源丰富的模式,这需要在固定语料库上进行高效的多轮训练(https://huggingface.co/papers?q=multi-epoch%20training)。标准自回归(AR)预训练在这种设置下严重过拟合,过早达到最优值后持续恶化。我们研究训练时数据增强(https://huggingface.co/papers?q=data%20augmentation)作为正则化手段,以缓解这种过拟合(https://huggingface.co/papers?q=overfitting),从而允许在相同数据上进行数百轮的有效训练。我们引入了三种正交的数据增强类别,用于自回归预训练:词元级噪声(https://huggingface.co/papers?q=token-level%20noise)(掩码、随机替换)、序列排列(https://huggingface.co/papers?q=sequence%20permutations)(从右到左预测、填空式预测)以及目标偏移预测(https://huggingface.co/papers?q=target%20offset%20prediction)(对于 i > 1 预测 x_{t+i})。通过系统性消融实验,我们发现各单项增强手段相对于基准线都能延迟过拟合(https://huggingface.co/papers?q=overfitting)并降低验证损失(https://huggingface.co/papers?q=validation%20loss),其中随机词元替换在单项方法中达到了最佳的最小损失。组合多个增强类别可进一步降低最小验证损失(https://huggingface.co/papers?q=validation%20loss)。我们的实验表明,数据增强(https://huggingface.co/papers?q=data%20augmentation)能够缓解自回归预训练的数据效率低下问题,并为数据受限场景(https://huggingface.co/papers?q=data-constrained%20regime)提供了一种有前景的解决方案~\footnote{所有代码和数据可在 https://github.com/michaelchen-lab/data-augmentations-for-pretraining 获取。}

查看 arXiv 页面(https://arxiv.org/abs/2606.16246) 查看 PDF(https://arxiv.org/pdf/2606.16246) GitHub3(https://github.com/michaelchen-lab/data-augmentations-for-pretraining) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.16246)

将该论文集成到您的 agent 中:

hf papers read 2606.16246

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.16246 以便在此页面建立链接。

引用此论文的数据集 0

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.16246 以便在此页面建立链接。

引用此论文的 Spaces 0

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.16246 以便在此页面建立链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

请将此论文添加到一个收藏集(https://huggingface.co/new-collection)以便在此页面建立链接。

相似文章

随机分词法提高模型鲁棒性

arXiv cs.CL

本论文证明了使用随机分词而非确定性标准分词来训练大型语言模型,可以显著提升模型对对抗攻击和随机扰动的鲁棒性。这种改进在预训练、微调和上下文学习阶段都有表现,且不会增加推理成本。

高效训练语言模型执行中间填充任务

OpenAI Blog

OpenAI 提出了一种简单的数据增强技术,使自回归语言模型能够执行填充中间(FIM)文本生成任务,同时不损害从左到右的性能。文章还提供了广泛的消融研究和训练此类模型的最佳实践。

翻译作为数据增强:翻译数据对难度评估的影响

arXiv cs.CL

本文提出了一种跨语言数据增强策略,利用机器翻译将专家标注的难度标签从高资源语言迁移到低资源语言。基于BERT的回归模型实验表明,用翻译语料库增强稀缺的本土数据显著提高了文本难度评估的准确性。