数据约束下的混合预训练缩放定律

arXiv cs.LG 论文

摘要

本文研究了在混合预训练中稀缺目标数据与丰富通用数据之间的权衡,发现重复是驱动性能的关键因素,并且混合训练能容忍目标数据重复15-20次。我们引入了一个考虑重复影响的缩放定律,以优化数据约束条件下的混合配置。

arXiv:2605.12715v1 公告类型:新论文 摘要:随着语言模型规模的增长,它们所需的数据量也在增加——然而许多目标数据源,如低资源语言或专业领域,其规模本质上是有限的。一种常见策略是将这些稀缺但有价值的目标数据与丰富的通用数据混合,这带来了一个基本权衡:混合中目标数据过少会导致模型对目标领域暴露不足,而目标数据过多则会过度重复相同样本,导致收益递减甚至过拟合。我们通过超过2000次语言模型训练实验研究了这一权衡,涵盖了多种模型规模、目标数据集大小以及多种数据类型,包括多语言、领域特定和质量过滤的混合。在所有设置中,我们发现重复是目标领域性能的核心驱动因素,并且混合训练比单一来源训练能容忍更高的重复次数:稀缺的目标语料库可以重复使用15-20次,最佳重复次数取决于目标数据大小、计算预算和模型规模。接着,我们引入了一个考虑重复影响的混合缩放定律,该定律考虑了重复目标标记的价值递减以及通用数据的正则化作用。优化这一缩放定律为计算有效的混合配置提供了一种原则性方法,从而为数据约束下的预训练提供了实用的混合建议。
查看原文
查看缓存全文

缓存时间: 2026/05/14 06:17

# 数据约束下混合预训练的缩放定律 来源:https://arxiv.org/html/2605.12715 \(2026年5月12日\) ###### 摘要 随着语言模型规模的扩大,它们所需的数据量也在增长——然而许多目标数据源,例如低资源语言或专业领域,本质上规模有限。一种常见策略是将这些稀缺但有价值的目标数据与丰富的通用数据混合,这带来了一个基本权衡:混合中目标数据过少会导致模型对目标领域接触不足,而目标数据过多则会过度重复相同的样本,导致收益递减并最终过拟合。我们通过超过2000次语言模型训练实验研究了这一权衡,这些实验涵盖了多种模型规模、目标数据集大小以及多种数据类型,包括多语言、特定领域和质量过滤混合数据。在所有设置中,我们发现重复是目标领域性能的核心驱动力,并且混合训练能容忍比单源训练高得多的重复次数:稀缺的目标语料库可以重复使用15–20次,最佳重复次数取决于目标数据规模、计算预算和模型规模。接下来,我们引入了一个考虑重复目标token价值递减以及通用数据正则化作用的重复感知混合缩放定律。优化该缩放定律为计算有效的混合配置提供了原则性方法,从而为数据约束下的预训练提供实用的混合建议。 参见说明图1:143M模型、50M德语token与英语混合时的重复动态,定义德语数据在训练混合中的权重。(a) 重复因子\(r\)随训练token增长;超过重复边界后,损失开始增加。(b) 德语验证损失与训练token的关系。星号表示过拟合开始点。## 1 引言 大型语言模型(LLM)在语言理解、数学、科学和知识密集型任务中展现出卓越性能 (luong2025advanced; woodruff2026accelerating; singh2025openai; antropic2026)。尽管这一成功很大程度上归功于超过数万亿token的大规模预训练语料库 (hojel2025essential; li2024datacomp),但许多语言模型预训练场景涉及的数据无法自由扩展,包括低资源语言、专业领域和精心策划的数据集,这些数据提供的独特数据量要少得多。在预训练期间,这些数据与丰富的通用数据混合,例如将低资源语言文本与英语文本配对,或将特定领域的数学语料库与通用网络文本配对。 参见说明图2:539M模型在不同目标数据规模下可实现的最佳德语测试损失。然而,混合引入了新的权衡。有限的数据必须重复足够多的训练次数,以提供足够的目标领域信号,但高重复会导致记忆和最终的过拟合。图1 (https://arxiv.org/html/2605.12715#S0.F1) 展示了143M模型与50M德语token混合英语时的这一挑战。较高的德语数据比例开始过拟合(图1 (https://arxiv.org/html/2605.12715#S0.F1)b),因为重复次数跨越了边界(图1 (https://arxiv.org/html/2605.12715#S0.F1)a)。这引出了一个问题:当混合中的目标数据受限时,模型规模、数据规模和重复如何共同影响混合预训练的结果? 先前的研究分别探讨了这两个维度。muennighoff2023scaling 推导了数据约束训练的缩放定律,表明在一个固定的整体数据集上重复多达4次的价值几乎与独特数据相当。然而,这一被广泛采纳为数据重复实际上限的结果适用于单源训练,其中*所有*token都被重复。在混合预训练中,只有受约束的领域被重复,而通用领域继续提供新鲜token,这是一个结构上不同的机制。相反,数据混合定律 (ye2024data; xie2024doremi; shukor2025scalinglawsoptimaldata) 优化训练混合的组成以最大化下游性能,但假设每个数据源都有无限数据。我们的工作位于两者的交叉点:我们研究如何将数据约束源与丰富源最优混合,共同优化混合权重和重复——这是许多实际预训练场景中出现的情况。我们的贡献如下: - • 一项超过2000次训练运行的系统实证研究,涵盖模型规模从101M到805M参数、不同的目标数据规模以及多种数据类型:多语言(德语、法语、斯瓦希里语)、多领域(数学、科学论文、维基百科)和质量过滤子集。 - • 关于数据混合中重复的实证发现:重复token在所有数据类型中都遵循可预测的收益递减;最佳重复次数随目标数据集大小和计算预算呈比例变化;较大的模型尽管过拟合更快,但始终能从有限数据中提取更多信息。关键在于,丰富的通用数据能维持学习,并实现比单源训练报告中高得多的重复次数而性能不降,目标任务性能的最佳重复次数达到15–20倍(图2 (https://arxiv.org/html/2605.12715#S1.F2))。 - • 一个位于数据约束训练和混合优化交叉点的缩放定律,能够预测目标域损失与目标数据规模、混合比例和模型规模的关系。我们证明该缩放定律可以在小规模上拟合,然后外推到更大规模,并且可用于准确估计最佳重复次数。我们还将发现扩展到两个稀缺目标领域的情况。 综合来看,我们的发现既提供了关于重复在数据混合中行为的实证理解,也提供了一个用于在有限目标数据上进行有效训练的预测缩放定律。 ## 2 相关工作 ### 神经缩放定律 语言模型缩放定律的研究由 kaplan2020scaling 推广,他们表明损失随模型规模、数据集大小和计算量呈现幂律下降。hoffmann2022training 通过 Chinchilla 缩放定律完善了这些发现,建立了平衡模型大小和数据的计算最优训练方案。与我们的工作相关,muennighoff2023scaling 将 Chinchilla 泛化到单个数据约束领域,发现重复数据大约四个epoch仅引起可忽略的退化,有意义的收益可扩展到大约16个epoch,并在40个epoch结束。他们提出了建模重复token价值递减的缩放定律。后续工作将缩放定律扩展到下游任务性能 (wei2022emergent)、混合专家架构 (abnar2025parameters; krajewski2024scaling; wang2024scaling)、持续预训练 (que2024d; liew2025acceleration; seto2026optimal)、微调 (bethune2025scaling; zhang2024scaling) 和数据质量 (chang2024scaling)。我们的工作扩展了这一研究方向,提供了数据约束混合的预测缩放定律,这是一个探索不足的机制,其中数据混合中只有一个组件是无限的,而其他组件受到严重限制。 ### 语言模型的数据混合 在多个数据领域上训练已成为标准,语料库从多个网络来源聚合 (gao2020pile; cerebras2023slimpajama; soldaini2024dolma),每个领域的数据量不同,最近的模型在精心调优的领域混合上训练 (bakouch2025smollm3; olmo2025olmo)。先前的工作也关注使用分布鲁棒优化优化领域权重 (xie2024doremi; fan2024doge),或通过聚类预训练语料库发现领域 (diaonemotron; grangier2025task)。领域混合缩放定律 (DMSL) 框架 (ye2024data; shukor2025scalinglawsoptimaldata) 建模了每个领域损失如何依赖于混合权重和总计算量。我们的重复感知缩放定律基于 DMSL,通过纳入数据重复的影响(当任何混合组件数据受限时变得关键)。最后,anonymous2026mixdonttune 比较了数据混合与超参数调优(权重衰减、学习率)作为数据约束预训练的竞争策略。我们工作的重点是通过表征混合比例、重复和模型规模如何共同决定目标域损失,从而在选定混合后如何最优设置混合,这消除了对每个配置进行扫描的需要。 ### 数据约束预训练 多项工作研究了数据约束预训练。hernandez2022scaling 提出了多epoch训练中重复数据价值的参数模型,而 goyal2024scaling 比较了重复高质量数据与在新鲜但较低质量的数据上训练,得出结论:过滤的益处取决于总计算预算。当目标域的高质量数据受限时,合成数据已被用作重复的替代方案。gunasekar2023textbook 在合成的"教科书质量"数据上预训练,而 maini2024rephrasing 证明重新表述网络数据为重复数据提供了替代方案。对于多领域设置,seto2025training 研究了当目标语言数据受限时预训练双语模型,表明在类型学相近的语言中,高质量的辅助语言数据可以部分替代目标语言数据,但模型缩放存在收益递减。低资源语言建模面临类似的约束,与高资源语言混合是一种常见策略 (joshi2020state)。本研究探讨了至少一个目标领域数据受限且其他通用数据不受限的不同场景,并提供了确定目标域损失的方案。这与旨在通过构建更多目标数据或纳入更多通用数据来提高数据多样性的其他方法不同。 ## 3 方法论:混合训练与数据集 我们考虑一个包含两个数据源的混合预训练设置,其中一个**目标**源规模有限,而一个**通用**源提供近乎无限的数据。设 \(D_{\text{target}}\) 为目标数据规模,即唯一目标领域token的数量;\(D_{\text{total}}\) 为训练总token数(即总计算预算);而 \(h \in [0,1]\) 为 \(D_{\text{total}}\) 中分配给目标领域的比例。重复次数 \(r\) 是唯一目标token在整个训练中被重复的次数: 
\[
r = h \cdot D_{\text{total}} / D_{\text{target}}.
\] 
对于固定的计算预算 \(D_{\text{total}}\) 和数据池 \(D_{\text{target}}\),增加目标权重 \(h\) 会增加重复因子 \(r\),反之亦然。假设通用领域足够丰富,永远不会重复。我们在第7节 (https://arxiv.org/html/2605.12715#S7) 中将该框架扩展到多个受约束的目标领域。 为了测试重复-多样性权衡是否具有泛化性,我们研究了实践中常见的三种数据约束场景:有限的目标语言数据(多语言)、有限的专门领域数据(多领域)和有限的高质量数据(质量过滤)。 ### 多语言 目标领域是来自 FineWeb2 (penedo2025fineweb2) 的德语文本,人工限制为 50M、100M、500M 或 1B token(请注意:在我们所有的实验设置中,每个较小的集合都是较大集合的子集),以及一个无限(无约束)设置。通用领域是来自 FineWeb (penedo2024fineweb) 的英语网络文本,被视为近乎无限。为了验证发现不是语言特异性的,我们使用法语和斯瓦希里语作为目标语言(也来自 FineWeb2)进行了 50M、100M 和 500M 数据规模的实验。评估在相应语言的 FineWeb2 留出集上进行。 参见说明图3:143M模型在三种目标数据预算下的德语验证损失与总训练token的关系。每条曲线对应不同的目标权重 \(h\)。 参见说明图4:不同模型规模下,三种数据约束规模的经验最优 \(r\) 与训练token的关系。最优重复次数随训练预算稳步增长。 ### 多领域 目标领域是 OpenWebMath (paster2023openwebmath),一个数学网页集合,限制为 10M、100M 或 1B token。通用领域是 DCLM (gadre2024language) 的子集,一个大规模精选的英语网络语料库。我们还使用维基百科和 peS2o (soldaini2023pes2o)(一个来自 Semantic Scholar 的科学论文语料库)进行了三领域实验,两者均来自 OLMo 数据混合 (walsh2024olmo2),数据集大小分别为 10M–500M 和 50M–2.5B。作为通用领域,我们使用 Fineweb 和 Nemotron-CC (dash2024nemotroncc)。评估在相应数据集的留出集上进行。 ### 质量 我们使用原始的 fasttext 质量分类器对 DCLM (li2024datacomp) 文档进行评分,并选择 DCLM 基础语料库的前 {1, 5, 10, 20}% 作为**高质量** (HQ) 目标集,以完整的 DCLM 基础数据作为**低质量**通用集。与不同的领域和语言实验不同,探索数据质量使我们能够研究来自数据约束领域的数据量与目标领域接近度之间的权衡。更严格的过滤会产生更小的 HQ 数据集,因此在给定的 \(h\) 下重复更多,但数据平均而言预计更接近目标集。相反,较低的过滤百分比会产生更多数据,但离目标集更远。评估在用于训练原始分类器的数据上进行。 实验使用 GPT-2 风格的自回归解码器专用 Transformer 语言模型,规模从 101M 到 805M 非嵌入参数(完整架构规格见附录10 (https://arxiv.org/html/2605.12715#S10))。模型训练大约 \(100 \times N\) 个 token,其中 \(N\) 是非嵌入参数数量,这是一个足以观察数据重复带来的好处以及最终退化的时间范围。数据源在样本级别混合:每个小批量包含从目标集以概率 \(h\) 和从通用集以概率 \(1-h\) 独立采样的样本。 ## 4 实证发现 由于篇幅限制,我们主要通过德语-英语双语设置呈现结果,模拟低资源场景。其他语言和领域的结果一致,并在附录11 (https://arxiv.org/html/2605.12715#S11) 中讨论。 ### 数据重复导致可预测的过拟合 图3 (https://arxiv.org/html/2605.12715#S3.F3) 显示了143M模型在三种目标数据集大小上的目标域损失,每条曲线对应不同的目标权重 \(h\)。当 \(h\) 强制高重复时,损失先改善然后急剧上升,反映了过拟合。较大的目标数据集会延迟这种退化,因为相同的 \(h\) 产生的重复较少(公式3.1 (https://arxiv.org/html/2605.12715#S3.E1))。关键的是,在所有设置中,过拟合的开始仅由重复因子 \(r\) 控制,即相同的目标权重根据可用数据集可能是安全或有害的,但相同的 \(r\) 无论怎样达到都会持续引发退化。这种阈值跨数据规模、模型规模和领域的一致性激发了第5节 (https://arxiv.org/html/2605.12715#S5) 中的缩放定律。

相似文章

数据受限训练的规定性缩放定律

Hugging Face Daily Papers

一种考虑数据重复效应的修正缩放定律,为数据受限场景提供了计算最优的训练策略,表明超出某一界限后,进一步重复会适得其反,计算资源应更明智地用于模型容量。