@jchudnov: 飞往 #ICML2026 展示 Oral 论文《Internal Data Repetition Destroys Language Models》,在 Foundations of Deep Gen Models Workshop 上

X AI KOLs Following 论文

摘要

一项新研究量化了语言模型预训练中重复数据造成的损害,表明即使是激进的去重也会留下有害的重复,可能浪费多达三分之一的算力 FLOPs。

飞往 #ICML2026 展示 Oral 论文《Internal Data Repetition Destroys Language Models》,在 Foundations of Deep Gen Models Workshop 上! 论文:https://arxiv.org/abs/2606.24998 你可能会好奇我们说的“摧毁”是什么意思!预训练现在受数据限制,即使经过激进去重的语料库也会保留一些重复。我们衡量了这种重复实际付出的代价——以实践者关心的算力为指标。最坏情况下,答案是你三分之一的 FLOPs。
查看原文
查看缓存全文

缓存时间: 2026/07/05 16:34

飞往 #ICML2026 展示《内部数据重复会摧毁语言模型》,这是深度生成模型基础研讨会的一项口头报告!论文:https://arxiv.org/abs/2606.24998 你可能会好奇,“摧毁”是什么意思!预训练现在受数据限制,即使经过激进去重的语料库仍保留了一些重复。我们测量了这种重复在实际从业者关心的计算成本方面究竟代价几何。在最坏情况下,答案是你的FLOPs的三分之一。 — # 内部数据重复会摧毁语言模型 来源:https://arxiv.org/html/2606.24998 Jessica Chudnovsky* 1Joshua Kazdan* 2Noam Levi* 3Rylan Schaeffer1Yegor Denisov-Blanch1Bo He4Mehmet Donmez4Sanmi Koyejo† 1David Donoho† 2 ###### 摘要 语言模型的高质量训练数据正在耗尽,即使经过激进去重的语料库也保留了一定数量的重复。早期的对照研究早于Chinchilla风格的缩放定律,只能间接测量重复的代价。我们在Chinchilla时代重新审视重复问题,使用拟合的无重复缩放定律来报告计算等效增益和计算等效损失。我们表明,在这种现代化范式下,重复损害在三个方面具有系统性。首先,在分配给重复数据的计算量固定的情况下,评估损失在中等重复次数RR处达到峰值;将中等大小的子集重复中等次数比将大子集重复几次或小子集重复多次对性能的损害更大。其次,该峰值的位置符合模型大小的幂律;这个缩放定律揭示,最具破坏性的重复数据增长速度快于计算量。最后,当重复文档在受控的精确文档重复设置中消耗10%的FLOPs预算时,计算等效损失可能很大:在FineWeb-Edu-Dedup上,对于OT=1\mathrm{OT}=1的Qwen3风格344M参数模型,最具破坏性的重复次数产生的损失与使用67% FLOPs的无重复运行相匹配。我们证明这些现象并非语言模型特有,并且可以在一个简单的统计模型中得到分析性理解:一个带有逐字重复的错误指定线性回归再现了相同的定性损失峰值,量化了这种峰值如何源于记忆化和泛化之间的统计权衡。我们的发现为语言模型中的重复研究增加了精确性,使从业者能够量化预训练语料库中重复的存在和重复结构所浪费的计算量。 11footnotetext:同等贡献。†资深作者。1斯坦福大学计算机科学系。2斯坦福大学统计学系。3特拉维夫大学。4IMC Trading。通讯作者:[email protected] (https://arxiv.org/html/2606.24998v1/mailto:[email protected]). ## 1引言 预训练已经进入数据受限时代。用于前沿训练的高质量公开文本语料库已经耗尽[1 (https://arxiv.org/html/2606.24998#bib.bib1),2 (https://arxiv.org/html/2606.24998#bib.bib2)],迫使采用多轮次训练。为了在预训练中保持数据效率,FineWeb-Edu、DataComp-LM、Dolma和RedPajama-v2[3 (https://arxiv.org/html/2606.24998#bib.bib3),4 (https://arxiv.org/html/2606.24998#bib.bib4),5 (https://arxiv.org/html/2606.24998#bib.bib5),6 (https://arxiv.org/html/2606.24998#bib.bib6)]等旗舰语料库实施了激进的去重和过滤。然而,激进的去重并非完美的去重[7 (https://arxiv.org/html/2606.24998#bib.bib7),8 (https://arxiv.org/html/2606.24998#bib.bib8),9 (https://arxiv.org/html/2606.24998#bib.bib9)]:预训练流中仍然包含近似重复的文档、改写后的模板和语义冗余的网页,并且随着规模扩大,“重复”本身的含义也在变化[10 (https://arxiv.org/html/2606.24998#bib.bib10)]。在本文中,我们隔离了一个受控情况:精确的文档级重放,所选重复池。我们精确量化了预训练中精确重复所付出的代价。最接近的早期对照研究,Hernandez等人[11 (https://arxiv.org/html/2606.24998#bib.bib11)],确立了重复一小部分训练数据会非单调地降低保留损失,并将损害定义为有效参数数量的减少,这是一种过时的度量方式,试图以参数而非计算量来衡量性能,当时所有模型都在300B个token上训练,而不考虑参数数量。这使得较大的模型训练不足,而较小的模型则严重过度训练。Hernandez等人[11 (https://arxiv.org/html/2606.24998#bib.bib11)]的工作早于计算最优缩放[12 (https://arxiv.org/html/2606.24998#bib.bib12)]的广泛使用,后者为缩放定律比较提供了清晰的计算轴。现代从业者用FLOPs而不是参数来衡量训练成本。我们通过测量计算等效增益CEG\mathrm{CEG}来现代化记忆化缩放定律的研究,遵循Gundlach等人[13 (https://arxiv.org/html/2606.24998#bib.bib13)]、Davidson等人[14 (https://arxiv.org/html/2606.24998#bib.bib14)]和Meta超级智能实验室[15 (https://arxiv.org/html/2606.24998#bib.bib15)]的计算等效增益框架。对于损失为LL、实际计算量为CactualC_{\mathrm{actual}}的重复数据运行,CEG\mathrm{CEG}是为了达到LL所需的无重复计算量除以CactualC_{\mathrm{actual}}。我们将计算等效损失定义为CEL=1−CEG\mathrm{CEL}=1-\mathrm{CEG}。因此,CEG=1\mathrm{CEG}=1匹配无重复基线,而CEG<1\mathrm{CEG}<1表示计算等效损失。为了现代化重复损害的研究,我们在FineWeb-Edu-Dedup[3 (https://arxiv.org/html/2606.24998#bib.bib3)]上训练Qwen3风格的模型[16 (https://arxiv.org/html/2606.24998#bib.bib16)],参数数量N∈{34,48,63,93,153,344}MN\in\{34,48,63,93,153,\allowbreak 344\}\mathrm{M}。我们扫描过度训练乘数OT∈{0.25,0.5,1,2,4}\mathrm{OT}\in\{0.25,0.5,1,2,4\}和每个文档的重复次数RR,范围大致对数网格,从无重复到高达R=20000R=20000(我们绘制到约R≈3000R\approx 3000)。在整个过程中,我们将重复token比例固定为f=0.1f=0.1:90%的训练token来自非重复文档,其余10%来自一个较小的文档池,重复RR次。这个比例足够大,能产生可测量的损害,同时保持大部分训练数据是唯一的,并且匹配Hernandez等人[11 (https://arxiv.org/html/2606.24998#bib.bib11)]使用的重复token比例,从而实现直接比较。Chinchilla预算等式C≈6NT=120⋅OT⋅N2C\approx 6NT=120\cdot\mathrm{OT}\cdot N^{2}将模型大小、总token数TT和总计算量CC联系在一起[17 (https://arxiv.org/html/2606.24998#bib.bib17),18 (https://arxiv.org/html/2606.24998#bib.bib18),19 (https://arxiv.org/html/2606.24998#bib.bib19),20 (https://arxiv.org/html/2606.24998#bib.bib20)]。这使我们能够在固定预算内改变重复结构,从而将重复集中度的影响与总计算量分离开来。例如,将记忆化计算预算固定在10%,我们可以将预训练语料库的1%1\%重复1010次,或者将预训练语料库的0.01%0.01\%重复10001000次。我们将这种重复池大小和重复次数的配对称为重复结构。我们发现最具破坏性的重复结构是模型参数数量NN的函数,并且我们使用拟合的无重复缩放定律将产生的损失增加转化为计算等效增益和计算等效损失。在这个拟合的前沿下,我们最大规模下最具破坏性的重复次数对应的CEG≈0.67\mathrm{CEG}\approx 0.67。一个带有逐字重复的错误指定线性回归以封闭形式再现了相同的定性非单调性,表明这种峰值可能源于重复样本的统计结构,而不是语言模型训练特有的任何注意力、深度或优化器特定效应。 参考图注 图1:Chinchilla最优乘数OT=1\mathrm{OT}=1下,在FineWeb-Edu-Dedup上训练的Qwen3风格344M参数模型,其计算等效增益CEG\mathrm{CEG}作为每个文档重复次数RR的函数,训练计算量固定。CEG\mathrm{CEG}是无重复计算量(达到所获损失所需的)与实际花费计算量的比值。CEG=1\mathrm{CEG}=1表示相对于无重复基线没有增益或损失。在RR接近100100时,CEL\mathrm{CEL}升至约0.330.33,这意味着该运行达到了一个无重复运行(仅使用三分之二FLOPs训练)的损失[16 (https://arxiv.org/html/2606.24998#bib.bib16),3 (https://arxiv.org/html/2606.24998#bib.bib3)]。 #### 贡献。 (i) 我们使用拟合的无重复Chinchilla缩放定律以计算等效单位量化了重复数据的损害(§4.3 (https://arxiv.org/html/2606.24998#S4.SS3))。在FineWeb-Edu-Dedup上,对于344M参数且OT=1\mathrm{OT}=1的模型[16 (https://arxiv.org/html/2606.24998#bib.bib16),3 (https://arxiv.org/html/2606.24998#bib.bib3)],最具破坏性的重复次数的CEL≈0.33\mathrm{CEL}\approx 0.33。 (ii) 我们识别出损害峰值所在的中间RR\mathrm{RR}区间(§4.1 (https://arxiv.org/html/2606.24998#S4.SS1)),并表明其位置遵循幂律Rpeak∝N−0.96R^{\mathrm{peak}}\propto N^{-0.96}(§4.2 (https://arxiv.org/html/2606.24998#S4.SS2)),使得最坏情况的配置可以通过NN预测。 (iii) 我们推导了一个带有逐字重复的错误指定线性回归的封闭形式训练和测试损失(§4.4 (https://arxiv.org/html/2606.24998#S4.SS4)),并在模拟中重现了相同的非单调峰值,为在固定重复token比例下精确文档重放的语言模型扫描中观察到的经验模式提供了一个简单的统计类比。 ## 2相关工作 我们将我们的工作定位在三个相关的研究方向上;附录A (https://arxiv.org/html/2606.24998#A1)扩展了讨论。 计算最优缩放和Chinchilla缩放定律。Kaplan等人[19 (https://arxiv.org/html/2606.24998#bib.bib19)]建立了Transformer损失作为计算量函数的幂律形式。Hoffmann等人[12 (https://arxiv.org/html/2606.24998#bib.bib12)]修正了最优(N,T)(N,T)分配,其中NN是参数数量,TT是token数量。Porian等人[18 (https://arxiv.org/html/2606.24998#bib.bib18)]、Besiroglu等人[21 (https://arxiv.org/html/2606.24998#bib.bib21)]检验了这些拟合的稳健性,Sardana等人[20 (https://arxiv.org/html/2606.24998#bib.bib20)]将其扩展到推理感知预算,Gadre等人[17 (https://arxiv.org/html/2606.24998#bib.bib17)]展示了通过激进过度训练的可靠外推。我们将这种函数形式用作拟合的无重复参考曲线。 去重、记忆化和过拟合的统计解释。大量文献从隐私和污染的角度研究去重和记忆化[7 (https://arxiv.org/html/2606.24998#bib.bib7),22 (https://arxiv.org/html/2606.24998#bib.bib22),23 (https://arxiv.org/html/2606.24998#bib.bib23),8 (https://arxiv.org/html/2606.24998#bib.bib8),9 (https://arxiv.org/html/2606.24998#bib.bib9),24 (https://arxiv.org/html/2606.24998#bib.bib24),25 (https://arxiv.org/html/2606.24998#bib.bib25)]。我们的设置在两个方面有所不同。首先,我们通过训练/测试分割将评估集从训练和所有重复池中排除,因此我们观察到的任何损害都必须来自扭曲的有效训练分布。其次,我们固定重复token的比例,仅改变其集中度,从而隔离重复结构的影响。我们的理论分析连接到关于双重下降和良性过拟合的经典结果[26 (https://arxiv.org/html/2606.24998#bib.bib26),27 (https://arxiv.org/html/2606.24998#bib.bib27),28 (https://arxiv.org/html/2606.24998#bib.bib28),29 (https://arxiv.org/html/2606.24998#bib.bib29)],专门针对文字样本重复。我们不知道有先前的工作使用这种块协方差视角来分析文字重复。 语言模型预训练中的重复数据。Hernandez等人[11 (https://arxiv.org/html/2606.24998#bib.bib11)]重复了一小部分训练数据,并观察到非单调的测试损失曲线。他们将损害定义为有效参数数量的减少,并将其与归纳头的退化联系起来。Muennighoff等人[30 (https://arxiv.org/html/2606.24998#bib.bib30)]研究了整个语料库均匀重复的互补情况,并发现大约四个轮次以内几乎是免费的。Xue等人[31 (https://arxiv.org/html/2606.24998#bib.bib31)]、Maini等人[32 (https://arxiv.org/html/2606.24998#bib.bib32)]、Komatsuzaki[33 (https://arxiv.org/html/2606.24998#bib.bib33)]研究了相关的重复、改写和轮次策略。最近的工作进一步论证语义重复本身具有尺度依赖性[10 (https://arxiv.org/html/2606.24998#bib.bib10)],并提出了针对数据受限缩放的显式过拟合惩罚[34 (https://arxiv.org/html/2606.24998#bib.bib34)]。我们处于这两种情况之间,并通过将损害测量为CEG\mathrm{CEG}和CEL\mathrm{CEL}(而非有效参数数量的减少)来扩展Hernandez等人[11 (https://arxiv.org/html/2606.24998#bib.bib11)]的研究:对于每次重复数据运行,我们询问无重复运行需要多少计算量才能达到相同的损失。我们还在Chinchilla风格的token和计算预算下进行扫描,同时将重复token比例固定为f=0.1f=0.1,并通过RR改变其集中度。 ## 3方法 在预训练过程中,重复数据越来越难以避免。因此,理解重复数据的哪些配置是危险的以及它们浪费了多少计算量变得至关重要。我们将重复token比例(或等效的重复token计算比例)固定为f=0.1f=0.1,并仅改变其结构。通过保持专用于重复的token比例不变,我们将重复结构的影响与重复数量的影响分离开来,从而能够在固定计算量下识别出最有害的配置。 #### 设置。 我们在FineWeb-Edu-Dedup[3 (https://arxiv.org/html/2606.24998#bib.bib3)]上训练Qwen3风格的仅解码器Transformer[16 (https://arxiv.org/html/2606.24998#bib.bib16),35 (https://arxiv.org/html/2606.24998#bib.bib35),36 (https://arxiv.org/html/2606.24998#bib.bib36)],使用六个参数数量N∈{34,48,63,93,153,344}MN\in\{34,48,63,93,153,344\}\mathrm{M}。我们在附录B (https://arxiv.org/html/2606.24998#A2)中更详细地定义了这个架构。每次运行由模型大小NN和过度训练乘数OT∈{0.25,0.5,1,2,4}\mathrm{OT}\in\{0.25,0.5,1,2,4\}参数化,较大的模型由于计算限制在此网格的子集上运行。设置OT=1\mathrm{OT}=1相当于每个参数20个token,遵循Chinchilla风格的缩放[12 (https://arxiv.org/html/2606.24998#bib.bib12)],而OT>1\mathrm{OT}>1意味着相对于计算最优token数量进行了过度训练。对于给定的(N,OT)(N,\mathrm{OT})对,总训练token数量为T=20⋅OT⋅NT=20\cdot\mathrm{OT}\cdot N。使用标准密集Transformer估计的每个token 6N6N FLOPs[19 (https://arxiv.org/html/2606.24998#bib.bib19),12 (https://arxiv.org/html/2606.24998#bib.bib12),20 (https://arxiv.org/html/2606.24998#bib.bib20)]

相似文章

内部数据重复破坏语言模型

arXiv cs.LG

本文系统研究了语言模型预训练过程中精确文档重复所造成的损害,表明以中等次数重复中等规模的子集对性能的损害最大,并且重复可能导致高达33%的计算浪费(以计算等效损失衡量)。

大语言模型顺序后训练中的表征坍塌

arXiv cs.LG

本文研究了大型语言模型在顺序后训练中的表征坍塌现象,表明重复的适应阶段会压缩内部表征,降低可塑性和域外泛化能力。作者提出了轻量级干预措施,在不牺牲行为增益的前提下保留未来的可学习性。

神经坍缩是被禁止的:语言模型中的信息下限

arXiv cs.CL

本文认为,语言模型表示中的类内方差并非不完全的神经坍缩,而是分配的信息存储,且这种分配服从信息下限定律。在14个模型中,宏观类别结构仅承载4–12%的表示方差,而词元内上下文则占据79–91%。