数据过滤的苦涩教训(1分钟阅读)
摘要
本文研究了大模型预训练中的数据过滤,发现在高计算、数据稀缺的情况下,过滤可能并非必要,甚至可能有害;充分训练的大模型能从名义上的低质量数据中受益。
新的缩放研究表明,在高计算、数据稀缺的设置下,不使用数据过滤可能是大模型预训练的最优选择。大参数模型不仅容忍而且受益于包含低质量和干扰数据。与普遍看法相反,在有充足计算资源的情况下,过滤掉低质量数据可能并非必要。
查看缓存全文
缓存时间: 2026/05/21 18:14
# 数据过滤的苦涩教训 来源:https://arxiv.org/html/2605.19407 Christopher Mohri 计算机科学系 斯坦福大学 xmohri@stanford\.edu & John Duchi 统计学与电子工程系 斯坦福大学 jduchi@stanford\.edu & Tatsunori Hashimoto 计算机科学系 斯坦福大学 thashim@stanford\.edu
###### 摘要
我们通过新的规模扩展研究,针对高计算、数据稀缺场景,探究大型模型预训练中的数据过滤问题。尽管普遍认为过滤数据以仅包含高质量信息至关重要,但我们的实验表明,当计算资源充足时,最佳的数据过滤策略就是不进行任何过滤。我们发现,经过充分训练的大参数模型不仅能够容忍低质量和干扰数据,反而会从名义上的“低质量”数据中获益。
## 1 引言
为语言模型选择预训练数据的标准方法是对来自 Common Crawl (CC) 等来源的文本进行过滤 (Common Crawl, 2024 (https://arxiv.org/html/2605.19407#bib.bib9))。广泛记载表明,在计算受限的情况下(即必须使用 CC 的子集进行训练),不同的数据选择策略会对性能产生巨大影响。这很直观:在其他条件相同的情况下,自然会在“更高质量”的数据上进行训练。因此,大量研究工作致力于解决数据选择问题,目标是找到预训练语言模型的最佳子集 (Albalak et al., 2024 (https://arxiv.org/html/2605.19407#bib.bib7); Li et al., 2025a (https://arxiv.org/html/2605.19407#bib.bib8))。
然而,大规模的过滤消融实验不仅成本高昂且具有启发性,而且过滤会移除数据,这与提倡不断增加数据量以提升模型性能的规模扩展趋势相悖。例如,经过严格过滤的 DCLM-Baseline 数据集仅保留了约原始 CC 的 1% 左右,大约 3.8 万亿个 token (Li et al., 2025a (https://arxiv.org/html/2605.19407#bib.bib8))。尽管这个数字仍然巨大,但对于一个 1 万亿参数的模型而言,它仍低于 Chinchilla 最优 token 预算,即使考虑了重复使用数据时的收益递减效应 (Muennighoff et al., 2025 (https://arxiv.org/html/2605.19407#bib.bib5))。当前的趋势也是相对于 Chinchilla 最优进行过度训练,这需要更多的 token 来构建相对较小的模型,以便在服务时经济可行 (Sardana et al., 2025 (https://arxiv.org/html/2605.19407#bib.bib10))。
我们首先检验在大量计算极限下,数据过滤是否真的必要。尽管大规模机器学习已转向任务无关的预训练 (Raffel et al., 2023 (https://arxiv.org/html/2605.19407#bib.bib6)),并且有经验证据表明更大的计算预算受益于更宽松的数据过滤器 (Goyal et al., 2024 (https://arxiv.org/html/2605.19407#bib.bib1); Muennighoff et al., 2025 (https://arxiv.org/html/2605.19407#bib.bib5)),但移除*所有*数据过滤将是一个极端的干预,会使用被认为有害的数据 (Raffel et al., 2023 (https://arxiv.org/html/2605.19407#bib.bib6))。我们在这项工作中的目标是认真对待这种极端情况,并研究(低质量)数据在 Transformer 预训练中的极限。我们发现证据否定了数据过滤是必要的假设,并且最终,任何现有的数据过滤器可能都无法比直接在 Common Crawl 上训练更好。
在我们的实验中,我们对 CC 及其过滤版本进行缩放,以保持它们相对大小不变,然后在这些不同数据集上扩展预训练的计算资源。我们用于此的两个主要杠杆是缩放模型大小(每一步训练需要更多计算)和训练步数(最终会导致重复使用数据)。在比较最佳达到的性能(无论计算成本如何)时,我们的主要发现是,完整的数据池优于我们选择的过滤器。随着我们将实验规模扩大两个数量级,这一发现依然稳健,并且我们发现只要模型足够大,就可以从我们的小规模池实验中持续观察到这些效应。此外,我们发现了池大小、训练步数和模型大小之间的可预测关系,这使我们能够构建规模扩展定律,预测对于特定池大小,需要多少计算量才能让无过滤策略达到最优。据此,我们发现来自 DCLM-Pool 的 240 万亿 token Common Crawl 池可能在 1e+30 FLOPs 时就变得最优。
这些初步发现促使我们研究预训练对“垃圾”数据的鲁棒性。令人惊讶的是,足够大的模型对无关或垃圾数据具有高度鲁棒性,甚至能从高度噪声的数据中提取有用信息。我们使用随机生成的字符串和单词顺序打乱的文档进行测试。虽然低计算预算下性能会下降,但经过充分训练的大型模型能够缩小差距。值得注意的是,这些模型甚至从单词打乱的文档中获益,尽管文档仅保留了单字分布。总体而言,我们的实验表明,经过足够长时间训练的足够大模型可以受益于完整的 CC 数据集。虽然可以构造有害数据(例如,看起来与高质量数据完全相同的非事实内容),但我们并未在 CC 中发现大量的此类数据。因此,数据过滤可能遭受苦涩教训 (Sutton, 2019 (https://arxiv.org/html/2605.19407#bib.bib39)):在小规模上表现良好的人工设计过滤器,最终会被随着计算量增长而更优雅地扩展的简单无过滤方法所取代。
本文结构如下:在第 2 节 (https://arxiv.org/html/2605.19407#S2) 中,我们提供基本实验设置;随后在第 3 节 (https://arxiv.org/html/2605.19407#S3) 中介绍过滤实验;然后我们在第 4 节 (https://arxiv.org/html/2605.19407#S4) 中向 CC 池添加数据;并在第 5 节 (https://arxiv.org/html/2605.19407#S5) 中扩展池大小;最后在第 6 节 (https://arxiv.org/html/2605.19407#S6) 中讨论边缘情况,并在第 7 节 (https://arxiv.org/html/2605.19407#S7) 中提供一个理论模型,作为对所观察现象的事后解释。
### 1.1 相关工作
**数据受限的预训练。** 几项先前的工作考虑了数据受限的预训练场景。Muennighoff 等人 (2025 (https://arxiv.org/html/2605.19407#bib.bib5)) 推导了将数据重复纳入原始 Chinchilla 规模扩展定律的缩放律,发现在数据上大约 4 个 epoch 后收益递减,并且添加代码数据和使用更宽松的基于困惑度的过滤器可以缓解数据稀缺性。然而,作者建议过滤“噪声数据集”并在 C4 的子集上训练 (Raffel et al., 2023 (https://arxiv.org/html/2605.19407#bib.bib6)),而当前工作直接在(解析后的)Common Crawl 上训练,并发现了支持无过滤的证据。Kim 等人 (2025 (https://arxiv.org/html/2605.19407#bib.bib16)) 研究了在数据受限但计算不受限的设置下算法改进的问题。我们共享类似的实验设置(即取数据集子集,在该子集上扩展计算量,然后扩展子集大小),但分析对象不同(数据集过滤)。
**宽松的数据过滤器。** 与我们最接近的工作是 Goyal 等人 (2024 (https://arxiv.org/html/2605.19407#bib.bib1)),他们认为过滤阈值应取决于计算预算,并展示了视觉-语言模型的证据。他们推导了一个规模扩展定律来预测作为计算预算函数的过滤阈值,并得出结论“大量计算下,较不激进的过滤最好”,但没有确定对我们工作至关重要的参数缩放交互作用,也没有展示我们的主要发现:对于语言模型,无过滤可以是最好的过滤。Fang 等人 (2025 (https://arxiv.org/html/2605.19407#bib.bib27)) 通过人为重复“高质量”数据以匹配松散过滤数据的规模来处理一个相关问题。他们发现前者在低计算场景下可以胜过后者,但本工作中研究的高计算场景在他们的工作中仍然完全是推测性的。最后,Gao (2021 (https://arxiv.org/html/2605.19407#bib.bib28)) 发现激进过滤会损害性能,推测这遵循了古德哈特定律 [1984 (https://arxiv.org/html/2605.19407#bib.bib29)],而 Saada 等人 (2025 (https://arxiv.org/html/2605.19407#bib.bib30)) 发现使用质量分类器进行过滤可能会改善下游基准测试,但不会改善“高质量”数据上的验证损失。在理论方面,Cheng 等人 (2024 (https://arxiv.org/html/2605.19407#bib.bib37)) 开发了数据清理过程的理论模型,认为给定具有足够保真度来模拟噪声数据生成方案的模型,最好不要清理数据,而当模型不完美时,清理数据可以产生更鲁棒的学习。这一预测与我们随后的发现不谋而合。
**低质量数据。** 近期工作中关于低质量或故意降级数据对模型性能影响的探索,激励了我们在第 4 节 (https://arxiv.org/html/2605.19407#S4) 中的实验。Allen-Zhu 和 Li (2024 (https://arxiv.org/html/2605.19407#bib.bib36)) 发现“垃圾数据”显著降低了合成数据设置中的知识容量,这与我们关于足够模型大小的发现一致。反直觉的是,Li 等人 (2025b (https://arxiv.org/html/2605.19407#bib.bib33)) 认为在有毒数据上进行预训练会带来更好的表示,这使得在后训练阶段更容易移除有毒行为。在探索数据结构极限方面,Sinha 等人 (2021 (https://arxiv.org/html/2605.19407#bib.bib31)) 在类似于我们的单词打乱实验的数据上进行了训练,认为掩码语言模型成功的主要原因是建模“高阶词共现统计量”。最后,Ru 等人 (2025 (https://arxiv.org/html/2605.19407#bib.bib32)) 在类似于第 4 节 (https://arxiv.org/html/2605.19407#S4) 中随机生成的文本的随机生成整数上训练模型,并且仅注意到轻微的性能下降。
## 2 预备知识
我们从问题设置开始。我们的目标是衡量数据集在最佳可能性能方面的价值,无论计算成本如何,关注的指标包括困惑度和下游基准测试。更正式地说,对于一个训练算法 $\mathcal{A}$,它接受任意大小的数据集 $D$、参数数量 $M$ 和训练步数 $N$ 作为参数,并输出一个模型 $\theta \in \Theta$,在损失函数 $\ell: \Theta \to \mathbb{R}$ 下进行评估,我们的目标是找到最佳可达到的性能:
\[
\mathcal{L}^{\star}(D) := \min_{M,N} \; \ell(\mathcal{A}(D, M, N)),
\tag{1}
\]
作为预训练数据的函数。我们的公式中对参数数量 $M$ 和训练步数 $N$ 进行了无约束最小化,试图提取数据集中的所有“价值”,无论其大小如何。经验上,我们通过变化 $M$ 和 $N$ 跨越几个数量级来计算这个最小值,直到性能提升开始趋于平稳或计算资源耗尽。
由于我们没有足够的计算预算在整个 Common Crawl 上进行训练(更不用说执行多个 epoch),我们的实验基于随机采样子集。令 $D_{cc}$ 为整个 CC,$D_{cc,m} \subseteq D_{cc}$ 为随机采样的 $m$ 个 token 的子集,而 $f(D_{cc,m}) \subseteq D_{cc,m}$ 是该子集的过滤变体。在第 3 节中,我们比较 $\mathcal{L}^{\star}(D_{cc,m})$ 和 $\mathcal{L}^{\star}(f(D_{cc,m}))$,针对标准过滤函数 $f$(如 DCLM-Baseline 和 RefinedWeb)以及我们最小的子集大小 $m$,以测试常见被移除的文档 $D_{cc,m} \setminus f(D_{cc,m})$ 是否确实有助于提升性能。在第 4 节中,我们通过注入各种“垃圾数据”$J$ 形成 $D_{cc,m} \cup J$ 来测试模型鲁棒性,挑战 $\mathcal{L}^{\star}(D_{cc,m}) < \mathcal{L}^{\star}(D_{cc,m} \cup J)$ 的假设。
我们较小规模的实验隐含假设 $\mathcal{L}^{\star}(f(D_{cc,m}))$ 和 $\mathcal{L}^{\star}(D_{cc,m})$ 中较好者不会随着 $m$ 变化(或至少可预测地变化),这使我们能够缩并并在合理的计算预算下研究函数 $\mathcal{L}^{\star}$。为了探究是否确实如此,并理解作为 $m$、$M$ 和 $N$ 函数的性能如何变化,我们在第 5 节中进一步对池大小 $m$ 进行缩放。
### 2.1 实验细节
我们使用 Li 等人 (2025a (https://arxiv.org/html/2605.19407#bib.bib8)) 在其 DCLM-Pool 数据集中提供的 Common Crawl 版本,该版本包含 2023 年之前的所有 CC,并通过 resiliparse (Bevendorff et al., 2018 (https://arxiv.org/html/2605.19407#bib.bib43)) 从 HTML 中提取文本。该数据集包含 240 万亿个 GPT-NeoX (Black et al., 2022 (https://arxiv.org/html/2605.19407#bib.bib12)) token,我们随机采样的子集范围从大约 6.7 亿到 100 亿个 token。过滤时,我们使用 Li 等人 (2025a (https://arxiv.org/html/2605.19407#bib.bib8)) 提供的代码。我们不使用任何专门的数据课程或数据权重。
我们的模型是 Llama 风格的密集 Transformer,参数范围从 1500 万到 70 亿,使用 Meta Lingua 代码库 (Videau et al., 2024 (https://arxiv.org/html/2605.19407#bib.bib11)) 进行训练。对于每个模型,我们调整训练步数和权重衰减,遵循先前研究以增加数据的可重复性 (Fang et al., 2025 (https://arxiv.org/html/2605.19407#bib.bib27); Kim et al., 2025 (https://arxiv.org/html/2605.19407#bib.bib16))。按照标准做法,我们设置学习率随模型大小衰减 (Brown et al., 2020 (https://arxiv.org/html/2605.19407#bib.bib35); Kaplan et al., 2020 (https://arxiv.org/html/2605.19407#bib.bib26)),并通过初始调优阶段确定衰减。我们在 GitHub 上发布了配置文件。¹¹¹https://github.com/chrismohrii/bitter-lesson-data-filtering
我们主要关注的指标是不同数据集上的损失(负对数似然),因为已知该指标与下游性能相关,并且比常见的问答基准测试提供更平滑的测量(可能由于它们规模较小)。这些数据集包括 C4 的英文部分 (Raffel et al., 2023 (https://arxiv.org/html/2605.19407#bib.bib6))、Fineweb-Edu (Penedo et al., 2024 (https://arxiv.org/html/2605.19407#bib.bib13))(一个针对教育文本的预训练数据集)和 Cosmopedia (Ben Allal et al., 2024 (https://arxiv.org/html/2605.19407#bib.bib14))(一个合成生成的文本数据集)。我们主要绘制这三个数据集的平均损失,但每个单独的损失趋势也是相同的。我们还在附录 B 中提供了常见基准测试的结果,如 ARC-Easy (Clark et al., 2018 (https://arxiv.org/html/2605.19407#bib.bib20)) 和 PIQA (Bisk et al., 2019 (https://arxiv.org/html/2605.19407#bib.bib21))。由于我们的实验仅使用高达 100 亿 token 的池大小,我们预计不会受到测试集污染的影响。
## 3 数据过滤
在本节中,我们检验标准过滤版本相似文章
@kothasuhas: 非常非常棒的工作。TLDR:在无限计算资源的条件下,过滤 _any_ 数据可能都没有意义。
新研究表明,在拥有充足计算资源的情况下,语言模型训练数据的过滤可能并不必要,模型反而能从低质量数据中受益。
@AI_Whisper_X: 苦涩教训第二弹:只要你算力够,最好的数据过滤器就是不过滤。 看完这篇 paper 最大的感受是,rich 老爷子的苦涩教训,这是要到数据侧了? 斯坦福的 Hashimoto 发了一篇《A Bitter Lesson for Data Fi…
斯坦福大学的研究论文提出,在足够大的算力下,最好的数据过滤策略是不过滤。实验表明,大规模模型对低质量数据具有鲁棒性,并且未过滤的数据池在较大规模下表现更优,但该结论适用于密集模型的标准预训练,且在算力受限时过滤仍然重要。
@tatsu_hashimoto: 我发推文给Chris(他不在线)的一些令人惊讶的新结果。只要有足够的算力,最好的数据…
令人惊讶的新结果表明,对于大型语言模型(LLM),只要有足够的算力,最好的数据过滤器可能就是没有过滤器,因为它们能很好地容忍低质量数据。
无需数据清洗即可获得高质量预测(为何“垃圾进,垃圾出”有时是一种误区)
这篇arXiv预印本挑战了“垃圾进,垃圾出”的经验法则,认为在高维表格数据中,激进的手动数据清洗可能会通过减少三角测量潜在驱动因素所需的维度,从而限制预测性能。
更少数据,更快训练:重复小数据集通过采样偏差加速学习
本文研究了“小规模与大规模差距”,即与使用更大的数据集相比,在更少的样本上进行更多次重复训练可以带来更快的学习和计算节省,并将加速归因于采样偏差所实现的逐层增长。研究结果表明,带有重复的小数据集可以被主动利用作为有利的归纳偏置,尤其是在推理任务中。