@tatsu_hashimoto: 我发推文给Chris(他不在线)的一些令人惊讶的新结果。只要有足够的算力,最好的数据…

X AI KOLs Following 论文

摘要

令人惊讶的新结果表明,对于大型语言模型(LLM),只要有足够的算力,最好的数据过滤器可能就是没有过滤器,因为它们能很好地容忍低质量数据。

我发推文给Chris(他不在线)的一些令人惊讶的新结果。只要有足够的算力,对语言模型(在DCLM上)最好的数据过滤器可能就是没有过滤器。为什么?大型模型可以容忍大量名义上的“低质量”数据,有时甚至能从中受益。https://t.co/VhshLOWBIx
查看原文
查看缓存全文

缓存时间: 2026/05/21 21:37

一些新发现让我感到惊讶,我在这里替克里斯(他不在这)发推文。如果算力足够,对语言模型(在DCLM上)来说,最好的数据过滤方法可能就是不过滤。为什么?大型模型能够容忍大量名义上的“低质量”数据,有时甚至能从中受益。https://t.co/VhshLOWBIx

相似文章

数据过滤的苦涩教训(1分钟阅读)

TLDR AI

本文研究了大模型预训练中的数据过滤,发现在高计算、数据稀缺的情况下,过滤可能并非必要,甚至可能有害;充分训练的大模型能从名义上的低质量数据中受益。

@AI_Whisper_X: 苦涩教训第二弹:只要你算力够,最好的数据过滤器就是不过滤。 看完这篇 paper 最大的感受是,rich 老爷子的苦涩教训,这是要到数据侧了? 斯坦福的 Hashimoto 发了一篇《A Bitter Lesson for Data Fi…

X AI KOLs Timeline

斯坦福大学的研究论文提出,在足够大的算力下,最好的数据过滤策略是不过滤。实验表明,大规模模型对低质量数据具有鲁棒性,并且未过滤的数据池在较大规模下表现更优,但该结论适用于密集模型的标准预训练,且在算力受限时过滤仍然重要。