@tatsu_hashimoto: 我发推文给Chris(他不在线)的一些令人惊讶的新结果。只要有足够的算力,最好的数据…
摘要
令人惊讶的新结果表明,对于大型语言模型(LLM),只要有足够的算力,最好的数据过滤器可能就是没有过滤器,因为它们能很好地容忍低质量数据。
我发推文给Chris(他不在线)的一些令人惊讶的新结果。只要有足够的算力,对语言模型(在DCLM上)最好的数据过滤器可能就是没有过滤器。为什么?大型模型可以容忍大量名义上的“低质量”数据,有时甚至能从中受益。https://t.co/VhshLOWBIx
查看缓存全文
缓存时间: 2026/05/21 21:37
一些新发现让我感到惊讶,我在这里替克里斯(他不在这)发推文。如果算力足够,对语言模型(在DCLM上)来说,最好的数据过滤方法可能就是不过滤。为什么?大型模型能够容忍大量名义上的“低质量”数据,有时甚至能从中受益。https://t.co/VhshLOWBIx
相似文章
@kothasuhas: 非常非常棒的工作。TLDR:在无限计算资源的条件下,过滤 _any_ 数据可能都没有意义。
新研究表明,在拥有充足计算资源的情况下,语言模型训练数据的过滤可能并不必要,模型反而能从低质量数据中受益。
数据过滤的苦涩教训(1分钟阅读)
本文研究了大模型预训练中的数据过滤,发现在高计算、数据稀缺的情况下,过滤可能并非必要,甚至可能有害;充分训练的大模型能从名义上的低质量数据中受益。
@AI_Whisper_X: 苦涩教训第二弹:只要你算力够,最好的数据过滤器就是不过滤。 看完这篇 paper 最大的感受是,rich 老爷子的苦涩教训,这是要到数据侧了? 斯坦福的 Hashimoto 发了一篇《A Bitter Lesson for Data Fi…
斯坦福大学的研究论文提出,在足够大的算力下,最好的数据过滤策略是不过滤。实验表明,大规模模型对低质量数据具有鲁棒性,并且未过滤的数据池在较大规模下表现更优,但该结论适用于密集模型的标准预训练,且在算力受限时过滤仍然重要。
@kazukifujii: 樱花互联网的Michishita-san的文章全面总结了LLM推理,强烈推荐。它涵…
本文总结了Junda Chen关于LLM分解推理的演讲,解释了为什么goodput(满足延迟SLO的吞吐量)比原始吞吐量更重要,以及分离预填充和解码阶段如何提升性能。文章还强调了其对NVIDIA Dynamo的影响。
@JunchenJiang:这会终止关于压缩KV缓存可能会搞砸LLM推理的争论吗?
这条推文质疑一项新发现是否能够解决关于压缩KV缓存是否损害LLM推理性能的争论。