标签
本文介绍了WebGraphMix,一个轻量级框架,利用来自Common Crawl的网络图中心性分数来选择预训练数据,实验表明混合中心文档与边缘文档能够提升语言模型性能。
Kyutai Labs 训练60亿参数模型,使用按时间顺序从2018年到2025年排列的Common Crawl数据,表明近期年份上的性能下降消失,并开源检查点以供持续学习研究。
斯坦福大学的研究论文提出,在足够大的算力下,最好的数据过滤策略是不过滤。实验表明,大规模模型对低质量数据具有鲁棒性,并且未过滤的数据池在较大规模下表现更优,但该结论适用于密集模型的标准预训练,且在算力受限时过滤仍然重要。
一个Hugging Face Space允许您对Common Crawl的21.9亿个网页运行SQL查询而无需下载,它使用DuckDB直接从Hugging Face存储桶读取数据。
了解如何设置并在本地使用 Common Crawl 数据进行网页数据处理任务。
本文研究了大模型预训练中的数据过滤,发现在高计算、数据稀缺的情况下,过滤可能并非必要,甚至可能有害;充分训练的大模型能从名义上的低质量数据中受益。
这项调查分析了排名前 50 万的网站中超过 30 万个网页订阅源,结果显示尽管订阅源依然普遍,但大多数因 CMS 自动生成而遭到废弃或质量不佳。作者利用 AI 智能体处理 Common Crawl 数据,并呼吁改进订阅源的管理实践。