common-crawl

标签

Cards List
#common-crawl

中心与边缘:基于网络图中心性的预训练数据选择

arXiv cs.CL · 2026-06-11 缓存

本文介绍了WebGraphMix,一个轻量级框架,利用来自Common Crawl的网络图中心性分数来选择预训练数据,实验表明混合中心文档与边缘文档能够提升语言模型性能。

0 人收藏 0 人点赞
#common-crawl

@kyutai_labs: 我们训练60亿参数模型,基于Common Crawl数据按时间顺序从2018年到2025年排序,使得最新数据最后被模型看到…

X AI KOLs Following · 2026-05-26 缓存

Kyutai Labs 训练60亿参数模型,使用按时间顺序从2018年到2025年排列的Common Crawl数据,表明近期年份上的性能下降消失,并开源检查点以供持续学习研究。

0 人收藏 0 人点赞
#common-crawl

@AI_Whisper_X: 苦涩教训第二弹:只要你算力够,最好的数据过滤器就是不过滤。 看完这篇 paper 最大的感受是,rich 老爷子的苦涩教训,这是要到数据侧了? 斯坦福的 Hashimoto 发了一篇《A Bitter Lesson for Data Fi…

X AI KOLs Timeline · 2026-05-24 缓存

斯坦福大学的研究论文提出,在足够大的算力下,最好的数据过滤策略是不过滤。实验表明,大规模模型对低质量数据具有鲁棒性,并且未过滤的数据池在较大规模下表现更优,但该结论适用于密集模型的标准预训练,且在算力受限时过滤仍然重要。

0 人收藏 0 人点赞
#common-crawl

@vanstriendaniel: 您现在可以对21.9亿个网页运行SQL查询,无需下载!@CommonCrawl 2026年4月的爬取数据及URL索引已上线@huggi...

X AI KOLs Following · 2026-05-22 缓存

一个Hugging Face Space允许您对Common Crawl的21.9亿个网页运行SQL查询而无需下载,它使用DuckDB直接从Hugging Face存储桶读取数据。

0 人收藏 0 人点赞
#common-crawl

@lhoestq: 你不知道你其实需要本地 Common Crawl

X AI KOLs Timeline · 2026-05-22 缓存

了解如何设置并在本地使用 Common Crawl 数据进行网页数据处理任务。

0 人收藏 0 人点赞
#common-crawl

数据过滤的苦涩教训(1分钟阅读)

TLDR AI · 2026-05-21 缓存

本文研究了大模型预训练中的数据过滤,发现在高计算、数据稀缺的情况下,过滤可能并非必要,甚至可能有害;充分训练的大模型能从名义上的低质量数据中受益。

1 人收藏 1 人点赞
#common-crawl

2026 年网页订阅源调查报告

Lobsters Hottest · 2026-05-11 缓存

这项调查分析了排名前 50 万的网站中超过 30 万个网页订阅源,结果显示尽管订阅源依然普遍,但大多数因 CMS 自动生成而遭到废弃或质量不佳。作者利用 AI 智能体处理 Common Crawl 数据,并呼吁改进订阅源的管理实践。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈