@AdinaYakup: Ultra-FineWeb-L1 开放英文网络语料库,用于LLM预训练,来自@OpenBMB https://huggingface.co/datasets/openbmb/Ult…
摘要
OpenBMB 发布了 Ultra-FineWeb-L1,一个开放英文网络语料库,包含超过1万亿个token,用于LLM预训练,源自Common Crawl,并采用Trafilatura 2.0进行高级清理。
查看缓存全文
缓存时间: 2026/08/21 13:13
Ultra-FineWeb-L1:用于大语言模型预训练的开源英文网络语料库(来自 @OpenBMB)
https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L1
- 超过1万亿词元(约11.4亿篇文档)
- 数据来源为直至CC-MAIN-2025-51的Common Crawl快照
- 采用Apache 2.0许可协议
- 使用trafilatura 2.0进行深度清洗,并辅以定制化质量检查
openbmb/Ultra-FineWeb-L1 · Hugging Face数据集
来源:https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L1
📜 Ultra-FineWeb技术报告 (https://arxiv.org/abs/2505.05427) | 📦 UltraData数据集合 (https://huggingface.co/collections/openbmb/ultradata) | 🌐 UltraData平台 (https://ultradata.openbmb.cn/)
English | 中文
📚 简介
Ultra-FineWeb-L1 是一个大规模英文网络语料库,构建自Common Crawl (https://commoncrawl.org/) 快照。在UltraData (https://ultradata.openbmb.cn/) 的L0-L4分层数据管理框架 (https://arxiv.org/pdf/2602.09003/) 中,它作为通用网络数据的L1过滤层,并为后续的L2筛选和L3精炼提供基础。基于FineWeb (https://huggingface.co/datasets/HuggingFaceFW/fineweb) 的处理流程,我们执行了正文提取、语言过滤、启发式过滤、敏感字段替换、MinHash去重以及定制化数据清洗。我们将正文提取升级至trafilatura 2.0 (https://github.com/adbar/trafilatura),并利用UltraData的数据质量检查工具和数据清洗智能体,优化了清洗规则,对残留HTML、编码损坏与乱码、不可见字符、损坏内容以及异常文档长度进行了针对性处理。首次发布包含来自2025年六个Common Crawl快照的超过1万亿词元(约11.4亿篇文档)。我们同时发布了Ultra-FineWeb (https://huggingface.co/datasets/openbmb/Ultra-FineWeb/tree/main/data/ultrafineweb_l1_en_hq),这是由Ultra-FineWeb分类器 (https://huggingface.co/openbmb/Ultra-FineWeb-classifier) 产生的L2筛选子集。
- Ultra-FineWeb-L1 (https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L1):L1过滤数据,经过基础清洗、启发式过滤、敏感字段替换和去重处理。(当前数据集)
- Ultra-FineWeb (https://huggingface.co/datasets/openbmb/Ultra-FineWeb):L2筛选数据,由Ultra-FineWeb分类器 (https://huggingface.co/openbmb/Ultra-FineWeb-classifier) 生成,包含约1万亿英文词元和1200亿中文词元。
- Ultra-FineWeb-L3 (https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3):L3精炼数据,在Ultra-FineWeb基础上通过问答对生成和多风格改写构建,包含超过4000亿英文词元和超过2000亿中文词元。
📢 更新日志
- [2026.08.20] Ultra-FineWeb-L1 (https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L1) 数据集已发布!构建自Common Crawl快照,经过正文提取、语言过滤、启发式过滤、敏感字段替换、定制化清洗和去重,产出超过1万亿词元(约11.4亿篇文档)。我们同步发布了由Ultra-FineWeb分类器 (https://huggingface.co/openbmb/Ultra-FineWeb-classifier) 筛选的L2数据集Ultra-FineWeb (https://huggingface.co/datasets/openbmb/Ultra-FineWeb/tree/main/data/ultrafineweb_l1_en_hq)。据我们所知,这个开源网络预训练数据集覆盖了最新的Common Crawl快照,直至
CC\-MAIN\-2025\-51。🚀🚀🚀 - [2026.05.28] Ultra-FineWeb-L3 (https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L3) 数据集已发布!基于Ultra-FineWeb,通过问答对生成和多风格改写构建的L3精炼数据,包含超过4000亿英文和超过2000亿中文词元。据我们所知,这是迄今为止最大的开源中文预训练合成语料库。🚀🚀🚀
- [2026.05.25] MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) 已发布!***它是MiniCPM5系列中的首个模型,一个为端侧、本地部署和资源受限场景设计的稠密1B Transformer模型,达到了1B级别开源模型的SOTA。Ultra-FineWeb是其核心预训练网络数据集。
- [2026.02.08] UltraData (https://ultradata.openbmb.cn/) 平台现已上线,引入了L0-L4分层数据管理框架 (https://arxiv.org/pdf/2602.09003)。Ultra-FineWeb在此框架中作为通用网络数据的L2筛选层。🔍🔍🔍
- [2025.06.16] Ultra-FineWeb-classifier 已在Hugging Face发布:openbmb/Ultra-FineWeb-classifier (https://huggingface.co/openbmb/Ultra-FineWeb-classifier)。
- [2025.06.06] Ultra-FineWeb-en 和 Ultra-FineWeb-zh 已在Hugging Face发布,与MiniCPM4系列 (https://huggingface.co/collections/openbmb/minicpm-4-6841ab29d180257e940baa9b) 模型一同发布。
- [2025.05.15] Ultra-FineWeb 登顶Hugging Face Datasets热门榜单,位列第一!⭐️⭐️⭐️
- [2025.05.09] Ultra-FineWeb 技术报告已发布于arXiv (https://arxiv.org/abs/2505.05427)。🔥🔥🔥
🏗️ 数据处理流程
每个Common Crawl转储文件独立处理:
- 页面与正文提取: 保留Common Crawl中的有效HTML页面,使用trafilatura 2.0提取纯文本,同时排除评论、导航栏等非正文内容。
- 语言过滤: 使用fastText语言识别,保留高置信度的英文文档。
- 启发式过滤: 基于FineWeb的启发式过滤方法,处理重复、低质量文档、样板文本和异常行结构。
- 敏感字段替换: 将检测到的电子邮件地址、IP地址、电话号码、身份证号和信用卡号替换为有效占位符。
- MinHash去重: 识别每个Common Crawl转储文件内的近似重复文档。遵循FineWeb的做法,去重在每个转储文件内独立进行,而非在整个数据集上跨文件进行。
- 定制化清洗: 利用UltraData的数据质量检查工具和数据清洗智能体,优化清洗规则,并对残留HTML、编码损坏与乱码、不可见字符、损坏内容以及异常文档长度进行针对性处理。
📁 数据集结构
Ultra-FineWeb-L1 按Common Crawl转储文件组织:
data/
└── CC-MAIN-YYYY-WW/
├── CC-MAIN-YYYY-WW-part-0001-of-NNNN.parquet
├── CC-MAIN-YYYY-WW-part-0002-of-NNNN.parquet
└── ...
分类器筛选的L2子集发布于Ultra-FineWeb (https://huggingface.co/datasets/openbmb/Ultra-FineWeb):
data/ultrafineweb_l1_en_hq/
└── CC-MAIN-YYYY-WW/
├── ultrafineweb-l1-en-hq-CC-MAIN-YYYY-WW-part-0001-of-NNNN.parquet
└── ...
数据字段
| 字段名 | 类型 | 描述 |
|---|---|---|
uid | string | UUID4格式的文档标识符 |
content | string | 清洗后的纯文本文档 |
meta | string | JSON编码的来源和处理元数据,包括 url、language、language_score、warc_record_id、warc_date 和 source_file |
dataset_index | int64 | 数据集来源标识符 |
📈 实验结果
评估设置
我们遵循FinePhrase评估设置,并采用FineWeb (https://huggingface.co/datasets/HuggingFaceFW/fineweb) 的消融实验方法:每种数据配置使用3-shot提示和单个随机种子,在六大类别的12个基准上进行评估。对于大多数任务,我们使用完形填空格式(CF),将评估框架设定为下一个词元预测。与标准多选评估相比,CF减少了指令遵循和答案格式对较小模型的干扰,提供了更稳定的评估信号。基准测试包括:
- 通用知识:ARC、MMLU Redux
- 阅读理解:SQuAD v2、DROP
- 推理:OpenBookQA、XCSQA
- 自然语言理解:WinoGrande、PIQA、HellaSwag
- 数学:GSM8K
- 表格理解:WikiTableQuestions、TriviaQA
训练设置
为评估清洗流程的有效性,我们选择了FineWeb v1.4 (https://huggingface.co/datasets/HuggingFaceFW/fineweb) 覆盖的最新Common Crawl快照CC\-MAIN\-2025\-26,比较了分别由FineWeb v1.4和Ultra-FineWeb-L1流程处理的数据。两组数据均使用MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) 模型,在相同设置下训练200亿词元:32块GPU、微批量大小16、全局批量大小512、Muon优化器、初始学习率0.000522、最小学习率0.0000522。
结果
下图展示了四种数据配置在训练过程中的六大类宏平均和12项任务微平均得分。得分普遍随训练词元数量增加而提升。训练结束时,Ultra-FineWeb-L1达到9.668%宏平均和9.180%微平均,分别比FineWeb高出0.635和0.696个百分点,验证了优化清洗流程的有效性。质量筛选带来了进一步提升:Ultra-FineWeb-from-FW达到9.954% / 9.414%,而Ultra-FineWeb-from-L1取得最佳结果10.379% / 9.798%,表明L1清洗和后续的质量筛选提供了互补性增益。
| 数据 | 六大类宏平均 | 12项任务微平均 |
|---|---|---|
| FineWeb | 9.033% | 8.484% |
| Ultra-FineWeb-L1 | 9.668% | 9.180% |
| Ultra-FineWeb-from-FW | 9.954% | 9.414% |
| Ultra-FineWeb-from-L1 | 10.379% | 9.798% |
❤️ 致谢
- 源网络数据:Common Crawl (https://commoncrawl.org/)
- 数据处理流程:FineWeb (https://huggingface.co/datasets/HuggingFaceFW/fineweb)、DataTrove (https://github.com/huggingface/datatrove)
- 文本提取与清洗工具:trafilatura (https://github.com/adbar/trafilatura)、fastText (https://fasttext.cc/)、NLTK (https://www.nltk.org/)、ftfy (https://github.com/rspeer/python-ftfy)
我们感谢这些优秀的开源项目——它们的贡献使得Ultra-FineWeb-L1成为可能!🙌
📖 引用
如果您觉得Ultra-FineWeb-L1对您的研究有帮助,请考虑引用:
@misc{wang2025ultrafineweb,
title={{Ultra-FineWeb}: Efficient Data Filtering and Verification for High-Quality LLM Training Data},
author={Yudong Wang and Zixuan Fu and Jie Cai and Peijun Tang and Hongya Lyu and Yewei Fang and Zhi Zheng and Jie Zhou and Guoyang Zeng and Chaojun Xiao and Xu Han and Zhiyuan Liu},
year={2025},
eprint={2505.05427},
archivePrefix={arXiv},
primaryClass={cs.CL}
}
@misc{ultra-fineweb-l1,
title={Ultra-FineWeb-L1},
author={Junshao Guo and Shuaikang Xue and Xiaofei Yang and Chuyue Zhou and Qiang Yin and Qingyang Yuan and Qiang Ma and Yuzhou Zhang and Jie Zhou and Chaojun Xiao and Yudong Wang and Zhiyuan Liu},
year={2026},
url={https://huggingface.co/datasets/openbmb/Ultra-FineWeb-L1},
publisher={Hugging Face}
}
📜 许可证
本项目采用Apache 2.0 (https://www.apache.org/licenses/LICENSE-2.0) 许可证。由于语料库源自网络内容,用户还必须遵守原始来源相关的权利、许可和条款。
禁止未经授权的原样再分发: 未经原始作者(或本组织)事先书面许可,任何机构、组织或第三方平台严禁以任何形式直接转载、镜像、重新托管或商业化包装并再发布本项目的任何产物。
上个月下载量:1,343
相似文章
我用大约200美元的成本,从零开始在20B tokens上训练了一个1B参数的LLM。
一位开发者从零开始训练了一个1.1B参数的LLM,使用了200亿个token,成本约为200美元。该模型使用fineweb-edu进行预训练,并在OpenHermes上进行了LoRA微调。该项目包含开源代码、模型权重和一个演示网站。
@AdinaYakup: OpenBMB 刚刚发布了一个令人印象深刻的有监督微调数据集 UltraData-SFT-2605,包含 1500 万以上高质量样本,覆盖深度思考与非思考等类型……
OpenBMB 发布了 UltraData-SFT-2605,这是一个大规模数据集,包含超过 1500 万高质量样本,用于推理型大语言模型的监督微调(SFT),涵盖深度思考、非思考、数学、代码、知识、指令遵循和多语言数据。
基于1800年代文本从头训练LLM(160GB数据集)
作者详细介绍了使用160GB的1800年代英语文本从头训练LLM的过程,训练了一个5亿参数的评估模型,并计划训练一个20亿参数的模型,结果显示在历史问答方面有不错的前景。
@oliviscusAI:OpenAI 联合创始人刚刚发布了他的个人指南,教你从头训练大语言模型。它叫 llm.c。无需繁琐设置。只…
OpenAI 联合创始人 Andrej Karpathy 发布了 llm.c,这是一份开源指南,教你如何从头训练大语言模型。代码简洁,可在任何硬件上运行,包括 CPU 和 MacBook,并且比标准方法快 7%。
Webfetch - 面向LLM智能体的本地网页搜索,减少87%令牌使用量并降低66%成本
Webfetch是一款工具,可为LLM智能体提供本地网页搜索,将令牌使用量减少87%,成本降低66%,提升效率。