@cjzafir: 今天微调你的第一个AI模型。运行GPT4o级别的模型,并在你的手机或笔记本电脑上运行。@OpenBMB发布了15M样本…
摘要
OpenBMB发布了UltraData-SFT-2605,一个包含1500万样本的高质量SFT数据集,用于微调如MiniCPM5-1B等AI模型,使其能在手机或笔记本电脑上运行。
查看缓存全文
缓存时间: 2026/05/29 17:53
今天就开始微调你的第一个 AI 模型。
在手机或笔记本电脑上运行 GPT4o 级别的模型。
@OpenBMB 发布了 1500 万条样本的 SFT 数据集,你现在就可以使用。
(319GB 高质量后训练数据集。)
从 Huggingface 下载附带的数据集 使用 Codex 进行剥离
openbmb/UltraData-SFT-2605 · Datasets at Hugging Face
来源:https://huggingface.co/datasets/openbmb/UltraData-SFT-2605
你需要同意分享联系方式才能访问该数据集
此仓库是公开可访问的,但你需要接受条件才能访问其文件和内容。
登录 (https://huggingface.co/login?next=/datasets/openbmb/UltraData-SFT-2605) 或注册 (https://huggingface.co/join?next=/datasets/openbmb/UltraData-SFT-2605) 以查看条件并访问该数据集内容。
📦 UltraData 集合 (https://huggingface.co/collections/openbmb/ultradata) | 🌐 UltraData (https://ultradata.openbmb.cn/) | 🤗 MiniCPM5 系列 (https://huggingface.co/collections/openbmb/minicpm5)
English | 中文 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605/blob/main/README_ZH.md)
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%9A-介绍📚 介绍
UltraData-SFT-2605 是 MiniCPM5-1B (https://huggingface.co/collections/openbmb/minicpm5) 系列中 MiniCPM5-1B-SFT (https://huggingface.co/openbmb/MiniCPM5-1B-SFT) 后训练 所用的全部核心领域 SFT 数据,也是 UltraData (https://ultradata.openbmb.cn/) L0-L4 分级数据管理框架 (https://arxiv.org/pdf/2602.09003) 中 L3 精炼数据 的关键代表。它涵盖数学、代码、知识、指令遵循等核心领域,包含 超过 1500 万条深度思考(Deep Thinking)和非思考(Non-thinking)训练样本。每条样本都经过 高质量 SFT 数据管理流水线——涵盖查询构建与过滤、答案质量控制、基于训练的验证以及基准去污染——确保进入最终训练的数据干净且真正有效。
在每个领域和每个难度级别上,UltraData-SFT-2605 都同时构建了深度思考和非思考数据:
- 非思考数据 针对模型在用户需要快速、即时回答的场景中直接响应的能力。
- 深度思考数据 针对复杂任务所需的推理、规划和验证能力。
这种双重覆盖确保了模型在各种使用场景下——从快速的对话式响应到多步推理链——都能获得适当的训练信号。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%A2-最新动态📢 最新动态
- [2026.05.28] UltraData-SFT-2605 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605) 数据集发布!这是 MiniCPM5-1B (https://huggingface.co/collections/openbmb/minicpm5) 系列中 MiniCPM5-1B-SFT (https://huggingface.co/openbmb/MiniCPM5-1B-SFT) 后训练 所用的全部核心领域 SFT 数据,也是 UltraData (https://ultradata.openbmb.cn/) L0-L4 分级数据管理框架 (https://arxiv.org/pdf/2602.09003) 中 L3 精炼数据 的关键代表。它涵盖数学、代码、知识、指令遵循等核心领域,包含 超过 1500 万条深度思考和非思考训练样本。🚀🚀🚀
- [2026.05.25] MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) 发布!,这是 MiniCPM5 系列的首个模型。它是一个密集的 1B Transformer,专为设备端、本地部署和资源受限场景构建,达到了 1B 级开源 SOTA。UltraData-SFT-2605 是 MiniCPM5-1B 的核心 SFT 数据集。
- [2026.02.08] UltraData (https://ultradata.openbmb.cn/) 平台现已上线,引入了 L0-L4 分级数据管理框架 (https://arxiv.org/pdf/2602.09003)。🔍🔍🔍
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%8F%97%EF%B8%8F-高质量-sft-数据管理流水线🏗️ 高质量 SFT 数据管理流水线
UltraData-SFT-2605 遵循六步高质量 SFT 数据管理流水线:
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#1-开源数据验证与查询过滤1. 开源数据验证与查询过滤
对于来自开源社区的数据,我们执行查询级别过滤,重点关注:
- 问题是否具有真正的训练价值
- 意图是否清晰
- 能力覆盖是否足够
- 难度是否合理
- 问题是否推动模型学习真正有用的技能,而不是重复低价值的模板
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#2-内部查询构建2. 内部查询构建
对于内部构建的数据,我们围绕不同能力类型设计查询来源和构建方法:
- 知识数据基于考试大纲和考查点构建
- 指令遵循数据基于原子指令构建
- 自我进化与增强:自我进化的问题演化与增强
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#3-高质量预训练格式-l3-数据过滤3. 高质量预训练格式 L3 数据过滤
后训练还包含高质量预训练格式的数据,例如 L3 教材或 Wiki 风格的内容,以增强模型的知识组织、表达和泛化能力。对于此类数据,我们进一步根据结构完整性、信息密度和可学习性进行过滤——确保其适合后训练,而不是简单地将预训练文本转换为问答格式。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#4-答案质量过滤4. 答案质量过滤
我们重点关注:
- 答案是否正确
- 表达是否清晰
- 格式是否满足要求
对于深度思考数据,我们额外验证推理过程是否有助于模型学习问题分解和中间验证,而不是堆砌冗长空洞的“思考文本”。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#5-单数据验证5. 单数据验证
所有数据都经过单数据验证。我们使用 70% 候选数据 + 30% 指令遵循数据 的混合进行快速 SFT 验证训练,默认 3 个 epoch,训练预算上限为 20B token。在此步骤中,我们主要关注:
- 验证每个数据类别的实际能力提升
- 结合跨检查点的评估结果,搜索最佳 epoch 数
- 确定数据在最终训练混合中的角色
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#6-基准去污染6. 基准去污染
所有数据都针对现有基准进行去污染测试,最大限度地降低训练-评估重叠的风险。这确保模型的能力提升来自真实的数据质量改进,而不是记忆测试项目。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%8E%AF-能力覆盖🎯 能力覆盖
UltraData-SFT-2605 涵盖七个核心能力领域。大多数领域提供深度思考和非思考变体,而多语言领域仅作为非思考发布。
| 领域(配置) | 描述 |
|---|---|
| Math | 数学推理、问题求解、公式推导 |
| Code | 代码生成、调试、算法问题求解 |
| Knowledge | 事实知识、概念理解、考试导向的问答 |
| Chinese-general | 通用中文对话和推理数据 |
| IF | 指令遵循——多约束指令、格式符合 |
| Multi-lang-Math | 多语言数学推理数据 |
| Multi-lang-Knowledge | 多语言知识/世界事实问答 |
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%8A-数据集统计📊 数据集统计
经过完整的数据管理流水线后,UltraData-SFT-2605 总共包含 1500 万+ 条样本。按领域和思考模式的细分如下:
| 领域(配置) | 深度思考 (think) | 非思考 (no_think) | 总计 |
|---|---|---|---|
| Math | 2,499,830 | 2,999,644 | 5,499,474 |
| Code | 2,788,465 | 3,000,000 | 5,788,465 |
| Knowledge | 499,667 | 800,000 | 1,299,667 |
| Chinese-general | 499,954 | 500,000 | 999,954 |
| IF | 199,883 | 199,991 | 399,874 |
| Multi-lang-Math | — | 549,230 | 549,230 |
| Multi-lang-Knowledge | — | 499,514 | 499,514 |
| 总计 | 6,487,799 | 8,548,379 | 15,036,178 |
原始样本数量(质量过滤前)略高;上表显示的是此处发布的最终后数据管理计数。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%9A%80-快速开始🚀 快速开始
你可以直接从 Hugging Face 加载数据集:
每个配置对应一个能力领域。在每个配置中,think 和 no_think 是两个拆分(当两者都可用时)。
from datasets import load_dataset
# Math: 深度思考拆分
ds = load_dataset("openbmb/UltraData-SFT-2605", "Math", split="think")
# Math: 非思考拆分
ds = load_dataset("openbmb/UltraData-SFT-2605", "Math", split="no_think")
# Code / Knowledge / IF / Chinese-general — 用法相同
ds = load_dataset("openbmb/UltraData-SFT-2605", "Code", split="think")
# Multi-lang-Knowledge / Multi-lang-Math: 仅可获取 no_think
ds = load_dataset("openbmb/UltraData-SFT-2605", "Multi-lang-Math", split="no_think")
可用配置:Chinese-general、IF、Knowledge、Code、Math、Multi-lang-Knowledge、Multi-lang-Math。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%92%A1-使用场景💡 使用场景
UltraData-SFT-2605 不仅仅是“大规模”SFT 数据集——它是一个经过过滤、去污染和基于训练验证的高质量后训练资源。它适用于:
- 训练小参数模型:经过 MiniCPM5-1B 验证的紧凑模型 SFT 方案。
- 领域微调:选择性使用数学、代码、知识或指令遵循切片进行针对性能力增强。
- 混合比例研究:研究深度思考与非思考数据比率对模型行为、延迟和下游任务性能的影响。
- 后训练方法论基准测试:用于在受控条件下比较后训练方法的参考数据集。
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%96-引用📖 引用
如果你发现 UltraData-SFT-2605 在研究中有用,请考虑引用:
@misc{ultradata-sft-2605,
title={UltraData-SFT-2605},
author={OpenBMB},
year={2026},
url={https://huggingface.co/datasets/openbmb/UltraData-SFT-2605},
publisher={Hugging Face}
}
https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%9C-许可📜 许可
本项目根据 Apache 2.0 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605/blob/main/LICENSE) 许可证发布。UltraData-SFT-2605 整合了来自多个源数据集的查询;除了本仓库的许可证外,用户还必须查看并遵守每个上游数据集的许可条款。
禁止未经授权的原样再分发: 未经原作者(或本组织)事先书面许可,任何机构、组织或第三方平台严禁以任何形式直接转载、镜像、重新托管或商业包装重新发布本项目的任何制品。
相似文章
@heyshrutimishra: 全尺寸AI模型现在可以在手机上运行。这就是 BitCPM,一个来自 ModelBest、清华大学和 OpenBMB 的全新开源模型。……
BitCPM 是一个来自 ModelBest、清华大学和 OpenBMB 的新开源模型,它使用三元权重(-1,0,1)在手机上运行全尺寸AI模型。
@AdinaYakup: MiniCPM V4.6 一个真正能在手机上运行的 1B 多模态大语言模型,由 @OpenBMB 刚刚发布 1B - Apache2.0 支持 iOS、Android,…
OpenBMB 发布了 MiniCPM V4.6,这是一个专为移动设备优化的 1B 参数多模态大语言模型,采用 Apache 2.0 许可证。它具备混合视觉 token 压缩功能,声称在 iOS、Android 和 HarmonyOS 上原生运行时,吞吐量比 Qwen3.5 0.8B 快约 1.5 倍。
@AdinaYakup: OpenBMB 刚刚发布了一个令人印象深刻的有监督微调数据集 UltraData-SFT-2605,包含 1500 万以上高质量样本,覆盖深度思考与非思考等类型……
OpenBMB 发布了 UltraData-SFT-2605,这是一个大规模数据集,包含超过 1500 万高质量样本,用于推理型大语言模型的监督微调(SFT),涵盖深度思考、非思考、数学、代码、知识、指令遵循和多语言数据。
GPT-4o 现已支持微调
OpenAI 推出了 GPT-4o 和 GPT-4o mini 的微调功能,允许开发者使用自己的数据集以更低成本自定义模型。该功能包括免费的训练代币(GPT-4o 每天 1M,GPT-4o mini 每天 2M,有效期至 9 月 23 日),面向所有付费层级的开发者提供。
MiniCPM-V 4.6
MiniCPM-V 4.6 是一款专为移动设备优化的极致高效 13 亿参数视觉语言模型。