@cjzafir: 今天微调你的第一个AI模型。运行GPT4o级别的模型,并在你的手机或笔记本电脑上运行。@OpenBMB发布了15M样本…

X AI KOLs Following 工具

摘要

OpenBMB发布了UltraData-SFT-2605,一个包含1500万样本的高质量SFT数据集,用于微调如MiniCPM5-1B等AI模型,使其能在手机或笔记本电脑上运行。

今天微调你的第一个AI模型。 运行GPT4o级别的模型,并在你的手机或笔记本电脑上运行。 @OpenBMB发布了1500万样本的SFT数据集,你现在就可以使用。 (319GB高质量后训练数据集。) > 从Huggingface下载附件数据集 > 使用Codex进行剥离
查看原文
查看缓存全文

缓存时间: 2026/05/29 17:53

今天就开始微调你的第一个 AI 模型。

在手机或笔记本电脑上运行 GPT4o 级别的模型。

@OpenBMB 发布了 1500 万条样本的 SFT 数据集,你现在就可以使用。

(319GB 高质量后训练数据集。)

从 Huggingface 下载附带的数据集 使用 Codex 进行剥离


openbmb/UltraData-SFT-2605 · Datasets at Hugging Face

来源:https://huggingface.co/datasets/openbmb/UltraData-SFT-2605

你需要同意分享联系方式才能访问该数据集

此仓库是公开可访问的,但你需要接受条件才能访问其文件和内容。

登录 (https://huggingface.co/login?next=/datasets/openbmb/UltraData-SFT-2605) 或注册 (https://huggingface.co/join?next=/datasets/openbmb/UltraData-SFT-2605) 以查看条件并访问该数据集内容。

📦 UltraData 集合 (https://huggingface.co/collections/openbmb/ultradata) | 🌐 UltraData (https://ultradata.openbmb.cn/) | 🤗 MiniCPM5 系列 (https://huggingface.co/collections/openbmb/minicpm5)

English | 中文 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605/blob/main/README_ZH.md)

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%9A-介绍📚 介绍

UltraData-SFT-2605MiniCPM5-1B (https://huggingface.co/collections/openbmb/minicpm5) 系列中 MiniCPM5-1B-SFT (https://huggingface.co/openbmb/MiniCPM5-1B-SFT) 后训练 所用的全部核心领域 SFT 数据,也是 UltraData (https://ultradata.openbmb.cn/) L0-L4 分级数据管理框架 (https://arxiv.org/pdf/2602.09003) 中 L3 精炼数据 的关键代表。它涵盖数学、代码、知识、指令遵循等核心领域,包含 超过 1500 万条深度思考(Deep Thinking)和非思考(Non-thinking)训练样本。每条样本都经过 高质量 SFT 数据管理流水线——涵盖查询构建与过滤、答案质量控制、基于训练的验证以及基准去污染——确保进入最终训练的数据干净且真正有效。

在每个领域和每个难度级别上,UltraData-SFT-2605 都同时构建了深度思考非思考数据:

  • 非思考数据 针对模型在用户需要快速、即时回答的场景中直接响应的能力。
  • 深度思考数据 针对复杂任务所需的推理、规划和验证能力。

这种双重覆盖确保了模型在各种使用场景下——从快速的对话式响应到多步推理链——都能获得适当的训练信号。

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%A2-最新动态📢 最新动态

  • [2026.05.28] UltraData-SFT-2605 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605) 数据集发布!这是 MiniCPM5-1B (https://huggingface.co/collections/openbmb/minicpm5) 系列中 MiniCPM5-1B-SFT (https://huggingface.co/openbmb/MiniCPM5-1B-SFT) 后训练 所用的全部核心领域 SFT 数据,也是 UltraData (https://ultradata.openbmb.cn/) L0-L4 分级数据管理框架 (https://arxiv.org/pdf/2602.09003) 中 L3 精炼数据 的关键代表。它涵盖数学、代码、知识、指令遵循等核心领域,包含 超过 1500 万条深度思考和非思考训练样本。🚀🚀🚀
  • [2026.05.25] MiniCPM5-1B (https://huggingface.co/openbmb/MiniCPM5-1B) 发布!,这是 MiniCPM5 系列的首个模型。它是一个密集的 1B Transformer,专为设备端、本地部署和资源受限场景构建,达到了 1B 级开源 SOTA。UltraData-SFT-2605 是 MiniCPM5-1B 的核心 SFT 数据集。
  • [2026.02.08] UltraData (https://ultradata.openbmb.cn/) 平台现已上线,引入了 L0-L4 分级数据管理框架 (https://arxiv.org/pdf/2602.09003)。🔍🔍🔍

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%8F%97%EF%B8%8F-高质量-sft-数据管理流水线🏗️ 高质量 SFT 数据管理流水线

UltraData-SFT-2605 遵循六步高质量 SFT 数据管理流水线:

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#1-开源数据验证与查询过滤1. 开源数据验证与查询过滤

对于来自开源社区的数据,我们执行查询级别过滤,重点关注:

  • 问题是否具有真正的训练价值
  • 意图是否清晰
  • 能力覆盖是否足够
  • 难度是否合理
  • 问题是否推动模型学习真正有用的技能,而不是重复低价值的模板

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#2-内部查询构建2. 内部查询构建

对于内部构建的数据,我们围绕不同能力类型设计查询来源和构建方法:

  • 知识数据基于考试大纲和考查点构建
  • 指令遵循数据基于原子指令构建
  • 自我进化与增强:自我进化的问题演化与增强

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#3-高质量预训练格式-l3-数据过滤3. 高质量预训练格式 L3 数据过滤

后训练还包含高质量预训练格式的数据,例如 L3 教材或 Wiki 风格的内容,以增强模型的知识组织、表达和泛化能力。对于此类数据,我们进一步根据结构完整性、信息密度和可学习性进行过滤——确保其适合后训练,而不是简单地将预训练文本转换为问答格式。

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#4-答案质量过滤4. 答案质量过滤

我们重点关注:

  • 答案是否正确
  • 表达是否清晰
  • 格式是否满足要求

对于深度思考数据,我们额外验证推理过程是否有助于模型学习问题分解和中间验证,而不是堆砌冗长空洞的“思考文本”。

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#5-单数据验证5. 单数据验证

所有数据都经过单数据验证。我们使用 70% 候选数据 + 30% 指令遵循数据 的混合进行快速 SFT 验证训练,默认 3 个 epoch,训练预算上限为 20B token。在此步骤中,我们主要关注:

  • 验证每个数据类别的实际能力提升
  • 结合跨检查点的评估结果,搜索最佳 epoch 数
  • 确定数据在最终训练混合中的角色

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#6-基准去污染6. 基准去污染

所有数据都针对现有基准进行去污染测试,最大限度地降低训练-评估重叠的风险。这确保模型的能力提升来自真实的数据质量改进,而不是记忆测试项目。

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%8E%AF-能力覆盖🎯 能力覆盖

UltraData-SFT-2605 涵盖七个核心能力领域。大多数领域提供深度思考和非思考变体,而多语言领域仅作为非思考发布。

领域(配置)描述
Math数学推理、问题求解、公式推导
Code代码生成、调试、算法问题求解
Knowledge事实知识、概念理解、考试导向的问答
Chinese-general通用中文对话和推理数据
IF指令遵循——多约束指令、格式符合
Multi-lang-Math多语言数学推理数据
Multi-lang-Knowledge多语言知识/世界事实问答

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%8A-数据集统计📊 数据集统计

经过完整的数据管理流水线后,UltraData-SFT-2605 总共包含 1500 万+ 条样本。按领域和思考模式的细分如下:

领域(配置)深度思考 (think)非思考 (no_think)总计
Math2,499,8302,999,6445,499,474
Code2,788,4653,000,0005,788,465
Knowledge499,667800,0001,299,667
Chinese-general499,954500,000999,954
IF199,883199,991399,874
Multi-lang-Math549,230549,230
Multi-lang-Knowledge499,514499,514
总计6,487,7998,548,37915,036,178

原始样本数量(质量过滤前)略高;上表显示的是此处发布的最终后数据管理计数

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%9A%80-快速开始🚀 快速开始

你可以直接从 Hugging Face 加载数据集:

每个配置对应一个能力领域。在每个配置中,thinkno_think 是两个拆分(当两者都可用时)。

from datasets import load_dataset

# Math: 深度思考拆分
ds = load_dataset("openbmb/UltraData-SFT-2605", "Math", split="think")

# Math: 非思考拆分
ds = load_dataset("openbmb/UltraData-SFT-2605", "Math", split="no_think")

# Code / Knowledge / IF / Chinese-general — 用法相同
ds = load_dataset("openbmb/UltraData-SFT-2605", "Code", split="think")

# Multi-lang-Knowledge / Multi-lang-Math: 仅可获取 no_think
ds = load_dataset("openbmb/UltraData-SFT-2605", "Multi-lang-Math", split="no_think")

可用配置:Chinese-generalIFKnowledgeCodeMathMulti-lang-KnowledgeMulti-lang-Math

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%92%A1-使用场景💡 使用场景

UltraData-SFT-2605 不仅仅是“大规模”SFT 数据集——它是一个经过过滤、去污染和基于训练验证的高质量后训练资源。它适用于:

  • 训练小参数模型:经过 MiniCPM5-1B 验证的紧凑模型 SFT 方案。
  • 领域微调:选择性使用数学、代码、知识或指令遵循切片进行针对性能力增强。
  • 混合比例研究:研究深度思考与非思考数据比率对模型行为、延迟和下游任务性能的影响。
  • 后训练方法论基准测试:用于在受控条件下比较后训练方法的参考数据集。

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%96-引用📖 引用

如果你发现 UltraData-SFT-2605 在研究中有用,请考虑引用:

@misc{ultradata-sft-2605,
  title={UltraData-SFT-2605},
  author={OpenBMB},
  year={2026},
  url={https://huggingface.co/datasets/openbmb/UltraData-SFT-2605},
  publisher={Hugging Face}
}

https://huggingface.co/datasets/openbmb/UltraData-SFT-2605#%F0%9F%93%9C-许可📜 许可

本项目根据 Apache 2.0 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605/blob/main/LICENSE) 许可证发布。UltraData-SFT-2605 整合了来自多个源数据集的查询;除了本仓库的许可证外,用户还必须查看并遵守每个上游数据集的许可条款

禁止未经授权的原样再分发: 未经原作者(或本组织)事先书面许可,任何机构、组织或第三方平台严禁以任何形式直接转载、镜像、重新托管或商业包装重新发布本项目的任何制品。

相似文章

GPT-4o 现已支持微调

OpenAI Blog

OpenAI 推出了 GPT-4o 和 GPT-4o mini 的微调功能,允许开发者使用自己的数据集以更低成本自定义模型。该功能包括免费的训练代币(GPT-4o 每天 1M,GPT-4o mini 每天 2M,有效期至 9 月 23 日),面向所有付费层级的开发者提供。

MiniCPM-V 4.6

Product Hunt

MiniCPM-V 4.6 是一款专为移动设备优化的极致高效 13 亿参数视觉语言模型。