@AtriaASI:我们感谢OpenBMB通过UltraData-SFT-Agent-2609支持Atria Dawn Preview。该数据集的高质量…

X AI KOLs Timeline 工具

摘要

OpenBMB发布了UltraData-SFT-Agent-2609,这是一个包含50万个样本的数据集,用于代理指令调优,并在MiniCPM5-2B模型的后训练中使用。

我们感谢OpenBMB通过UltraData-SFT-Agent-2609支持Atria Dawn Preview。 该数据集的高质量代理轨迹在开发Atria在代理任务方面的能力时非常有价值。 🔗 https://t.co/PBAz6Q7J51
查看原文
查看缓存全文

缓存时间: 2026/09/16 22:13

我们衷心感谢OpenBMB为Atria Dawn Preview提供UltraData-SFT-Agent-2609的支持。该数据集高质量的代理轨迹对开发Atria的代理任务能力具有重要价值。🔗 https://t.co/PBAz6Q7J51 — # openbmb/UltraData-SFT-Agent-2609 · Hugging Face数据集 来源:https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609 📦 UltraData合集 (https://huggingface.co/collections/openbmb/ultradata)|🌐 UltraData (https://ultradata.openbmb.cn/)|🤗 MiniCPM5系列 (https://huggingface.co/collections/openbmb/minicpm5) English|中文 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609/blob/main/README_ZH.md) ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%93%9A-introduction📚 简介 UltraData-SFT-Agent-2609是UltraData (https://ultradata.openbmb.cn/) L0-L4分层数据管理框架 (https://arxiv.org/pdf/2602.09003/) 中用于代理指令微调的L3精炼数据。它为MiniCPM5-2B (https://huggingface.co/openmb/MiniCPM5-2B) 的后训练而构建,通过可执行的代理轨迹补充了UltraData-SFT-2605 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605)(核心领域SFT)。本次发布包含约50万个样本,涵盖工具使用、搜索代理、代码代理和通用代理,覆盖了从指令理解、工具调用、环境交互、验证、错误恢复到最终交付的完整工作流程。数据集涵盖的任务类型包括技能检索与调用、网络搜索与多跳问答、软件工程与代码执行、办公文档处理、通用函数调用、多轮记忆、金融服务、数据库操作、文件读写以及多模态内容处理,以及从技能调用和文件操作到文档和办公流程执行的综合工作流。任务包括单步或短链指令执行,以及需要持续规划、重复工具调用、处理执行反馈和中间验证的长链任务,形成了从基础工具使用到复杂代理协作的渐进任务分布。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%93%A2-whats-new📢 新增内容 - [2026.09.07] UltraData-SFT-Agent-2609 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609) 数据集发布! 为MiniCPM5-2B (https://huggingface.co/openbmb/MiniCPM5-2B) 后训练提供的代理指令微调轨迹,作为UltraData (https://ultradata.openbmb.cn/) L0-L4框架 (https://arxiv.org/pdf/2602.09003) 中的L3精炼数据。包含约50万条跨越工具使用、搜索代理、代码代理和通用代理的样本。🚀🚀🚀 - [2026.09.07] MiniCPM5-2B (https://huggingface.co/openbmb/MiniCPM5-2B) 发布!,这是MiniCPM5系列中继MiniCPM5-1B之后的第二个模型。它是一个密集的2B Transformer模型,扩展了相同的训练配方,专为设备端、本地部署和资源受限场景而构建。它达到了2B级别开源模型的最先进水平,与4B级别模型相比仍具有竞争力,并在编码、数学、长上下文理解、工具使用和代理任务方面展现出特别优势。UltraData-SFT-Agent-2609作为MiniCPM5-2B的核心代理SFT数据集。🚀🚀🚀 - [2026.02.08] UltraData (https://ultradata.openbmb.cn/) 平台现已上线,引入了L0-L4分层数据管理框架 (https://arxiv.org/pdf/2602.09003)。🔍🔍🔍 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%8E%AF-dataset-statistics-and-capability-coverage🎯 数据集统计与能力覆盖 本次发布包含483,661条跨越四个代理方向的轨迹。部分通用代理代码代理任务在多个执行环境中进行了重采样,因此统计的是轨迹数量而非唯一任务数。 方向样本数占比侧重点
通用代理311,00664.3%技能检索与调用、办公/文件工作流、多环境集成任务
工具使用82,76017.1%函数调用、虚拟工具、数据库、金融工作流、多轮工具使用
代码代理69,89514.5%跨环境的软件工程、代码编辑、测试和错误修复
搜索代理20,0004.1%中文/英文搜索、多跳问答、检索规划、网络访问
总计483,661100%

https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%8C%9F-dataset-characteristics🌟 数据集特性 - 完整轨迹:保留环境观察、工具调用与返回、错误、重试和最终提交——不仅限于用户指令和答案。 - 跨执行环境泛化:同类任务在不同执行环境、工具集和系统约束下进行采样。 - 轮次级掩码:低质量、冗余或格式错误的轮次可以从SFT损失中排除,而无需丢弃整个轨迹。 - 保留诊断性失败:部分超时、工具错误和恢复跟踪被保留(经脱敏处理)作为辅助监督,而非成功示范。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%8F%97%EF%B8%8F-data-construction-pipeline🏗️ 数据构建流程 数据集使用统一的流程进行任务生成和代理轨迹构建: 下图展示了数据构建过程的六个步骤:任务准备、任务重写与扩展、环境配置、跨执行环境采样、结果验证和轨迹组织。 1. 任务准备:从公开任务、开源数据集、代码仓库、知识资源或人工设计的任务中收集任务种子,并补充角色、目标、约束、输入和交付要求。 2. 任务重写与扩展:任务经过结构化重写、难度分级和能力标注,以生成不同语言、不同任务链和不同交付格式的任务变体。 3. 环境配置:为每个任务提供初始环境、参考文件、工具集、权限范围和可执行的成功标准。 4. 跨执行环境采样:任务被放置在不同的代理执行环境以及真实或模拟环境中,教师模型完成多轮交互和工具调用,收集环境反馈和最终结果。 5. 结果验证:根据任务类型,通过程序测试、沙箱执行、文件可打开性检查、格式规则、数值检查、证据检查或模型审查来验证结果。 6. 轨迹组织:将任务指令、环境观察、助手行为、工具输入、工具返回、错误和最终提交组织成统一的消息序列。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%A7%B9-data-cleaning-and-quality-control🧹 数据清洗与质量控制 上述流程产生的候选轨迹必须通过以下检查才能进入发布版本。这些检查通过自动规则、执行验证和模型审查的组合实现,涵盖采样、验证和组织阶段。主要包括: - 格式验证:检查JSONL可解析性、消息角色、必需字段、工具调用格式和参数模式。 - 轨迹完整性检查:检查任务指令、助手工具调用、工具返回、环境反馈和最终结果是否正确配对。 - 工具行为检查:过滤不存在的工具、非法参数、无效调用、重复调用、调用循环以及与任务无关的工具行为。 - 执行结果验证:通过沙箱执行、测试用例、文件产物、结构化规则、数值一致性或证据追溯来验证任务是否完成。 - 异常轨迹处理:对涉及超时、环境错误、工具故障、任务中断和错误恢复的轨迹进行过滤或应用归一化标签。 - 轮次级掩码:掩码低质量、冗余、重复、格式错误或其他不打算用于监督的交互轮次,以确保无效信号不会进入SFT损失。 - 重复与污染处理:执行样本去重、近重复检测、跨分集检查以及针对已知评估集的污染筛选。 - 隐私与安全处理:移除个人信息、账户、密钥、Cookie、内部路径和其他敏感字段,并标记或过滤危险操作、恶意代码和提示注入。 - 多阶段质量审查:结合基于规则的审查、执行结果审查、模型审查和人工抽查,优先处理目标明确、流程可执行且结果可验证的样本。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%93%A6-data-format📦 数据格式 每个JSONL行是一条轨迹。发布元数据使用五个字段:uuidmessagestoolssourcedomain。工具调用、观察、推理和最终答案位于messages中。 json { "uuid": "agent_sample_000001", "messages": [ {"role": "system", "content": "..."}, {"role": "user", "content": "..."}, {"role": "assistant", "content": "...", "tool_calls": [...]}, {"role": "tool", "content": "..."}, ... {"role": "assistant", "content": "..."} ], "tools": [ { "type": "function", "function": { "name": "", "description": "", "parameters": { "type": "object", "title": "parameters", "properties": { "": { "type": "string", "title": "", "description": "" } }, "required": [""] } } } ], "source": "UltraData-SFT-Agent-2609", "domain": "General_Agent-Office_Agent" } 字段类型 | 描述

— | — uuid | 字符串 | 样本ID。 messages | 数组 | 按时间顺序排列的system/user/assistant/tool轮次。 tools | 数组 | 采样时提供的工具定义;训练时将其渲染到目标聊天模板中。 source | 字符串 | 数据来源。 domain | 字符串 | General_Agent-Claw_AgentGeneral_Agent-Office_AgentSearch_Agent-enSearch_Agent-zhSearch_Agent-planTool_UseCode_Agent之一。部分子集可能保留额外的来源特定字段;如果存在,请使用子集说明进行映射。

https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%9A%80-quick-start🚀 快速开始 python from datasets import load_dataset ds = load_dataset("openbmb/UltraData-SFT-Agent-2609", "Code-Agent", split="train") ds = load_dataset("openbmb/UltraData-SFT-Agent-2609", "Search-Agent", split="train") ds = load_dataset("openbmb/UltraData-SFT-Agent-2609", "General-Agent", split="train") ds = load_dataset("openbmb/UltraData-SFT-Agent-2609", "Tool-Use", split="train") 可用配置:Code-AgentSearch-AgentGeneral-AgentTool-Use。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%92%A1-intended-uses💡 预期用途 - 面向MiniCPM风格的设备端模型的代理SFT,可通过domain、工具调用密度和轨迹长度进行可选过滤。 - 定向切片:函数调用(Tool-Use)、搜索/多跳检索(Search-Agent)、软件工程代理(Code-Agent)、办公和技能工作流(General-Agent)。 - 训练错误恢复和结果验证,包括保留的失败/恢复跟踪。 - 代理数据与核心领域SFT(如UltraData-SFT-2605 (https://huggingface.co/datasets/openbmb/UltraData-SFT-2605))的混合比例研究。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%E2%9A%A0%EF%B8%8F-notes-and-limitations⚠️ 注意事项与限制 - 仅静态轨迹:发布不包含环境、工具实现、测试或采样代码。无法在本地重放或重新接收轨迹。 - 渲染样本工具tools字段在采样执行环境中是固定的,必须写入训练上下文;许多虚拟API在实际部署中不存在。 - 验证 ≠ 过程质量:通过环境的成功检查并不意味着每一步都正确或高效。保留的失败跟踪不是成功标签。 - 快照时效性:网页、检索命中、文件、依赖项和API在采样时是固定的。请勿将轨迹事实或版本视为最新。 - 去污染范围:筛选涵盖了构建时已知的评估集;引入新基准前请运行新的检查。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%93%9C-license-and-data-sources📜 许可证与数据来源 本项目在Apache 2.0 (https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609/tree/main/LICENSE)许可证下发布。数据集聚合了上游数据集、公共仓库、网络内容和模型生成的轨迹;用户还必须遵守每个上游许可证。Apache 2.0不覆盖这些条款。部分样本源自公开可访问的课程页面。公开访问不授予重新分发、商业使用或训练权。权利持有者可通过数据集页面上的联系渠道请求删除。数据集不应包含明文密钥或未经授权的个人数据。请通过同一渠道报告敏感内容或删除请求。 禁止未经授权的原样再分发:未经原始作者(或本组织)事先书面许可,任何机构、组织或第三方平台均严禁以任何形式直接转载、镜像、重新托管,或商业化重新打包和重新发布本项目的任何成果。 ## https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609#%F0%9F%93%96-citation📖 引用 如果您觉得UltraData-SFT-Agent-2609对您的研究有用,请考虑引用: bibtex @misc{ultradata_sft_agent_2609, title = {UltraData-SFT-Agent-2609}, author = {MiniCPM Team}, year = {2026}, publisher = {Hugging Face}, howpublished = {\url{https://huggingface.co/datasets/openbmb/UltraData-SFT-Agent-2609}} } 上月下载量:13,932## 在openbmb/UltraData-SFT-Agent-2609上训练或微调的模型 ## 使用openbmb/UltraData-SFT-Agent-2609的Space ## 包含openbmb/UltraData-SFT-Agent-2609的合集 ## openbmb/UltraData-SFT-Agent-2609的论文

相似文章

openbmb/MiniCPM5-2B

Hugging Face Models Trending

OpenBMB发布了MiniCPM5-2B,这是一个2B参数的密集Transformer模型,在设备端部署的同类模型中达到了最先进的性能,并提供了开源的高质量训练数据集。

openbmb/MiniCPM5-2B-GGUF

Hugging Face Models Trending

发布 MiniCPM5-2B-GGUF,这是一个针对设备端部署优化的20亿参数AI模型,使用开源训练数据集在同类产品中达到了最先进的性能水平。

ProCUA-SFT 技术报告

Hugging Face Daily Papers

ProCUA-SFT 是一个大规模合成数据集,包含 310 万个步骤级别的 SFT 样本,用于训练计算机使用代理。该数据集通过使用单一 VLM(Kimi-K2.5)的自动化流程生成。在其上微调 UI-TARS 7B 在 OSWorld 上达到 45.0%,比基础模型提高了 18.7 个百分点。