智能体数据
摘要
NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。
查看缓存全文
缓存时间: 2026/07/09 07:33
智能体的数据
来源:https://huggingface.co/blog/nvidia/open-data-for-agents 返回文章列表 (https://huggingface.co/blog)
为什么智能体 AI 需要开放数据,以及合成数据为何是我们扩展它的方式。
Nemotron Post-Training v3 Prompt Atlas
图片:Nemotron Post-Training v3 Prompt Atlas
不止模型权重
构建 AI 智能体很难,因为现实世界的行为与基准测试不一致。
一个无法从失败的 API 调用或从未见过的工作流中恢复的智能体,并非真正的智能体。它只是一个带有工具自动补全器。从前者跨越到后者是一个数据问题:软件工程轨迹、工具使用失败、多步推理、检索、安全、用户模拟、工作流执行,以及最终的物理世界交互。这就是 NVIDIA Nemotron 开放数据产品所在之处。
NVIDIA 近期强调了开放模型如何推动 AI 研究 (https://blogs.nvidia.com/blog/open-models-icml-2026/),并在广受欢迎的国际机器学习大会 (ICML) 上亮相,近 145 篇论文引用了 Nemotron 模型和数据集。合成数据在该生态系统中扮演着重要角色:
- Nemotron-CC (https://huggingface.co/datasets/nvidia/Nemotron-CC-v2) 使用合成数据增强流行的 Common Crawl 数据集,用于预训练。
- Nemotron-CC-MATH (https://huggingface.co/datasets/nvidia/Nemotron-CC-Math-v1) 利用合成数学问题提升推理能力。
- Nemotron 预训练 (https://huggingface.co/collections/nvidia/nemotron-pre-training-datasets) 是一个广泛的数据集集合,涵盖通用、代码、数学和合成数据,规模达数万亿 tokens。
NVIDIA 发布开放数据集 (https://huggingface.co/blog/nvidia/open-data-for-ai) 的部分原因,是为了与社区共同学习,在这些不同应用上拓展。
开放权重很重要。但对于智能体而言,权重只是故事的一部分。可复现性还依赖于模型背后的数据集、筛选选择、训练方案和评估方法。
智能体的行为需要是可检查的。如果一个模型调用工具、执行工作流、检索信息并在多个系统间运作,开发者需要理解塑造这些行为的数据。开放数据使得智能体行为可检查、可解释。合成数据是实现这一目标的关键拼图。
保守秘密
NVIDIA 应用深度学习研究副总裁 Bryan Catanzaro 最近指出:“每个公司都围绕着一个秘密建立” (https://youtu.be/Oojrfdl42LI?is=94ru5X7RaufPBHL9) —— 竞争对手没有的工作流、语料库或客户模式。这些秘密让 AI 变得有用,但公司不应轻易暴露它们。合成数据为团队提供了一种保留有用信号而不暴露底层来源的方式。
Bryan 还谈到要培育一个多样化、参与性的 AI 生态系统,让各类公司、研究人员、政府和社区都能做出贡献。这不仅是价值主张,更是数据主张。
如果每个模型都从同样狭窄的数据池中学习,那么当模型开始趋同时,我们不应感到惊讶。困难在于,最有用的数据往往存在于那些无法或不愿直接发布它们的组织内部。每个人都受益于更丰富的共享数据层。但没有人愿意第一个放弃让自己与众不同的东西。
公开发布的合成数据是改变这种局面的一种方式。
探索智能体数据
作为 Nemotron 开放数据的一部分,我们已发布超过 10 万亿个预训练 tokens 和数百万个后训练样本,涵盖众多领域和数据形态。这很难理解——而原始数据集表格帮助不大。
为了更容易探索 Nemotron 后训练数据中究竟包含什么,我们构建了 Nemotron Post-Training v3 Prompt Atlas (https://huggingface.co/spaces/nvidia/nemotron-post-training-v3-prompt-atlas):一个交互式可视化地图,每个点代表一个提示样本,取自 Nemotron v3 后训练集合,并按数据混合的实际比例进行体积采样。
颜色叠加和筛选器允许你按数据集、流水线阶段、领域或工具使用重新组织地图。由于语义相似的提示会聚集在一起,你可以放大到某个区域——编码算法、安全、数学、智能体行为——检查代表性示例,并利用这些信号来整理数据、构建评估或理解模型为何表现出特定行为。
角色万岁
智能体还需要理解它们所服务的人群,而在这里,“数据质量”变成局部性的,而非普适的。一个在英文互联网数据上训练的有毒内容分类器,可能会漏掉韩语或日语中的敌意信息——在这些语言中,攻击性通常编码在礼貌级别中,而非明显的词汇。同样的信号,不同的上下文。团队已经在以这种方式将智能体落地 (https://huggingface.co/blog/nvidia/build-korean-agents-with-nemotron-personas)。
Nemotron-Personas (https://docs.nvidia.com/nemo/datadesigner/dev-notes/designing-nemotron-personas) 是解决这一问题的一次尝试:基于本地现实的合成角色,捕捉人群的多样性和复杂性。它使用 NeMo Data Designer (https://github.com/NVIDIA-NeMo/DataDesigner/),这是 NVIDIA 用于合成数据生成的最先进复合 AI 工具集,Nemotron-Personas 反映了官方的区域人口和地理统计数据。目标不是复刻真实的人。从某种意义上说,它是为了帮助开发者测试他们的系统是否反映了他们声称要服务的用户、语言、区域和职业。上个月在巴黎的 VivaTech 大会上,我们发布了该系列 (https://huggingface.co/collections/nvidia/nemotron-personas) 中的第十个国家,目前覆盖超过 24 亿人口。
Nemotron-Personas 全球覆盖范围
当质量是局部的时,只有了解该区域的人才能构建它——区域研究人员、母语者、领域专家、能够与你一起检查和纠正的干系人。这就是公开学习:不是孤立地发布数据,而是协作构建。
事实基础
合成数据需要作为数据源系统的一部分进行集成。这其中存在权衡。它可以降低风险,但并不能消除对事实基础、溯源、整理、评估和人类判断的需求。
一个有用的思考方式是“合成阈值” (https://youtu.be/1Qka-OiViqM?si=6umC78jZ94AmbTeq&t=1366):即数据不再能被视为纯粹真实数据的临界点。这条线并不总是明显的。真实的工作流、人类反馈、模型生成的轨迹、模拟用户和合成标签都可能交织在一起。答案不是假装合成数据是虚假或无害的。而是记录生成了什么、基于什么事实、经过什么审查、以及数据旨在测试什么。随着越来越多的 AI 系统在人工信息上进行训练,我们需要更好的共享习惯来检查、记录这些数据,并公开讨论这些技术。
质量在不同语境下也有不同含义。推理数据需要更难的问题和更清晰的轨迹。角色数据需要分布保真度和局部审查。智能体工作流需要任务多样性、失败覆盖和恢复路径。这个领域仍然更像手艺而非公式。
这就是开放方法重要的原因。合成数据不仅仅是生成更多示例。它关乎提出更好的问题,并让原本无法坐在同一张桌子上的各方能够参与:公司无需泄露秘密,政府无需牺牲隐私,研究人员无需等待可能永远不会到来的许可。
AI 中的稀缺资源不是 tokens。而是组织间的信任。合成数据是我们为数不多的建立信任的工具之一。
我们曾在 2026 年 7 月 7 日(星期二)举办了一场关于“为何开放数据重要”的直播 (https://www.youtube.com/live/qg8awR1Yg78?si=nEsZzEJCOxcjZnp4),嘉宾阵容精彩。值得一看,同时还有 Hugging Face 上的 Nemotron 数据集合 (https://huggingface.co/nvidia/collections)。
通过订阅 NVIDIA 新闻 (https://www.nvidia.com/en-us/preferences/email-preferences/) 保持对 NVIDIA Nemotron 的最新了解,并在 LinkedIn (https://www.linkedin.com/showcase/nvidia-ai/)、X (https://x.com/NVIDIAAI)、YouTube (https://www.youtube.com/@NVIDIADeveloper) 和 Discord 上的 Nemotron 频道 (https://discord.com/invite/nvidia) 关注 NVIDIA AI。
访问 Hugging Face 上的开放 Nemotron 模型 (https://huggingface.co/nvidia),以及 build.nvidia.com 上的 NIM 微服务和开发者示例集合 (https://build.nvidia.com/)。
相似文章
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。
@nicos_ai: NVIDIA 刚刚正式发布了他们用于其 AI 代理的技能集。目前他们拥有的技能包括:→ 分析…
NVIDIA 正式发布了一套用于 AI 代理的技能集,涵盖视频分析、语音代理、LLM 训练、模型加速、RAG、安全环境、物流优化和 CUDA 编程。
Nemotron Labs:开放模型如何让企业和国家拥有可信、可控且可定制的AI
NVIDIA的博客文章强调了像Nemotron这样的开放模型如何使企业和国家能够构建可信、可控且可定制的AI系统,这与限制检查和适应的封闭模型形成对比。
开放模型如何推动AI研究
NVIDIA强调,开放前沿模型和AI基础设施正在推动AI研究,这体现在ICML 2026接收的论文中,涵盖机器人学、生命科学和合成数据等领域。
企业如何构建值得信赖的专用AI
NVIDIA 推出 Agent Toolkit,这是一个开放的模块化基础架构,包含模型、工具、技能和安全运行时,帮助企业为各行各业构建专用、可信的AI智能体。