进入Omniverse:借助合成数据与微调提升视觉AI代理准确性的三种工作流
摘要
NVIDIA讨论了在其Omniverse和Metropolis平台上使用合成数据与微调的三种工作流,以提升视觉AI代理在边缘部署中的准确性。
<div id="bsf_rt_marker"></div><p><i><span style="font-weight: 400;">编者按:本文是</span></i><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/news/"><i><span style="font-weight: 400;">《进入Omniverse》</span></i></a><i><span style="font-weight: 400;">系列的一部分,该系列专注于开发者、3D从业者及企业如何利用</span></i><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/usd/"><i><span style="font-weight: 400;">OpenUSD</span></i></a><i><span style="font-weight: 400;">和</span></i><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/"><i><span style="font-weight: 400;">NVIDIA Omniverse</span></i></a><i><span style="font-weight: 400;">的最新进展来转变工作流程。</span></i></p>
<p><a target="_blank" href="https://www.nvidia.com/en-us/use-cases/video-analytics-ai-agents/"><span style="font-weight: 400;">视觉AI代理</span></a><span style="font-weight: 400;">正成为一种实用方式,能够自动将物理世界的视频数据转化为工厂、城市、仓库和交通系统中的运营智能。</span></p>
<p><span style="font-weight: 400;">随着越来越多的AI工作负载靠近数据生成的位置,这种转变正在加速。Gartner预计,到2028年,超过三分之二的企业管理数据将在数据中心或云端之外创建和处理,到2029年,全球超过三分之二的企业将部署边缘AI,而2025年这一比例仅为10%(1)。</span></p>
<p><span style="font-weight: 400;">但更多的边缘数据并不会自动带来更多的智能。根据同一份Gartner报告,高达90%的现有边缘数据未得到处理。</span><span style="font-weight: 400;"><br />
</span><span style="font-weight: 400;"><br />
</span><span style="font-weight: 400;">将数据转化为有用的行动需要视觉AI代理能够理解视频、适应现实世界条件并将洞察连接到运营工作流。这些代理通常运行在摄像头、机器和传感器附近,模型必须满足延迟、功耗、成本和连接性要求,同时适应特定站点条件。</span><span style="font-weight: 400;"><br />
</span><span style="font-weight: 400;"><br />
</span><span style="font-weight: 400;">为此,开发者需要可重复的方法来生成训练数据、微调模型,并在边缘和云环境中部署代理视频应用。</span></p>
<p><a target="_blank" href="https://developer.nvidia.com/metropolis"><span style="font-weight: 400;">NVIDIA Metropolis</span></a><span style="font-weight: 400;">代理技能和蓝图提供了可重复使用的工作流,用于在整个生命周期中构建、优化和部署视觉AI代理。</span></p>
<p><span style="font-weight: 400;">在模拟和</span><a target="_blank" href="https://www.nvidia.com/en-us/glossary/synthetic-data-generation/"><span style="font-weight: 400;">合成数据</span></a><span style="font-weight: 400;">方面,通用场景描述(</span><a target="_blank" href="https://www.nvidia.com/en-us/glossary/openusd/"><span style="font-weight: 400;">OpenUSD</span></a><span style="font-weight: 400;">)提供了一个用于描述、组合和重用3D世界的通用框架。基于OpenUSD,</span><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/"> <span style="font-weight: 400;">NVIDIA Omniverse</span></a><span style="font-weight: 400;">库帮助团队构建模拟、合成数据生成和数字孪生工作流,能够模拟真实环境并扩展场景覆盖范围,涵盖光照、天气、交通模式、摄像头角度、遮挡和罕见事件等条件。</span></p>
<h2><strong>视觉AI代理项目可能遇到的瓶颈</strong></h2>
<p><span style="font-weight: 400;">随着组织转向自主视觉代理,三个常见挑战随之出现:</span></p>
<ul>
<li><b>数据缺口导致精度停滞:</b><span style="font-weight: 400;">视觉AI代理需要识别罕见缺陷、异常事件和变化的环境。例如,在制造业中,一个检测模型可能在常见划痕或凹陷上表现良好,但面对训练数据中未出现的新的细微裂纹时便会失效。</span><b> </b></li>
<li><b>缺乏微调专业知识:</b>一旦团队识别出性能差距,改进模型很少是简单的交接。微调需要标注数据集、训练配置、实验跟踪、评估以及判断是否对目标用例有所改进。许多构建视觉AI代理的组织没有庞大内部机器学习团队来快速管理这一过程,尤其是在涉及多个站点、产品或摄像头视角时。</li>
<li><b>复杂且耗时的代理组装工作流:</b><span style="font-weight: 400;">部署视觉AI代理不仅需要运行推理。开发者必须整合视频管线、AI模型、元数据、嵌入向量、索引、搜索、告警、报告和系统集成。针对特定环境定制该工作流会显著增加时间,并且需要专业知识。如果没有OpenUSD的共享场景描述层,团队每次在条件或部署站点变化时都需从头重建3D环境。</span></li>
</ul>
<h2><strong>视觉AI代理的全生命周期方法</strong></h2>
<p><span style="font-weight: 400;">NVIDIA代理技能和蓝图——与基于OpenUSD的模拟和合成数据生成的NVIDIA Omniverse、用于模型开发和视频AI部署的NVIDIA Metropolis配合使用——为这些工作流的关键部分提供了可重复的起点:</span></p>
<ul>
<li style="font-weight: 400;" aria-level="1"><span style="font-weight: 400;">“</span><a target="_blank" href="https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-defect-image-generation"><span style="font-weight: 400;">缺陷图像生成技能</span></a><span style="font-weight: 400;">”帮助创建合成缺陷数据。</span></li>
<li style="font-weight: 400;" aria-level="1"><span style="font-weight: 400;">“</span><a target="_blank" href="https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation"><span style="font-weight: 400;">视频数据增强技能</span></a><span style="font-weight: 400;">”帮助扩展场景覆盖范围。</span></li>
<li style="font-weight: 400;" aria-level="1"><a target="_blank" href="https://github.com/NVIDIA-TAO/tao-skills-bank"><span style="font-weight: 400;">NVIDIA TAO技能</span></a><span style="font-weight: 400;">支持模型微调。</span></li>
<li style="font-weight: 400;" aria-level="1"><a target="_blank" href="https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization/tree/main/skills"><span style="font-weight: 400;">NVIDIA视频搜索与摘要(VSS)技能</span></a><span style="font-weight: 400;">帮助将视频理解转化为可部署的工作流,用于告警、报告、流管理等。</span></li>
</ul>
<p><span style="font-weight: 400;">开发者无需从头重建每个步骤,便可利用这些可重复使用的工作流来生成数据、改进模型并更快地部署视觉AI代理。</span></p>
<h2><strong>视觉检测:生成生产线缺失的数据</strong></h2>
<p><span style="font-weight: 400;">在制造业中,工厂预防缺陷越成功,收集足够缺陷样本来训练下一个检测模型就越困难。</span></p>
<p><a target="_blank" href="https://blog.roboflow.com/synthetic-data-generation-manufacturing-nvidia/"><span style="font-weight: 400;">Roboflow</span></a><span style="font-weight: 400;">正在整合NVIDIA的</span></p>
查看缓存全文
缓存时间: 2026/06/30 17:27
# 走进 Omniverse:利用合成数据与微调提升视觉 AI 智能体准确率的三种工作流
来源:https://blogs.nvidia.com/blog/vision-ai-agent-skills-omniverse-metropolis/
*编者按:本文是**走进 Omniverse* (https://www.nvidia.com/en-us/omniverse/news/)*系列的一部分,该系列聚焦于开发者、3D 从业者以及企业如何借助**OpenUSD* (https://www.nvidia.com/en-us/omniverse/usd/)*和**NVIDIA Omniverse* (https://www.nvidia.com/en-us/omniverse/)*的最新进展,变革自身工作流程。*
视觉 AI 智能体 (https://www.nvidia.com/en-us/use-cases/video-analytics-ai-agents/)正逐渐成为一种实用的方式,能够自动将来自物理世界的视频数据,转化为工厂、城市、仓库和交通系统中的运营情报。
随着越来越多的 AI 工作负载向数据产生的地方靠近,这一转变正在加速。Gartner 预测,到 2028 年,超过三分之二的企业管理数据将在数据中心或云之外创建和处理,并且到 2029 年,全球超过三分之二的企业将部署边缘 AI,而 2025 年这一比例仅为 10% (1)。
但更多的边缘数据并不会自动带来更多的智能。根据同一份 Gartner 报告,高达 90% 的现有边缘数据未被处理。要将这些数据转化为可用的行动,需要视觉 AI 智能体能够理解视频、适应现实世界条件,并将洞察连接到运营工作流程。这些智能体通常运行在摄像头、机器和传感器附近,模型必须满足延迟、功耗、成本和连接性要求,同时适应特定站点的条件。为了构建这些智能体,开发者需要可重复的方法来生成训练数据、微调模型,并在边缘和云端部署代理型视频应用。
NVIDIA Metropolis (https://developer.nvidia.com/metropolis) 智能体技能和蓝图为开发者提供了可重复使用的工作流,以构建、运营和优化整个生命周期的视觉 AI 智能体。
对于这一工作中的模拟和合成数据 (https://www.nvidia.com/en-us/glossary/synthetic-data-generation/) 方面,通用场景描述(OpenUSD)(https://www.nvidia.com/en-us/glossary/openusd/) 提供了一个通用框架,用于描述、组合和复用 3D 世界。基于 OpenUSD,NVIDIA Omniverse (https://www.nvidia.com/en-us/omniverse/) 库帮助团队构建模拟、合成数据生成和数字孪生工作流,这些工作流可以对现实世界环境建模,并扩展在光照、天气、交通模式、摄像头角度、遮挡和罕见事件等条件下的场景覆盖范围。
## **视觉 AI 智能体项目可能卡在哪**
随着组织朝着自主视觉智能体方向发展,通常会遇到三个挑战:
- **因数据缺失导致准确率停滞不前:** 视觉 AI 智能体需要识别罕见的缺陷、异常事件和不断变化的环境。例如,在制造业中,一个检测模型可能对常见的划痕或凹痕表现良好,但对于训练数据中未出现的新型发丝裂纹却很难处理。
- **缺乏微调方面的专业知识:** 团队发现性能差距后,改进模型很少是简单的交接。微调需要带标注的数据集、训练配置、实验跟踪、评估,以及判断是否为目标用例带来了改进。许多构建视觉 AI 智能体的组织没有大型内部机器学习团队来快速管理这一过程,尤其是在多个站点、产品或摄像头视角下。
- **复杂且耗时的智能体组装工作流:** 部署一个视觉 AI 智能体不仅仅是运行推理。开发者必须将视频流水线、AI 模型、元数据、嵌入向量、索引、搜索、告警、报告和系统集成等拼接起来。为特定环境定制这一工作流会显著增加时间,并需要专业知识。如果没有 OpenUSD 的共享场景描述层,团队常常在条件或部署站点变化时从头重建 3D 环境。
## **视觉 AI 智能体的全生命周期方法**
NVIDIA 智能体技能和蓝图——与用于基于 OpenUSD 的模拟和合成数据生成的 NVIDIA Omniverse、用于模型开发和视频 AI 部署的 NVIDIA Metropolis 一起使用——为开发者提供了这些工作流关键部分的可复用起点:
- **缺陷图像生成技能** (https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-defect-image-generation) 帮助创建合成缺陷数据。
- **视频数据增强技能** (https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation) 帮助扩展场景覆盖范围。
- **NVIDIA TAO 技能** (https://github.com/NVIDIA-TAO/tao-skills-bank) 支持模型微调。
- **NVIDIA 视频搜索与摘要 (VSS) 技能** (https://github.com/NVIDIA-AI-Blueprints/video-search-and-summarization/tree/main/skills) 帮助将视频理解转化为可部署的工作流,用于告警、报告、流管理等。
开发者无需从头重写每一步,而是可以使用这些可复用的工作流来更快地生成数据、改进模型并部署视觉 AI 智能体。
## **视觉检测:生成生产线上缺少的数据**
在制造业中,工厂越成功地防止缺陷,就越难收集到足够的缺陷样本来训练下一个检测模型。
Roboflow (https://blog.roboflow.com/synthetic-data-generation-manufacturing-nvidia/) 正在将 NVIDIA 缺陷图像生成技能和 NVIDIA Cosmos 世界基础模型 (https://www.nvidia.com/en-us/ai/cosmos/) 集成到其视觉 AI 平台中,以便在真实训练数据稀缺时为 Corning 等客户生成合成缺陷图像,从而实现近乎完美的检测性能,同时显著减少每日手动图像检查的需求。
在与 Corning 光纤制造工程团队进行的基准测试中,仅用八张真实缺陷图像训练的模型——配合由 NVIDIA 缺陷图像生成技能生成的合成数据进行增强——在最具挑战性的缺陷类别上实现了 95% 的平均精确率和完美的召回率。这一性能超越了仅使用真实数据训练的基线模型,实质上将一个需要多个季度的检测项目压缩到了几天之内。
观看合成数据生成工作流如何帮助开发者创建训练和改进物理 AI 模型所需的数据:
## **智慧城市:从视频分析到自主运营**
大规模城市运营表明,视觉 AI 智能体需要连接的工作流,而不仅仅是推理。Linker Vision (https://www.nvidia.com/en-us/case-studies/linker-vision-ai-smart-city-solutions/) 正在利用 NVIDIA Metropolis VSS 蓝图 (https://build.nvidia.com/nvidia/video-search-and-summarization) 构建智慧城市 AI 系统,以加速在城市基础设施中部署视频推理智能体。在此工作流中,VSS 技能有助于将常见的视频 AI 任务(如搜索、摘要、告警、报告和流管理)打包成可复用的智能体可执行工作流。
基于 OpenUSD 的 NVIDIA Omniverse 数字孪生有助于对城市环境进行建模,并测试视觉 AI 系统如何应对不同的交通模式、天气条件、紧急事件和基础设施变化。Linker Vision 使用 NVIDIA Cosmos 进行视频数据增强 (https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation),并使用 NVIDIA TAO (https://developer.nvidia.com/tao-toolkit) 进行 Cosmos 模型微调。
在高雄,Linker Vision 使用 VSS 蓝图将开发工作量减少了 85%,并将事件响应时间缩短了高达 80%。其较新的 AI-GRID 扩展在此基础上采用了 NVIDIA NemoClaw (https://www.nvidia.com/en-us/ai/nemoclaw/) 蓝图,用于安全的代理型 AI,支持在城市和交通环境中进行自主视频推理。
## **工业运营:对进行中的工作进行推理**
在工业环境中,挑战不仅仅在于检测视频帧中出现的内容。团队需要的智能体能够:
- 理解工作是否按正确的方式执行
- 将执行情况与标准操作程序进行比较
- 在缺陷流向下一环节之前产生洞察
在富士康,DeepHow 的实时标准操作程序 (https://deephow.com/blog/foxconn-boosts-production-throughput-with-deephow-live-sop-verification-powered-by-nvidia)(SOP)验证智能体使用 NVIDIA Metropolis VSS 蓝图作为运营环境中视频搜索、摘要和分析的代理型视频工作流层。NVIDIA Cosmos 提供了推理能力,帮助智能体在上下文中解释复杂的人类活动和工作序列,例如组装步骤是否按正确顺序正确执行。
该解决方案已在 NVIDIA GB300 服务器生产线上使用,将首次通过率提高了 3%,在对关键 SOP 步骤的微动作理解上实现了 99% 的任务级准确率,并通过帮助团队更早发现问题减少了重复工作。
*要了解开发者如何构建和部署视频分析 AI 智能体,请观看此技术演示,了解如何将**NVIDIA VSS 技能与编码智能体**结合使用* (https://www.youtube.com/watch?v=U1D4ZhSHHd0)*。*
*探索 NVIDIA 智能体技能和蓝图,构建、运营和优化**视频分析 AI 智能体* (https://www.nvidia.com/en-us/use-cases/video-analytics-ai-agents/)*。*
*来源:Gartner,Predicts 2026: Physical AI Pushes I&O to the Edge,2026 年 3 月 3 日。**Gartner 是 Gartner, Inc. 和/或其关联公司的商标。*
相似文章
智能体数据
NVIDIA 讨论了开放数据和合成数据对于构建稳健 AI 智能体的重要性,并重点介绍了他们用于训练、推理和工具使用的 Nemotron 开放数据集。
使用LoRA/DoRA微调NVIDIA Cosmos Predict 2.5以生成机器人操作视频
一份完整指南,介绍如何使用LoRA/DoRA微调NVIDIA的Cosmos Predict 2.5世界模型,以生成机器人操作视频,涵盖数据集准备、训练、推理和评估。
介绍 Cosmos 3 Edge
NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。
为微调 API 引入视觉功能
OpenAI 为 GPT-4o 推出视觉微调功能,允许开发者使用图像数据和文本对模型进行定制,以在视觉搜索、物体检测和医学影像分析等视觉任务中提升性能。
生成更好训练数据的智能体(25分钟阅读)
Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。