NVIDIA通过用于自动驾驶汽车、机器人和视觉AI的智能体技能开启物理AI研究新时代

NVIDIA Blog 工具

摘要

NVIDIA在CVPR上宣布了新的物理AI智能体技能,用于加速自动驾驶汽车、机器人和视觉AI的研究,包括神经重建、模拟和强化学习工具。

<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">在CVPR上,NVIDIA推出了新的物理AI智能体技能,这些技能</span><a href="https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/"><span style="font-weight: 400;">帮助研究人员和开发者</span></a><span style="font-weight: 400;">加速开发</span><a target="_blank" href="https://www.nvidia.com/en-us/solutions/autonomous-vehicles/"><span style="font-weight: 400;">自动驾驶汽车</span></a><span style="font-weight: 400;">、</span><a target="_blank" href="https://www.nvidia.com/en-us/industries/robotics/"><span style="font-weight: 400;">机器人</span></a><span style="font-weight: 400;">和</span><a target="_blank" href="https://www.nvidia.com/en-us/autonomous-machines/intelligent-video-analytics-platform/"><span style="font-weight: 400;">视觉AI系统</span></a><span style="font-weight: 400;">。</span></p> <p><span style="font-weight: 400;">物理AI研究的核心挑战不仅仅是开发更强的模型,而是围绕它们构建完整的工作流程——重建真实场景、生成边缘案例、训练策略、评估行为以及快速迭代。目前,这些步骤分散在不同的工具中,研究人员在拼凑这些工具时遇到困难,从而拖慢了实验速度。</span></p> <p><span style="font-weight: 400;">本周早些时候,NVIDIA发布了</span><a target="_blank" href="https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai"><span style="font-weight: 400;">NVIDIA Cosmos 3</span></a><span style="font-weight: 400;">,这是物理AI的开放前沿模型,也是世界上第一个完整的多模态模型,统一了视觉推理、世界生成和动作生成。该世界基础模型在物理AI相关的开放模型公共排行榜上处于领先地位,为物理AI开发提供了核心能力。</span><a target="_blank" href="https://github.com/NVIDIA/skills"><span style="font-weight: 400;">NVIDIA物理AI技能</span></a><span style="font-weight: 400;">与Cosmos、NVIDIA库和模拟框架配合使用,帮助研究人员比以往更快地从模型能力转向可扩展的端到端工作流。</span></p> <h2><b>推动自动驾驶汽车研究超越记录里程</b></h2> <p><span style="font-weight: 400;">对于自动驾驶汽车研究人员而言,问题在于“长尾”驾驶——那些难以重复收集但训练和验证至关重要的罕见交互、异常道路几何、光照变化和边缘案例行为。</span><span style="font-weight: 400;"><br /> </span></p> <div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-93956-3" width="1200" height="675" preload="metadata" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4?_=3" /><a href="https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4">https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4</a></video></div> <p>&nbsp;</p> <p style="text-align: center;"><em><span style="font-weight: 400;">OpenClaw中的神经重建技能演示,展示了从高空虚拟传感器视点重新渲染的视频。</span></em></p> <p><span style="font-weight: 400;">借助NVIDIA自动驾驶汽车技能,研究人员和开发者可以指令AI代理自动化处理场景重建工作流,从车队数据中重建场景并生成合成场景。</span><a target="_blank" href="https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-neural-reconstruction"><span style="font-weight: 400;">神经重建</span></a> <span style="font-weight: 400;">技能帮助AI代理将车队捕获的数据转化为可编辑的3D场景,用于</span><a target="_blank" href="https://www.nvidia.com/en-us/solutions/autonomous-vehicles/simulation/"><span style="font-weight: 400;">模拟</span></a><span style="font-weight: 400;">和合成数据生成,而包括</span><a target="_blank" href="https://developer.nvidia.com/omniverse/nurec"><span style="font-weight: 400;">NVIDIA Omniverse NuRec</span></a><span style="font-weight: 400;">、</span><a target="_blank" href="https://github.com/NVIDIA/instant-nurec"><span style="font-weight: 400;">InstantNuRec</span></a><span style="font-weight: 400;">、</span><a target="_blank" href="http://www.github.com/NVIDIA/harmonizer"><span style="font-weight: 400;">Harmonizer</span></a><span style="font-weight: 400;">和</span><a target="_blank" href="https://research.nvidia.com/labs/sil/projects/higs/"><span style="font-weight: 400;">HiGS加速渲染器</span></a><span style="font-weight: 400;">在内的技术有助于加速重建、提高场景真实感并生成新视角。</span></p> <div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-93956-4" width="1200" height="340" preload="metadata" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4?_=4" /><a href="https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4">https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4</a></video></div> <p>&nbsp;</p> <p style="text-align: center;"><em><span style="font-weight: 400;">InstantNuRec无需逐场景优化,即可从图像中快速实现3D高斯道路场景重建。</span></em></p> <p><span style="font-weight: 400;">对于自动驾驶汽车研究人员来说,可重复的模拟有助于改变条件、比较系统响应并发现故障模式,覆盖范围超越真实世界数据所能捕获的场景。</span></p> <p><a target="_blank" href="https://huggingface.co/blog/drmapavone/nvidia-alpamayo-2"><span style="font-weight: 400;">NVIDIA AlpaGym</span></a><span style="font-weight: 400;">是一个开源闭环强化学习框架,它通过将策略回滚和高保真模拟与智能体技能相结合,扩展到数千个GPU上,帮助研究人员快速进入设置、回滚和评估环节。</span><a target="_blank" href="https://huggingface.co/nvidia/omni-dreams-models"><span style="font-weight: 400;">NVIDIA OmniDreams</span></a><span style="font-weight: 400;">是一个动作条件生成世界模型,它在模拟循环中增加了照片级渲染,实时生成直接响应策略动作的相机帧。</span></p> <p><span style="font-weight: 400;">NVIDIA还通过其迄今为止最强大的开放驾驶基础模型——</span><a target="_blank" href="https://nvidianews.nvidia.com/news/nvidia-alpamayo-2-super-robotaxis"><span style="font-weight: 400;">NVIDIA Alpamayo 2 Super</span></a><span style="font-weight: 400;">,推动自动驾驶汽车研究。这是一个拥有320亿参数的开源推理视觉语言动作模型,能够在整个驾驶堆栈中进行推理、规划和行动,以实现更安全、可扩展的L4级开发和部署。</span></p> <h2><b>推动面向真实世界的视觉AI系统</b></h2> <p><span style="font-weight: 400;">对于视觉AI研究来说,瓶颈在于创建足够多的受控示例,以研究模型在视觉条件、物体状态或时间事件变化时的行为。零样本异常检测、合成异常生成和少样本缺陷识别等工作都遇到了同样的数据壁垒。</span></p> <div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-93956-5" width="1200" height="675" preload="metadata" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/06/Delta-Defect-Image-Generation.mp4" /></video></div>
查看原文
查看缓存全文

缓存时间: 2026/06/03 15:38

# NVIDIA推动物理AI研究进入新时代:为自动驾驶、机器人和视觉AI推出Agent技能 来源:https://blogs.nvidia.com/blog/cvpr-physical-ai-research-agent-skills/ 在CVPR大会上,NVIDIA推出全新的物理AI agent技能,帮助研究人员和开发者(https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/)加速自动驾驶(https://www.nvidia.com/en-us/solutions/autonomous-vehicles/)、机器人(https://www.nvidia.com/en-us/industries/robotics/)和视觉AI系统(https://www.nvidia.com/en-us/autonomous-machines/intelligent-video-analytics-platform/)的开发。 物理AI(https://www.nvidia.com/en-us/glossary/generative-physical-ai/)研究的核心挑战不仅仅是开发更强大的模型。而在于围绕它们构建完整的工作流——重建真实世界场景、生成边缘案例场景、训练策略、评估行为以及快速迭代。目前,这些步骤分散在不同的工具中,研究人员费力地将其拼凑起来,拖慢了实验速度。 本周早些时候,NVIDIA发布了NVIDIA Cosmos 3(https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai),这是物理AI的开放前沿模型,也是世界上第一个统一了视觉推理、世界生成和动作生成的全能与多模型。这款世界基础模型在物理AI核心的公开模型排行榜上均处于领先地位,为物理AI开发提供了核心能力。NVIDIA物理AI技能(https://github.com/NVIDIA/skills)与Cosmos、NVIDIA库和模拟框架相结合,帮助研究人员比以往更快地从模型能力转向可扩展的端到端工作流。 ## **推进自动驾驶研究:超越已录制的行驶里程** 对于自动驾驶(AV)研究人员而言,问题在于驾驶的“长尾”——罕见的交互、不寻常的道路几何形状、光照变化以及边缘案例行为。这些情况难以重复采集,但对于训练和验证至关重要。 https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4 *OpenClaw中的神经重建技能演示,展示从升高的虚拟传感器视角重新渲染的视频。* 借助NVIDIA自动驾驶技能,研究人员和开发者可以指示AI agent来自动化从车队数据中进行场景重建和生成合成场景的工作流。神经重建(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-neural-reconstruction)技能帮助AI agent将车队捕获的数据转换为可编辑的3D场景,用于模拟(https://www.nvidia.com/en-us/solutions/autonomous-vehicles/simulation/)和合成数据生成,而包括NVIDIA Omniverse NuRec(https://developer.nvidia.com/omniverse/nurec)、InstantNuRec(https://github.com/NVIDIA/instant-nurec)、Harmonizer(http://www.github.com/NVIDIA/harmonizer)和HiGS加速渲染器(https://research.nvidia.com/labs/sil/projects/higs/)在内的技术有助于加速重建、提高场景真实感并生成新视角。 https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4 *InstantNuRec能够从图像中快速重建3D高斯道路场景,无需针对每个场景进行优化。* 对于AV研究人员而言,可重复的模拟有助于改变条件、比较系统响应并发现故障模式,覆盖范围超过真实世界数据所能捕获的场景。 NVIDIA AlpaGym(https://huggingface.co/blog/drmapavone/nvidia-alpamayo-2),一个开源的闭环强化学习框架,通过将策略部署和高保真模拟与agent技能连接起来,扩展到数千个GPU,帮助研究人员完成设置、部署和评估。NVIDIA OmniDreams(https://huggingface.co/nvidia/omni-dreams-models),一个基于动作条件的生成式世界模型,为模拟循环增加了照片级渲染,生成直接实时响应策略动作的相机帧。 NVIDIA还在推进AV研究,推出了迄今为止最强大的开放驾驶基础模型:NVIDIA Alpamayo 2 Super(https://nvidianews.nvidia.com/news/nvidia-alpamayo-2-super-robotaxis),这是一个开放的320亿参数推理视觉语言动作(VLA)模型,能够在整个驾驶堆栈中进行推理、规划和行动,以实现更安全、可扩展的L4级开发和部署。 ## **推进面向真实世界的视觉AI系统** 对于视觉AI研究,瓶颈在于创建足够多的受控示例,以研究模型在视觉条件、对象状态或时间事件发生变化时的表现。零样本异常检测、合成异常生成和少样本缺陷识别等工作都遇到了相同的数据壁垒。 https://blogs.nvidia.com/wp-content/uploads/2026/06/Delta-Defect-Image-Generation.mp4 *用于视觉检测的新技能可在不同表面上生成多种罕见缺陷。* 新的NVIDIA Metropolis技能(https://developer.nvidia.com/metropolis)帮助研究人员和开发者使用AI agent生成合成视觉场景(包括异常)、增强数据并支持伪标签。这些技能受益于Cosmos 3的混合Transformer架构,该架构使用一个推理Transformer来分析观察结果,并将指令馈送到生成塔,从而帮助扩展具有物理真实感的虚拟世界。 构建高精度视觉检测模型的研究人员可以使用缺陷图像生成技能(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-defect-image-generation),利用真实图像创建不同表面上不同缺陷的示例。该工作流程结合了NVIDIA Isaac Sim进行模拟、Cosmos 3进行编排以及视觉语言推理,让研究人员能够创建罕见的视觉案例,并评估模型是否正确响应。 https://blogs.nvidia.com/wp-content/uploads/2026/06/VSS3_Demo.mp4 *新的NVIDIA Metropolis VSS蓝图技能可从海量视频数据中提取洞察。* 对于视频AI agent,NVIDIA视频搜索与摘要(VSS)蓝图(https://build.nvidia.com/nvidia/video-search-and-summarization)、NVIDIA TAO(https://developer.nvidia.com/tao-toolkit)和视频增强技能(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation)帮助从海量视频数据中提取洞察、微调模型,并自动化构建与评估循环。这为研究人员提供了一种更可重复的方式来开发能够检测事件、推理复杂场景、总结活动并发送警报的视觉推理AI agent。 ## **通过Agent就绪的模拟工作流扩展机器人学习** 教授机器人导航或操作等技能归结为迭代。对于研究人员而言,瓶颈在于构建足够多的受控环境和策略部署,以理解机器人行为在不同任务、设置和本体上的变化——这项工作通常需要手动拼接模拟环境、任务变体、策略训练和评估。 https://blogs.nvidia.com/wp-content/uploads/2026/06/Isaac-Sim.mp4 *NVIDIA Isaac Sim 6.0包含agent友好型技能和连接器,有助于自动化工作流。* 借助NVIDIA机器人技能,研究人员可以利用NVIDIA Omniverse库(https://developer.nvidia.com/omniverse)、Isaac Sim(https://developer.nvidia.com/isaac/sim)和Isaac Lab(https://developer.nvidia.com/isaac/lab)框架,指示AI agent自动化场景准备、模拟和机器人学习中的大多数常见开发步骤。Agent可以帮助启动模拟会话、编写场景、控制模拟、捕获数据并在Isaac Sim中验证环境,而Isaac Lab技能支持强化学习设置、训练、评估和自定义环境开发。 https://blogs.nvidia.com/wp-content/uploads/2026/06/COMPASS-grid.mp4 *新的NVIDIA Isaac移动性技能可自动化导航工作流。* 专门的技能将这一工作流扩展到移动性和操作。Isaac移动性技能(https://github.com/NVlabs/COMPASS)支持跨越场景搜索、USD转换、环境注册、残差强化学习和策略评估的导航工作流,而专门的Isaac Lab agent工作流则有助于完成同模拟到模拟、以及同模拟到真实的任务,例如环境构建、物理调整、调试和分析。 对于医疗机器人,Cosmos-H-Surgical-Simulator(https://huggingface.co/nvidia/Cosmos-H-Surgical-Simulator)通过生成逼真的手术机器人数据用于策略训练和评估,从而推进研究。通过直接从真实手术数据(而非手工设计的物理模型)学习,它有助于缩小模拟到真实的差距,支持自主手术任务的开发。 Cosmos 3还可以帮助生成合成数据和场景变体,然后支持基于特定本体的行为和环境数据进行后训练,涵盖从拾取放置到灵巧操作等任务。 ## **NVIDIA研究在CVPR** NVIDIA技术——包括GPU、开放模型、模拟框架和CUDA加速库——在大多数被CVPR 2026接受的论文中均被引用,并被全球领先的研究实验室和机构采用,其中包括卡内基梅隆大学、斯坦福大学、加州大学伯克利分校、清华大学和北京大学。 NVIDIA研究人员正在CVPR(https://www.nvidia.com/en-us/events/cvpr/)(6月3日至7日在丹佛举办)上展示其在计算机视觉、物理AI、自动驾驶系统、神经渲染、生成式AI和机器人领域的工作。 NVIDIA在CVPR的亮相还包括多个开放式研究挑战,用于基准测试物理AI的进展: - AI城市挑战赛(https://www.aicitychallenge.org/),一项面向智慧城市应用的顶级计算机视觉竞赛,今年已进入第十个年头。 - PAI-AV推理挑战赛(https://huggingface.co/spaces/nvidia/PhysicalAI-AV-OOD-Reasoning-Challenge-2026),一项新的开放基准,评估VLA模型使用因果链标签解释驾驶决策的能力。 - AlpaSim闭环端到端驾驶挑战赛(https://huggingface.co/spaces/nvidia/AlpasimE2EClosedLoopChallenge2026),一项新的开放基准,在基于真实世界重建场景的闭环模拟中测试自动驾驶策略。 https://blogs.nvidia.com/wp-content/uploads/2026/06/RoboSim-Grid.mp4 *作为Cosmos 3数据集发布的一部分,来自新机器人模拟数据集的示例视频网格。* NVIDIA还在通过面向训练、微调和评估的数据集来扩展物理AI的研究基础设施。NVIDIA物理AI数据集(https://huggingface.co/collections/nvidia/physical-ai)在Hugging Face上的下载量已超过1500万次,而NVIDIA Isaac GR00T X Embodiment Sim(https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim)已成为下载量最大的机器人数据集之一。新发布的数据集包括GRAIL(https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-Locomanipulation-GRAIL),包含约50小时的人形物体交互数据,以及用于训练Cosmos 3的六个合成视频数据集,涵盖机器人(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Embodied-Robot-Scenes)、物理(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Physical-Interaction-Scenes)、数字人(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Digital-Human-Scenes)、自动驾驶(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Autonomous-Driving-Scenarios)、仓库安全(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Warehouse-Operations-Scenes)和空间推理(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Spatial-Reasoning)等领域。 ## **可用性** NVIDIA物理AI agent工具和技能现已通过GitHub(https://github.com/NVIDIA/skills)开放获取。 用于合成数据生成的agent技能和工具——神经重建(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-neural-reconstruction)、视频增强(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation)、缺陷图像生成(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-defect-image-generation)——也可在NVIDIA Brev上以物理AI可启动项(https://brev.nvidia.com/physical-ai)的形式即时试用,这是一种预配置环境,捆绑了agent技能和工具,用于更快的合成数据生成和评估。可启动项在托管的NVIDIA H100 Tensor Core GPU上运行,并为研究人员提供免费试用积分。 *了解更多关于**CVPR上的NVIDIA**(https://www.nvidia.com/en-us/events/cvpr/),并探索**NVIDIA Research**(https://research.nvidia.com/)在物理AI、计算机视觉和自动驾驶系统方面的工作。开始使用**Isaac GR00T和NVIDIA机器人工具**(https://developer.nvidia.com/isaac)。*

相似文章

National Robotics Week — 最新物理AI研究、突破与资源

NVIDIA Blog

National Robotics Week 期间,NVIDIA 重点展示了其在物理AI和机器人领域的突破,宣布了多项新技术,包括用于自然语言指令理解的NVIDIA Isaac GR00T开源模型、用于合成数据生成的Cosmos世界模型、Newton 1.0物理引擎,以及借助Isaac Sim 6.0和Isaac Lab 3.0扩展的仿真能力,从而加速机器人从训练到现实部署的开发进程。