NVIDIA通过用于自动驾驶汽车、机器人和视觉AI的智能体技能开启物理AI研究新时代
摘要
NVIDIA在CVPR上宣布了新的物理AI智能体技能,用于加速自动驾驶汽车、机器人和视觉AI的研究,包括神经重建、模拟和强化学习工具。
<div id="bsf_rt_marker"></div><p><span style="font-weight: 400;">在CVPR上,NVIDIA推出了新的物理AI智能体技能,这些技能</span><a href="https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/"><span style="font-weight: 400;">帮助研究人员和开发者</span></a><span style="font-weight: 400;">加速开发</span><a target="_blank" href="https://www.nvidia.com/en-us/solutions/autonomous-vehicles/"><span style="font-weight: 400;">自动驾驶汽车</span></a><span style="font-weight: 400;">、</span><a target="_blank" href="https://www.nvidia.com/en-us/industries/robotics/"><span style="font-weight: 400;">机器人</span></a><span style="font-weight: 400;">和</span><a target="_blank" href="https://www.nvidia.com/en-us/autonomous-machines/intelligent-video-analytics-platform/"><span style="font-weight: 400;">视觉AI系统</span></a><span style="font-weight: 400;">。</span></p>
<p><span style="font-weight: 400;">物理AI研究的核心挑战不仅仅是开发更强的模型,而是围绕它们构建完整的工作流程——重建真实场景、生成边缘案例、训练策略、评估行为以及快速迭代。目前,这些步骤分散在不同的工具中,研究人员在拼凑这些工具时遇到困难,从而拖慢了实验速度。</span></p>
<p><span style="font-weight: 400;">本周早些时候,NVIDIA发布了</span><a target="_blank" href="https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai"><span style="font-weight: 400;">NVIDIA Cosmos 3</span></a><span style="font-weight: 400;">,这是物理AI的开放前沿模型,也是世界上第一个完整的多模态模型,统一了视觉推理、世界生成和动作生成。该世界基础模型在物理AI相关的开放模型公共排行榜上处于领先地位,为物理AI开发提供了核心能力。</span><a target="_blank" href="https://github.com/NVIDIA/skills"><span style="font-weight: 400;">NVIDIA物理AI技能</span></a><span style="font-weight: 400;">与Cosmos、NVIDIA库和模拟框架配合使用,帮助研究人员比以往更快地从模型能力转向可扩展的端到端工作流。</span></p>
<h2><b>推动自动驾驶汽车研究超越记录里程</b></h2>
<p><span style="font-weight: 400;">对于自动驾驶汽车研究人员而言,问题在于“长尾”驾驶——那些难以重复收集但训练和验证至关重要的罕见交互、异常道路几何、光照变化和边缘案例行为。</span><span style="font-weight: 400;"><br />
</span></p>
<div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-93956-3" width="1200" height="675" preload="metadata" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4?_=3" /><a href="https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4">https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4</a></video></div>
<p> </p>
<p style="text-align: center;"><em><span style="font-weight: 400;">OpenClaw中的神经重建技能演示,展示了从高空虚拟传感器视点重新渲染的视频。</span></em></p>
<p><span style="font-weight: 400;">借助NVIDIA自动驾驶汽车技能,研究人员和开发者可以指令AI代理自动化处理场景重建工作流,从车队数据中重建场景并生成合成场景。</span><a target="_blank" href="https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-neural-reconstruction"><span style="font-weight: 400;">神经重建</span></a> <span style="font-weight: 400;">技能帮助AI代理将车队捕获的数据转化为可编辑的3D场景,用于</span><a target="_blank" href="https://www.nvidia.com/en-us/solutions/autonomous-vehicles/simulation/"><span style="font-weight: 400;">模拟</span></a><span style="font-weight: 400;">和合成数据生成,而包括</span><a target="_blank" href="https://developer.nvidia.com/omniverse/nurec"><span style="font-weight: 400;">NVIDIA Omniverse NuRec</span></a><span style="font-weight: 400;">、</span><a target="_blank" href="https://github.com/NVIDIA/instant-nurec"><span style="font-weight: 400;">InstantNuRec</span></a><span style="font-weight: 400;">、</span><a target="_blank" href="http://www.github.com/NVIDIA/harmonizer"><span style="font-weight: 400;">Harmonizer</span></a><span style="font-weight: 400;">和</span><a target="_blank" href="https://research.nvidia.com/labs/sil/projects/higs/"><span style="font-weight: 400;">HiGS加速渲染器</span></a><span style="font-weight: 400;">在内的技术有助于加速重建、提高场景真实感并生成新视角。</span></p>
<div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-93956-4" width="1200" height="340" preload="metadata" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4?_=4" /><a href="https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4">https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4</a></video></div>
<p> </p>
<p style="text-align: center;"><em><span style="font-weight: 400;">InstantNuRec无需逐场景优化,即可从图像中快速实现3D高斯道路场景重建。</span></em></p>
<p><span style="font-weight: 400;">对于自动驾驶汽车研究人员来说,可重复的模拟有助于改变条件、比较系统响应并发现故障模式,覆盖范围超越真实世界数据所能捕获的场景。</span></p>
<p><a target="_blank" href="https://huggingface.co/blog/drmapavone/nvidia-alpamayo-2"><span style="font-weight: 400;">NVIDIA AlpaGym</span></a><span style="font-weight: 400;">是一个开源闭环强化学习框架,它通过将策略回滚和高保真模拟与智能体技能相结合,扩展到数千个GPU上,帮助研究人员快速进入设置、回滚和评估环节。</span><a target="_blank" href="https://huggingface.co/nvidia/omni-dreams-models"><span style="font-weight: 400;">NVIDIA OmniDreams</span></a><span style="font-weight: 400;">是一个动作条件生成世界模型,它在模拟循环中增加了照片级渲染,实时生成直接响应策略动作的相机帧。</span></p>
<p><span style="font-weight: 400;">NVIDIA还通过其迄今为止最强大的开放驾驶基础模型——</span><a target="_blank" href="https://nvidianews.nvidia.com/news/nvidia-alpamayo-2-super-robotaxis"><span style="font-weight: 400;">NVIDIA Alpamayo 2 Super</span></a><span style="font-weight: 400;">,推动自动驾驶汽车研究。这是一个拥有320亿参数的开源推理视觉语言动作模型,能够在整个驾驶堆栈中进行推理、规划和行动,以实现更安全、可扩展的L4级开发和部署。</span></p>
<h2><b>推动面向真实世界的视觉AI系统</b></h2>
<p><span style="font-weight: 400;">对于视觉AI研究来说,瓶颈在于创建足够多的受控示例,以研究模型在视觉条件、物体状态或时间事件变化时的行为。零样本异常检测、合成异常生成和少样本缺陷识别等工作都遇到了同样的数据壁垒。</span></p>
<div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-93956-5" width="1200" height="675" preload="metadata" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/06/Delta-Defect-Image-Generation.mp4" /></video></div>
查看缓存全文
缓存时间:
2026/06/03 15:38
# NVIDIA推动物理AI研究进入新时代:为自动驾驶、机器人和视觉AI推出Agent技能
来源:https://blogs.nvidia.com/blog/cvpr-physical-ai-research-agent-skills/
在CVPR大会上,NVIDIA推出全新的物理AI agent技能,帮助研究人员和开发者(https://blogs.nvidia.com/blog/cvpr-research-grasping-driving-agent-training/)加速自动驾驶(https://www.nvidia.com/en-us/solutions/autonomous-vehicles/)、机器人(https://www.nvidia.com/en-us/industries/robotics/)和视觉AI系统(https://www.nvidia.com/en-us/autonomous-machines/intelligent-video-analytics-platform/)的开发。
物理AI(https://www.nvidia.com/en-us/glossary/generative-physical-ai/)研究的核心挑战不仅仅是开发更强大的模型。而在于围绕它们构建完整的工作流——重建真实世界场景、生成边缘案例场景、训练策略、评估行为以及快速迭代。目前,这些步骤分散在不同的工具中,研究人员费力地将其拼凑起来,拖慢了实验速度。
本周早些时候,NVIDIA发布了NVIDIA Cosmos 3(https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai),这是物理AI的开放前沿模型,也是世界上第一个统一了视觉推理、世界生成和动作生成的全能与多模型。这款世界基础模型在物理AI核心的公开模型排行榜上均处于领先地位,为物理AI开发提供了核心能力。NVIDIA物理AI技能(https://github.com/NVIDIA/skills)与Cosmos、NVIDIA库和模拟框架相结合,帮助研究人员比以往更快地从模型能力转向可扩展的端到端工作流。
## **推进自动驾驶研究:超越已录制的行驶里程**
对于自动驾驶(AV)研究人员而言,问题在于驾驶的“长尾”——罕见的交互、不寻常的道路几何形状、光照变化以及边缘案例行为。这些情况难以重复采集,但对于训练和验证至关重要。
https://blogs.nvidia.com/wp-content/uploads/2026/06/NeuralReconstructionDemo.mp4
*OpenClaw中的神经重建技能演示,展示从升高的虚拟传感器视角重新渲染的视频。*
借助NVIDIA自动驾驶技能,研究人员和开发者可以指示AI agent来自动化从车队数据中进行场景重建和生成合成场景的工作流。神经重建(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-neural-reconstruction)技能帮助AI agent将车队捕获的数据转换为可编辑的3D场景,用于模拟(https://www.nvidia.com/en-us/solutions/autonomous-vehicles/simulation/)和合成数据生成,而包括NVIDIA Omniverse NuRec(https://developer.nvidia.com/omniverse/nurec)、InstantNuRec(https://github.com/NVIDIA/instant-nurec)、Harmonizer(http://www.github.com/NVIDIA/harmonizer)和HiGS加速渲染器(https://research.nvidia.com/labs/sil/projects/higs/)在内的技术有助于加速重建、提高场景真实感并生成新视角。
https://blogs.nvidia.com/wp-content/uploads/2026/06/InstantNuRec.mp4
*InstantNuRec能够从图像中快速重建3D高斯道路场景,无需针对每个场景进行优化。*
对于AV研究人员而言,可重复的模拟有助于改变条件、比较系统响应并发现故障模式,覆盖范围超过真实世界数据所能捕获的场景。
NVIDIA AlpaGym(https://huggingface.co/blog/drmapavone/nvidia-alpamayo-2),一个开源的闭环强化学习框架,通过将策略部署和高保真模拟与agent技能连接起来,扩展到数千个GPU,帮助研究人员完成设置、部署和评估。NVIDIA OmniDreams(https://huggingface.co/nvidia/omni-dreams-models),一个基于动作条件的生成式世界模型,为模拟循环增加了照片级渲染,生成直接实时响应策略动作的相机帧。
NVIDIA还在推进AV研究,推出了迄今为止最强大的开放驾驶基础模型:NVIDIA Alpamayo 2 Super(https://nvidianews.nvidia.com/news/nvidia-alpamayo-2-super-robotaxis),这是一个开放的320亿参数推理视觉语言动作(VLA)模型,能够在整个驾驶堆栈中进行推理、规划和行动,以实现更安全、可扩展的L4级开发和部署。
## **推进面向真实世界的视觉AI系统**
对于视觉AI研究,瓶颈在于创建足够多的受控示例,以研究模型在视觉条件、对象状态或时间事件发生变化时的表现。零样本异常检测、合成异常生成和少样本缺陷识别等工作都遇到了相同的数据壁垒。
https://blogs.nvidia.com/wp-content/uploads/2026/06/Delta-Defect-Image-Generation.mp4
*用于视觉检测的新技能可在不同表面上生成多种罕见缺陷。*
新的NVIDIA Metropolis技能(https://developer.nvidia.com/metropolis)帮助研究人员和开发者使用AI agent生成合成视觉场景(包括异常)、增强数据并支持伪标签。这些技能受益于Cosmos 3的混合Transformer架构,该架构使用一个推理Transformer来分析观察结果,并将指令馈送到生成塔,从而帮助扩展具有物理真实感的虚拟世界。
构建高精度视觉检测模型的研究人员可以使用缺陷图像生成技能(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-defect-image-generation),利用真实图像创建不同表面上不同缺陷的示例。该工作流程结合了NVIDIA Isaac Sim进行模拟、Cosmos 3进行编排以及视觉语言推理,让研究人员能够创建罕见的视觉案例,并评估模型是否正确响应。
https://blogs.nvidia.com/wp-content/uploads/2026/06/VSS3_Demo.mp4
*新的NVIDIA Metropolis VSS蓝图技能可从海量视频数据中提取洞察。*
对于视频AI agent,NVIDIA视频搜索与摘要(VSS)蓝图(https://build.nvidia.com/nvidia/video-search-and-summarization)、NVIDIA TAO(https://developer.nvidia.com/tao-toolkit)和视频增强技能(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation)帮助从海量视频数据中提取洞察、微调模型,并自动化构建与评估循环。这为研究人员提供了一种更可重复的方式来开发能够检测事件、推理复杂场景、总结活动并发送警报的视觉推理AI agent。
## **通过Agent就绪的模拟工作流扩展机器人学习**
教授机器人导航或操作等技能归结为迭代。对于研究人员而言,瓶颈在于构建足够多的受控环境和策略部署,以理解机器人行为在不同任务、设置和本体上的变化——这项工作通常需要手动拼接模拟环境、任务变体、策略训练和评估。
https://blogs.nvidia.com/wp-content/uploads/2026/06/Isaac-Sim.mp4
*NVIDIA Isaac Sim 6.0包含agent友好型技能和连接器,有助于自动化工作流。*
借助NVIDIA机器人技能,研究人员可以利用NVIDIA Omniverse库(https://developer.nvidia.com/omniverse)、Isaac Sim(https://developer.nvidia.com/isaac/sim)和Isaac Lab(https://developer.nvidia.com/isaac/lab)框架,指示AI agent自动化场景准备、模拟和机器人学习中的大多数常见开发步骤。Agent可以帮助启动模拟会话、编写场景、控制模拟、捕获数据并在Isaac Sim中验证环境,而Isaac Lab技能支持强化学习设置、训练、评估和自定义环境开发。
https://blogs.nvidia.com/wp-content/uploads/2026/06/COMPASS-grid.mp4
*新的NVIDIA Isaac移动性技能可自动化导航工作流。*
专门的技能将这一工作流扩展到移动性和操作。Isaac移动性技能(https://github.com/NVlabs/COMPASS)支持跨越场景搜索、USD转换、环境注册、残差强化学习和策略评估的导航工作流,而专门的Isaac Lab agent工作流则有助于完成同模拟到模拟、以及同模拟到真实的任务,例如环境构建、物理调整、调试和分析。
对于医疗机器人,Cosmos-H-Surgical-Simulator(https://huggingface.co/nvidia/Cosmos-H-Surgical-Simulator)通过生成逼真的手术机器人数据用于策略训练和评估,从而推进研究。通过直接从真实手术数据(而非手工设计的物理模型)学习,它有助于缩小模拟到真实的差距,支持自主手术任务的开发。
Cosmos 3还可以帮助生成合成数据和场景变体,然后支持基于特定本体的行为和环境数据进行后训练,涵盖从拾取放置到灵巧操作等任务。
## **NVIDIA研究在CVPR**
NVIDIA技术——包括GPU、开放模型、模拟框架和CUDA加速库——在大多数被CVPR 2026接受的论文中均被引用,并被全球领先的研究实验室和机构采用,其中包括卡内基梅隆大学、斯坦福大学、加州大学伯克利分校、清华大学和北京大学。
NVIDIA研究人员正在CVPR(https://www.nvidia.com/en-us/events/cvpr/)(6月3日至7日在丹佛举办)上展示其在计算机视觉、物理AI、自动驾驶系统、神经渲染、生成式AI和机器人领域的工作。
NVIDIA在CVPR的亮相还包括多个开放式研究挑战,用于基准测试物理AI的进展:
- AI城市挑战赛(https://www.aicitychallenge.org/),一项面向智慧城市应用的顶级计算机视觉竞赛,今年已进入第十个年头。
- PAI-AV推理挑战赛(https://huggingface.co/spaces/nvidia/PhysicalAI-AV-OOD-Reasoning-Challenge-2026),一项新的开放基准,评估VLA模型使用因果链标签解释驾驶决策的能力。
- AlpaSim闭环端到端驾驶挑战赛(https://huggingface.co/spaces/nvidia/AlpasimE2EClosedLoopChallenge2026),一项新的开放基准,在基于真实世界重建场景的闭环模拟中测试自动驾驶策略。
https://blogs.nvidia.com/wp-content/uploads/2026/06/RoboSim-Grid.mp4
*作为Cosmos 3数据集发布的一部分,来自新机器人模拟数据集的示例视频网格。*
NVIDIA还在通过面向训练、微调和评估的数据集来扩展物理AI的研究基础设施。NVIDIA物理AI数据集(https://huggingface.co/collections/nvidia/physical-ai)在Hugging Face上的下载量已超过1500万次,而NVIDIA Isaac GR00T X Embodiment Sim(https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim)已成为下载量最大的机器人数据集之一。新发布的数据集包括GRAIL(https://huggingface.co/datasets/nvidia/PhysicalAI-Robotics-Locomanipulation-GRAIL),包含约50小时的人形物体交互数据,以及用于训练Cosmos 3的六个合成视频数据集,涵盖机器人(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Embodied-Robot-Scenes)、物理(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Physical-Interaction-Scenes)、数字人(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Digital-Human-Scenes)、自动驾驶(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Autonomous-Driving-Scenarios)、仓库安全(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Warehouse-Operations-Scenes)和空间推理(https://huggingface.co/datasets/nvidia/PhysicalAI-WorldModel-Synthetic-Spatial-Reasoning)等领域。
## **可用性**
NVIDIA物理AI agent工具和技能现已通过GitHub(https://github.com/NVIDIA/skills)开放获取。
用于合成数据生成的agent技能和工具——神经重建(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-neural-reconstruction)、视频增强(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-video-data-augmentation)、缺陷图像生成(https://github.com/NVIDIA/skills/tree/main/skills/physical-ai-defect-image-generation)——也可在NVIDIA Brev上以物理AI可启动项(https://brev.nvidia.com/physical-ai)的形式即时试用,这是一种预配置环境,捆绑了agent技能和工具,用于更快的合成数据生成和评估。可启动项在托管的NVIDIA H100 Tensor Core GPU上运行,并为研究人员提供免费试用积分。
*了解更多关于**CVPR上的NVIDIA**(https://www.nvidia.com/en-us/events/cvpr/),并探索**NVIDIA Research**(https://research.nvidia.com/)在物理AI、计算机视觉和自动驾驶系统方面的工作。开始使用**Isaac GR00T和NVIDIA机器人工具**(https://developer.nvidia.com/isaac)。*
相似文章
X AI KOLs Timeline
NVIDIA 正式发布了一套用于 AI 代理的技能集,涵盖视频分析、语音代理、LLM 训练、模型加速、RAG、安全环境、物流优化和 CUDA 编程。
NVIDIA Blog
NVIDIA研究在CVPR上展示三篇论文:GraspGen-X(零样本抓取基础模型)、LCDrive(高效自动驾驶推理)和NitroGen(通用游戏AI基础模型),强调物理AI系统的大规模训练。
NVIDIA Blog
在SIGGRAPH 2026上,NVIDIA发布了一系列图形和AI领域的进展,包括面向创意工具的Model Context Protocol集成、Cosmos 3 Edge开放世界模型、合成视频检测器NIM微服务以及基于DGX Station的NemoClaw,突显了代理式AI和物理AI。
NVIDIA Blog
NVIDIA 与 Google Cloud 宣布深化合作,以推进智能体 AI 和物理 AI 的发展,推出了由 NVIDIA Vera Rubin 驱动的全新 A5X 实例,并将 Gemini 企业智能体平台与 NVIDIA NeMo 集成。
NVIDIA Blog
National Robotics Week 期间,NVIDIA 重点展示了其在物理AI和机器人领域的突破,宣布了多项新技术,包括用于自然语言指令理解的NVIDIA Isaac GR00T开源模型、用于合成数据生成的Cosmos世界模型、Newton 1.0物理引擎,以及借助Isaac Sim 6.0和Isaac Lab 3.0扩展的仿真能力,从而加速机器人从训练到现实部署的开发进程。