深入 Omniverse:开放世界模型如何推动物理 AI 的前沿
摘要
NVIDIA 强调了开放世界模型对物理 AI 的重要性,介绍了 NVIDIA Cosmos 3 开放模型系列以及用于仿真和模型定制的 Omniverse 库。
<div id="bsf_rt_marker"></div><p><em>编者按:本文是 </em><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/news/"><em>深入 Omniverse</em></a><em> 系列文章之一,该系列聚焦开发者、3D 从业者与企业如何利用 </em><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/usd/"><em>OpenUSD</em></a><em> 和 </em><a target="_blank" href="https://www.nvidia.com/en-us/omniverse/"><em>NVIDIA Omniverse</em></a><em> 的最新进展来变革工作流程。</em></p>
<!-- /wp:post-content -->
<!-- wp:paragraph -->
<p>7 月,NVIDIA 与超过 200 家公司和组织共同签署了“<a target="_blank" href="https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf">开放权重与美国 AI 领导力</a>”公开信,信中提出,AI 领导力的衡量标准不是某一个前沿模型,而是开放生态系统是否触及每个行业。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p><a target="_blank" href="https://www.nvidia.com/en-us/glossary/open-models/">开放模型</a>让这一切成为可能——任何人都可以下载、检查、修改并在自己的基础设施上运行这些模型。这一点在<a target="_blank" href="https://www.nvidia.com/en-us/glossary/generative-physical-ai/">物理 AI</a> 领域尤为关键,因为每一次部署都是一个定制化问题。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>物理 AI 必须理解并预测后果,而不仅仅是外观。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>为了实现这一点,<a target="_blank" href="https://www.nvidia.com/en-us/glossary/world-models/">世界模型</a>学习物理环境的行为方式、接下来可能发生什么以及哪些后续动作是合理的。它们可以生成基于物理的世界与动作数据、模拟未来状态,并为团队提供可针对机器人、自动驾驶汽车或视觉 AI 系统进行定制的基础。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>开放世界模型已被用于生成训练数据、测试策略以及定制物理 AI 系统。<a target="_blank" href="https://www.nvidia.com/en-us/ai/cosmos/">NVIDIA Cosmos 3</a> 将这些能力整合到一个开放模型系列中,在机器人、自动驾驶汽车和视觉 AI 领域取得了领先的基准测试结果并获得广泛应用。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>此外,作为 NVIDIA Agent Toolkit 一部分的 <a target="_blank" href="https://www.nvidia.com/en-us/omniverse/">NVIDIA Omniverse</a> 库提供了用于构建可仿真世界的预置能力,物理 AI 团队可以在实际部署前使用这些能力来训练、测试和验证系统。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p><iframe title="Bringing Agent-Ready Simulation Into Blender" width="1200" height="675" src="https://www.youtube.com/embed/XdtQbMXHDjQ?feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe></p>
<!-- /wp:paragraph -->
<!-- wp:heading {"level":2} -->
<h2 class="wp-block-heading"><strong><strong>世界模型是物理 AI 的基础</strong></strong></h2>
<!-- /wp:heading -->
<!-- wp:paragraph -->
<p>物理 AI 所需的数据在所需规模下难以采集且成本高昂。罕见事件和长尾场景尤其难以安全、可重复地复现。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>世界模型能够实现:</p>
<!-- /wp:paragraph -->
<!-- wp:list -->
<ul class="wp-block-list"><!-- wp:list-item -->
<li>
<p dir="ltr" role="presentation">通过从大规模多模态场景中学习物理关系,生成更有用的数据。</p>
</li>
<!-- /wp:list-item -->
<!-- wp:list-item -->
<li>
<p dir="ltr" role="presentation">生成更多样化的环境,涵盖不同的天气、光照、物体和轨迹。</p>
</li>
<!-- /wp:list-item -->
<!-- wp:list-item -->
<li>
<p dir="ltr" role="presentation">提供更好的基础,以便针对特定机器人、车辆、传感器配置、任务或运行环境进行构建和适配。</p>
</li>
<!-- /wp:list-item --></ul>
<!-- /wp:list -->
<!-- wp:paragraph /-->
<!-- wp:paragraph -->
<div style="width: 1200px;" class="wp-video"><video class="wp-video-shortcode" id="video-97234-1" width="1200" height="675" autoplay preload="auto" controls="controls"><source type="video/mp4" src="https://blogs.nvidia.com/wp-content/uploads/2026/08/cosmos-corp-blog-promo-1920x1080-1.mp4?_=1" /><a href="https://blogs.nvidia.com/wp-content/uploads/2026/08/cosmos-corp-blog-promo-1920x1080-1.mp4">https://blogs.nvidia.com/wp-content/uploads/2026/08/cosmos-corp-blog-promo-1920x1080-1.mp4</a></video></div>
<p> </p>
<p>通用模型从未见过团队特定的机器人、传感器或运行环境。要弥合这一差距,需要访问模型权重、获得允许适配的许可证以及进行后训练所需的工具。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>NVIDIA Cosmos 世界基础模型采用 Linux 基金会的 OpenMDW 1.1 许可证发布,使团队能够根据自己的数据和硬件对模型进行后训练。定制化正是开放性成为实际技术要求的地方。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>定制模型只是工作流程的一部分。团队还需要环境来生成数据、运行仿真和测试行为。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>Omniverse 库帮助开发者构建可仿真的环境,而 <a target="_blank" href="https://www.nvidia.com/en-us/glossary/openusd/">OpenUSD</a> 提供开放框架,用于在<a target="_blank" href="https://www.nvidia.com/en-us/glossary/digital-twin/">数字孪生</a>、仿真和<a target="_blank" href="https://www.nvidia.com/en-us/glossary/synthetic-data-generation/">合成数据生成</a>工作流程中组合、复用和交换复杂的 3D 数据。Omniverse 与 OpenUSD 共同减少了重复工作——否则每次资产、传感器配置或环境条件变化时,这些工作都会不断累积。</p>
<!-- /wp:paragraph -->
<!-- wp:heading {"level":2} -->
<h2 class="wp-block-heading"><strong><strong>Cosmos 3:前沿模型</strong></strong></h2>
<!-- /wp:heading -->
<!-- wp:paragraph -->
<p><iframe title="Introducing NVIDIA Cosmos 3: The Open Model That Thinks, Generates, and Acts" width="1200" height="675" src="https://www.youtube.com/embed/q7Hj3J9SOXw?start=2&feature=oembed" frameborder="0" allow="accelerometer; autoplay; clipboard-write; encrypted-media; gyroscope; picture-in-picture; web-share" referrerpolicy="strict-origin-when-cross-origin" allowfullscreen></iframe></p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>NVIDIA Cosmos 3 是一个前沿的开放物理 AI 基础<a target="_blank" href="https://www.nvidia.com/en-us/glossary/omni-model/">全能模型</a>,基于 <a target="_blank" href="https://www.nvidia.com/en-us/glossary/mixture-of-transformers/">混合 Transformer</a> 架构构建,结合了视觉推理、世界生成和动作预测,使开发者能够使用一个模型系列来理解场景、生成合成数据、模拟未来状态,并构建专门的<a target="_blank" href="https://www.nvidia.com/en-us/glossary/world-action-model/">世界动作模型</a>。</p>
<!-- /wp:paragraph -->
<!-- wp:paragraph -->
<p>开发者可以将 Cosmos 3 用作 <a target="_blank" href="https://www.nvidia.com/en-us/glossary/vision-language-models/">视觉语言模型</a>、物理世界模拟器(预测未来世界状态并生成大规模合成数据),或者作为构建专门世界动作模型的基础。</p>
<!-- /wp:paragraph -->
查看缓存全文
缓存时间: 2026/08/06 13:44
来源:https://blogs.nvidia.com/blog/open-world-models-physical-ai/
*编者按:本文是 [**Into the Omniverse**](https://www.nvidia.com/en-us/omniverse/news/) 系列的一部分,该系列聚焦开发者、3D 从业者与企业如何利用 [**OpenUSD**](https://www.nvidia.com/en-us/omniverse/usd/) 和 [**NVIDIA Omniverse**](https://www.nvidia.com/en-us/omniverse/) 的最新进展来变革自身工作流程。*
今年 7 月,NVIDIA 与 200 多家公司和组织共同签署了 [“Open Weights and American AI Leadership”](https://images.nvidia.com/pdf/Open-Weights-and-American-AI-Leadership.pdf) 公开信,指出 AI 领导力将不再以任何单一前沿模型来衡量,而取决于开放生态系统能否惠及各行各业。
[开放模型](https://www.nvidia.com/en-us/glossary/open-models/) 可供任何人下载、检查、修改并在自有基础设施上运行,正是实现这一目标的关键。而这一点在[物理 AI](https://www.nvidia.com/en-us/glossary/generative-physical-ai/) 领域尤为关键,因为每一次部署都是一个专业化问题。
物理 AI 必须理解和预测后果,而不仅仅是表象。
为了实现这一点,[世界模型](https://www.nvidia.com/en-us/glossary/world-models/) 学习物理环境的行为方式、接下来可能发生什么,以及后续哪些动作有意义。它们能够生成基于物理的世界与动作数据,模拟未来状态,并为团队针对机器人、自动驾驶汽车或视觉 AI 系统进行定制提供基础。
开放世界模型已被用于生成训练数据、测试策略以及定制物理 AI 系统。[NVIDIA Cosmos 3](https://www.nvidia.com/en-us/ai/cosmos/) 将上述能力整合到一个开放模型系列中,在多项基准测试中取得领先成绩,并被机器人、自动驾驶汽车和视觉 AI 领域广泛采用。
此外,作为 NVIDIA Agent Toolkit 组成部分的 [NVIDIA Omniverse](https://www.nvidia.com/en-us/omniverse/) 库提供了预构建功能,用于打造可供模拟的虚拟世界,物理 AI 团队可借此在真实世界部署前训练、测试和验证系统。
## **世界模型是物理 AI 的基础**
物理 AI 所需的数据难以按所需规模进行采集,且成本高昂。罕见事件和长尾场景尤其难以安全、重复地复现。
世界模型能够实现:
- 通过学习大规模多模态场景中的物理关系,获得更有用的数据。
- 更多样化的环境,涵盖天气、光照、物体和轨迹的变化。
- 更好的基础,便于针对特定机器人、车辆、传感器配置、任务或运行环境进行构建和适配。
https://blogs.nvidia.com/wp-content/uploads/2026/08/cosmos-corp-blog-promo-1920x1080-1.mp4
通用模型没有见过团队的特定机器人、传感器或运行环境。要弥合这一差距,需要获得模型权重、允许改写的许可证,以及进行后训练所需的工具。
NVIDIA Cosmos 世界基础模型以 Linux 基金会的 OpenMDW 1.1 许可证发布,允许团队在自有数据和硬件上对模型进行后训练。专业化正是开放性成为实际技术需求的关键所在。
定制模型只是工作流程的一部分。团队还需要用于生成数据、运行模拟和测试行为的环境。
Omniverse 库可帮助开发者构建模拟就绪的环境,而 [OpenUSD](https://www.nvidia.com/en-us/glossary/openusd/) 提供了开放框架,用于在[数字孪生](https://www.nvidia.com/en-us/glossary/digital-twin/)、模拟和[合成数据生成](https://www.nvidia.com/en-us/glossary/synthetic-data-generation/)工作流中组合、复用和交换复杂的 3D 数据。Omniverse 与 OpenUSD 双剑合璧,可减少因资产、传感器配置或环境条件变化而不断重复的工作。
## **Cosmos 3:前沿模型**
NVIDIA Cosmos 3 是一个前沿的开放物理 AI 基础[全能模型(omni-model)](https://www.nvidia.com/en-us/glossary/omni-model/),基于[混合 Transformer(mixture-of-transformers)](https://www.nvidia.com/en-us/glossary/mixture-of-transformers/)架构构建,融合了视觉推理、世界生成和动作预测,使开发者能够使用一个模型系列来理解场景、生成合成数据、模拟未来状态并构建专业化的[世界动作模型](https://www.nvidia.com/en-us/glossary/world-action-model/)。
开发者可以将 Cosmos 3 用作[视觉语言模型](https://www.nvidia.com/en-us/glossary/vision-language-models/)、预测未来世界状态并生成大规模合成数据的基于物理的世界模拟器,或作为世界动作模型的骨干,而无需为每种能力分别组装和维护独立模型。
该系列包括用于高保真世界建模的 Cosmos 3 Super(64B)、用于高效推理和后训练的 Cosmos 3 Nano(16B),以及用于设备端视觉推理和机器人策略部署的 [Cosmos 3 Edge](https://huggingface.co/nvidia/Cosmos3-Edge)(4B)。Cosmos 3 Edge 足够轻量,可在边缘 GPU 上运行,并支持部署到 NVIDIA RTX GPU、NVIDIA DGX 系统和 NVIDIA Jetson(包括 Jetson Thor 平台)。
在多项基准测试中,Cosmos 3 在 [Artificial Analysis](https://artificialanalysis.ai/image/leaderboard/text-to-image/open-weights) 的开放权重文生图和图生视频评估、[PAI-Bench](https://huggingface.co/spaces/shi-labs/physical-ai-bench-leaderboard) 的世界生成评估以及 [Physics-IQ](https://physics-iq.github.io/) 的图生视频类别中均排名第一。在机器人策略方面,它在 [RoboLab](https://research.nvidia.com/labs/srl/projects/robolab/leaderboard.html) 上排名第一。Cosmos 3 Super 还是 [VANTAGE-Bench](https://huggingface.co/spaces/clemson-computing/VANTAGE-Bench-Leaderboard) 视觉理解评估中排名最高的开放模型。
除了 Cosmos 之外,NVIDIA 的物理 AI 技术栈还包括面向机器人的 [Isaac GR00T](https://developer.nvidia.com/isaac/gr00t)、面向自动驾驶汽车的 [Alpamayo](https://www.nvidia.com/en-us/solutions/autonomous-vehicles/alpamayo/) 以及面向视觉 AI 的 [Metropolis](https://www.nvidia.com/en-us/autonomous-machines/intelligent-video-analytics-platform/)。
## **开发者如何应用 Cosmos 3**
各行业的开发者正在基于 NVIDIA Cosmos 构建物理 AI 应用:机器人领域有 Doosan Robotics、LG Electronics、Samsung Electronics 和 Skild AI;自动驾驶汽车领域有 Li Auto、Xiaomi 和 Afari;视觉 AI 智能体领域有 [Centific](https://www.centific.com/blog/centific-brings-last-mile-physical-ai-to-production-with-nvidia-cosmos-3)、[Fogsphere](https://fogsphere.com/fogsphere-announces-cosmos-3-support/)、[Linker Vision](https://www.linkervision.com/post/linker-vision-unveils-application-driven-ai-grid-for-agentic-video-reasoning-at-scale)、[Milestone Systems](https://www.milestonesys.com/resources/content/articles/milestone-hafnia-nvidia-cosmos-3/) 和 [Yuan](https://www.yuan.com.tw/news/preview-news?id=336&t=d74eb353274d4fd78e460600ae11a561),它们为支持工业 AI 和智能空间应用的[视觉 AI 智能体](https://www.nvidia.com/en-us/use-cases/video-analytics-ai-agents/)提供动力。
[NVIDIA Cosmos 联盟](https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai)进一步推动了这项工作,汇聚了世界模型构建者、AI 开发者和物理 AI 领导者,共同贡献模型、研究和评估方法。NVIDIA 最近[将该联盟扩展至日本](https://nvidianews.nvidia.com/news/japans-robotics-and-manufacturing-leaders-build-on-nvidia-cosmos-to-advance-physical-ai-frontier),当地机器人和制造业领导者计划加入,并为工厂、物流、农业、建筑、医疗和交通运输开发开放世界模型。
综上所述,这些应用和合作正在将开放世界模型确立为物理 AI 的适应性基础,覆盖机器人、自动驾驶汽车和视觉 AI 系统。
## **了解更多**
通过以下资源了解更多关于世界模型、OpenUSD 和物理 AI 开发的信息:
- **探索** [Hugging Face](https://huggingface.co/nvidia) 和 [GitHub](https://github.com/nvidia-cosmos) 上的开放 [Cosmos 3 模型集合](https://huggingface.co/collections/nvidia/cosmos3)与数据集。
- **阅读** [Cosmos 3 技术报告](https://research.nvidia.com/labs/cosmos-lab/cosmos3/technical-report.pdf),了解完整架构细节与评估。
- **阅读** [Cosmos 3 技术博客](https://developer.nvidia.com/blog/)。
- **观看** [Cosmos Labs 直播](https://www.addevent.com/calendar/ss55fmjpm04t)。
- **了解** [NVIDIA Cosmos 联盟](https://nvidianews.nvidia.com/news/nvidia-launches-cosmos-3-the-open-frontier-foundation-model-for-physical-ai)。
相似文章
NVIDIA 推出 Cosmos 3,面向物理AI的开放前沿基础模型(5分钟阅读)
NVIDIA 发布 Cosmos 3,这是一个面向物理AI的开放基础模型,采用混合Transformer架构,支持推理、世界模拟和动作生成,适用于机器人和自动驾驶车辆。
欢迎 NVIDIA Cosmos 3:首个用于物理AI推理与行为的开放全能模型
NVIDIA Cosmos 3 是一个面向物理AI的开放全能模型,它将世界生成、推理和行为生成统一到一个模型中,现已可在 Hugging Face 上获取,并提供多种资源。
走进 Omniverse:NVIDIA GTC 展示赋能物理智能时代的虚拟世界
NVIDIA GTC 2026 展示了物理智能领域的重大突破,包括全新前沿模型(Cosmos 3、Isaac GR00T N1.7、Alpamayo 1.5)以及用于扩展机器人、车辆和工厂部署的基础设施蓝图。本届大会重点突出了虚拟世界与数字孪生技术如何推动各行业的跨企业级物理智能落地应用。
Cosmos 3: 用于物理AI的全模态世界模型
Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。
Nvidia Cosmos 3
NVIDIA 开源了 Cosmos 3,这是一个物理AI的前沿基础模型,将推理、世界生成和动作生成统一在单一的 Mixture-of-Transformers 架构中,并发布了用于机器人、自动驾驶和仓库监控的模型检查点、数据集和训练脚本。