介绍 Cosmos 3 Edge

Hugging Face Blog 模型

摘要

NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/20 21:27

推出 Cosmos 3 Edge

来源:https://huggingface.co/blog/nvidia/cosmos3edge 返回文章列表(https://huggingface.co/blog)

Pranjali Joshi 的头像(https://huggingface.co/PranjaliJoshi)

Saeed Babamohamadi 的头像(https://huggingface.co/SaeedBabamohamadi)

  • 什么是世界建模?(https://huggingface.co/blog/nvidia/cosmos3edge#what-is-world-modeling)
  • 两个 Transformer 塔,一个共享表示(https://huggingface.co/blog/nvidia/cosmos3edge#two-transformer-towers-one-shared-representation)
  • 行动的通用表示(https://huggingface.co/blog/nvidia/cosmos3edge#a-common-representation-for-action)
  • 策略模式(https://huggingface.co/blog/nvidia/cosmos3edge#policy-mode)
  • 后训练样本以提升性能(https://huggingface.co/blog/nvidia/cosmos3edge#post-trained-samples-for-improved-performance)
  • 试用 Cosmos 3 Edge(https://huggingface.co/blog/nvidia/cosmos3edge#try-cosmos-3-edge)

现实世界浩瀚无边,物理 AI 系统要在其中运行,需要理解场景如何变化,预测接下来可能发生什么,并判断一个动作将如何影响世界。

机器运行在工厂、仓库、医院等边缘环境中。要在这些环境中理解和行动,它们需要能够在内存受限的系统上提供数据中心级性能的模型。

今天,我们在 Hugging Face 的 Cosmos 3 仓库中发布 NVIDIA Cosmos 3 Edge。这是一个拥有 40 亿参数的开源世界模型,可帮助机器人和视觉 AI 代理理解周围环境、实时推理,并在边缘设备上生成机器人动作。

下载模型:https://huggingface.co/nvidia/Cosmos3-Edge

该模型在 NVIDIA 边缘计算机上提供内存高效、高吞吐量的推理,包括 NVIDIA RTX PRO GPU、NVIDIA DGX、NVIDIA GeForce RTX™ GPU、NVIDIA Jetson(包括新发布的 Jetson T2000 和 T3000 模块)。

它被设计为紧凑的开源模型,可作为小型视觉语言模型(VLM)使用,吞吐量和准确率均属一流,且支持实时推理。

作为后训练的世界动作模型(WAM),Cosmos 3 Edge 以机器人控制分辨率(640×360 观测)运行,在 NVIDIA Jetson Thor 上实现实时推理,每次推理生成 32 个动作——同时以 15 Hz 频率实现实时控制。

在同类规模(4B 参数)模型中,Cosmos 3 Edge 在 VANTAGE-Bench 视觉分析基准上排名第一,在机器人策略学习方面达到最先进水平,为智能基础设施和机器人领域树立了新标杆。

Cosmos 3 视频(https://youtu.be/1QPh70Es_oU)

什么是世界建模?(https://huggingface.co/blog/nvidia/cosmos3edge#what-is-world-modeling)

世界模型学习环境如何随时间变化。它表示物体、运动、空间关系以及动作的效果。

想象一个机器人伸手去拿一个物体。识别物体只是第一步。机器人还必须知道物体在哪里,它的夹爪如何运动,接触时可能发生什么,以及哪种动作最有可能成功完成任务。

世界模型帮助机器人推理这些关系。它可以预测一个动作的视觉结果,推断导致变化的动作,或者生成一个动作来产生期望的结果。

Cosmos 3 Edge 将这些能力整合到一个模型当中,并在设备上运行。它的共享表示使物理 AI 系统能够理解当前世界状态,模拟可能的未来,并将这些未来与动作连接起来。

两个 Transformer 塔,一个共享表示(https://huggingface.co/blog/nvidia/cosmos3edge#two-transformer-towers-one-shared-representation)

Cosmos 3 结合了两个 Transformer 塔:

  • 自回归塔: 处理视觉和文本 token,用于理解和推理。
  • 扩散塔: 处理视觉、音频和动作 token,用于预测、生成和神经模拟。

两个塔各自拥有独立的归一化层和多层感知机。它们共享多模态注意力层,将语言、视频、音频和动作信息对齐。

这种设计允许模型在生成输出之前先推理场景。根据任务的不同,Cosmos 3 可以从自回归塔生成推理 token,或者从扩散塔生成去噪后的视频和动作 token。

注意力模式也根据信息类型进行了调整。语言使用因果注意力,每个 token 关注它之前的 token。扩散 token 更广泛地关注可用上下文,支持连贯的预测和生成。

这些组件共同为模型提供了一种通用的表示,用于理解正在发生的事情、接下来可能发生什么,以及动作如何影响结果。

ababa(https://cdn-uploads.huggingface.co/production/uploads/6a45813c717ace23b8c3b562/EXkYn60a1TSwkBXaoKmNh.png)

行动的通用表示(https://huggingface.co/blog/nvidia/cosmos3edge#a-common-representation-for-action)

物理系统以不同方式描述动作。车辆可能通过自我姿态和运动来表示动作。摄像机使用摄像机运动。机械臂使用末端执行器的姿态,而手或夹爪还需要表示抓取状态。

Cosmos 3 将这些不同的具身形态映射到一个通用的动作表示中。

动作被编码为紧凑的几何向量,包含:

  • 平移
  • 旋转
  • 操控状态

这在控制与世界的视觉结构之间建立了直接联系。模型可以将像素变化与物理运动、空间关系和控制输入关联起来。

因此,生成的视频不仅仅是视觉预测。它可以表示世界对动作的预期变化。这为开发者提供了植根于运动、控制和因果关系的训练数据。

策略模式(https://huggingface.co/blog/nvidia/cosmos3edge#policy-mode)

作为策略,Cosmos 3 预测一个动作及其预期的视觉后果。

模型可以生成系统应该做什么,并模拟接下来可能发生什么。这直接将世界建模与机器人策略训练和评估联系起来。

输入当前状态,输出动作和视觉后果。

这些模式使一个模型能够学习原因、结果和策略。动作可以在模型中双向流动,使 Cosmos 3 Edge 能够预测动作的效果或从效果推断动作。

机械臂拿起一根香蕉

提示:拿起香蕉并放入盘中。

我们还发布了 Cosmos 3 Edge Policy (DROID):这是一个在 DROID 数据集上后训练的机器人操控策略,用于拾取与放置任务,并附带了后训练脚本。

开发者可以使用一个小型 H100 集群或 NVIDIA DGX Station 来高效微调 Cosmos 3 Edge 以适配其目标工作负载,然后部署到 NVIDIA 边缘和加速计算平台上。

后训练样本以提升性能(https://huggingface.co/blog/nvidia/cosmos3edge#post-trained-samples-for-improved-performance)

除了基础模型,我们还发布了参考后训练检查点和训练配方,帮助开发者调整和优化 Cosmos 3 以用于自己的应用。

Cosmos 3 是一个开源世界基础模型平台。随着模型使用高质量、领域特定的数据进行后训练,其在专业应用中的准确率会持续提升。Cosmos 是使用开放框架构建领域适应世界模型的起点。后训练使开发者能够提升模型性能,同时保持输出质量。为了演示这一工作流程,我们还发布了 Cosmos 3 Super 4 步蒸馏检查点以及后训练脚本,为 64B 模型提供了一个更快的参考实现,帮助开发者将 Cosmos 适应到自己的领域并获得更好的下游性能。

Cosmos 3 Super 4 步(文生图 & 图生视频):这些是分布匹配蒸馏后的检查点和脚本,将扩散去噪步骤从 35–50 步减少到仅 4 步,在保持图像和视频质量与保真度的同时,实现高达 25 倍的推理加速。

这些示例作为参考实现,开发者可以在其基础上进行构建。使用开源训练脚本,您可以对 Cosmos 3 Edge 进行后训练以构建自定义机器人策略,或者蒸馏 Cosmos 3 Super 以更快地生成适合您应用的图像和视频。

试用 Cosmos 3 Edge(https://huggingface.co/blog/nvidia/cosmos3edge#try-cosmos-3-edge)

下载模型:https://huggingface.co/nvidia/Cosmos3-Edge

Cosmos 3 Edge 通过共享的世界表示将理解、预测、模拟和动作连接起来。开发者可以将其部署在靠近传感器的设备上。该模型既可用作推理器,也可用作动作生成器。

使用开放的 Cosmos 框架定制和专化模型。

查看 Cosmos 3:https://huggingface.co/collections/nvidia/cosmos3

未来展望(https://huggingface.co/blog/nvidia/cosmos3edge#whats-ahead)

我们将继续推进 Cosmos 3 在物理 AI 中的应用,即将推出交互式世界生成、驾驶场景模拟和机器人策略方面的改进。

我们还在投资于更快的推理和更广泛硬件上的更高效后训练,以减少构建下游模型所需的时间和算力。

这包括使用开放推理和优化框架(如 vLLM)优化 Cosmos 3 检查点,更多优化和开发者工具即将推出。

相似文章

nvidia/Cosmos3-Edge

Hugging Face Models Trending

NVIDIA 发布了 Cosmos3-Edge,这是一个全模态世界基础模型,能够从文本、图像、视频和动作轨迹输入生成视频、图像、音频和动作命令,面向机器人、自动驾驶和智能空间等物理 AI 应用。

Nvidia Cosmos 3

Hacker News Top

NVIDIA 开源了 Cosmos 3,这是一个物理AI的前沿基础模型,将推理、世界生成和动作生成统一在单一的 Mixture-of-Transformers 架构中,并发布了用于机器人、自动驾驶和仓库监控的模型检查点、数据集和训练脚本。

Cosmos 3 如何帮助物理 AI 在行动前思考

NVIDIA Blog

NVIDIA 宣布推出 Cosmos 3,这是一个开放的世界基础模型,结合了视觉推理、多模态生成和动作预测,帮助机器人、自动驾驶车辆和 AI 代理理解并预测现实世界的动态。

NVIDIA/cosmos

GitHub Trending (daily)

NVIDIA Cosmos 是一个开放平台,提供世界模型、数据集和工具,旨在帮助开发者为机器人、自动驾驶车辆和智能基础设施构建物理AI应用。