nvidia/Cosmos3-Edge

Hugging Face Models Trending 模型

摘要

NVIDIA 发布了 Cosmos3-Edge,这是一个全模态世界基础模型,能够从文本、图像、视频和动作轨迹输入生成视频、图像、音频和动作命令,面向机器人、自动驾驶和智能空间等物理 AI 应用。

标签:cosmos, diffusers, safetensors, cosmos3_edge, nvidia, cosmos3, arxiv:2405.14867, license:other, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/22 08:17

nvidia/Cosmos3-Edge · Hugging Face 来源:https://huggingface.co/nvidia/Cosmos3-Edge ## https://huggingface.co/nvidia/Cosmos3-Edge#cosmos-3-omnimodal-world-models-for-physical-aiCosmos 3:面向物理AI的全模态世界模型 模型集合 (https://huggingface.co/collections/nvidia/cosmos3)|代码 (https://github.com/nvidia/cosmos)|白皮书 (https://research.nvidia.com/labs/cosmos-lab/cosmos3/technical-report.pdf)|网站 (https://research.nvidia.com/labs/cosmos-lab/cosmos3/) NVIDIA Cosmos™ (https://github.com/nvidia/cosmos) 是一个世界基础模型平台,旨在加速物理AI的发展,使机器能够理解、模拟和交互物理世界,覆盖机器人、自动驾驶以及智能空间环境(包括工业和工厂规模应用)。 ## https://huggingface.co/nvidia/Cosmos3-Edge#model-overview-cosmos3-edge模型概述:Cosmos3-Edge ## https://huggingface.co/nvidia/Cosmos3-Edge#description描述 Cosmos3 是一个全模态世界模型集合,能够根据文本、图像、视频和动作轨迹的组合输入,生成动态、高质量的视频、图像、音频和动作指令。它是广泛物理AI应用和研究的基础构建模块,涵盖世界理解、世界生成、仿真和具身策略学习等领域。该模型可用于商业和非商业用途。 **模型开发者:**NVIDIA ### https://huggingface.co/nvidia/Cosmos3-Edge#model-versions模型版本 发布日期:2026年7月20日 - Cosmos3-Edge: - 给定包括文本、图像、视频和动作轨迹在内的多模态输入,生成连贯的文本、图像、视频和动作输出,用于多模态理解、世界仿真、未来预测、动作推理及物理AI应用。 - Cosmos3-Edge-Policy-DROID: - 给定来自DROID机器人平台的语言指令和视觉观测,生成用于操作和控制任务的机器人动作轨迹。 - Cosmos3-Super-Image2Video-4Step: - 给定一张或多张输入图像以及可选的文本指令,生成与提供的视觉内容一致的时域连贯视频序列。通过改进的分布匹配蒸馏 (DMD2) (https://arxiv.org/abs/2405.14867) 从Cosmos3-Super-Image2Video蒸馏而来,支持4步高质量生成。 - Cosmos3-Super-Text2Image-4Step: - 给定文本输入,生成与描述一致的高保真图像。通过改进的分布匹配蒸馏 (DMD2) (https://arxiv.org/abs/2405.14867) 从Cosmos3-Super-Text2Image蒸馏而来,支持4步高质量生成。 发布日期:2026年5月31日 - Cosmos3-Nano: - 给定包括文本、图像、视频、音频和动作轨迹在内的多模态输入,生成连贯的文本、图像、视频、音频和动作输出,用于多模态理解、世界仿真、未来预测、动作推理及物理AI应用。 - Cosmos3-Super: - 给定包括文本、图像、视频、音频和动作轨迹在内的多模态输入,生成连贯的文本、图像、视频、音频和动作输出,用于多模态理解、世界仿真、未来预测、动作推理及物理AI应用。 - Cosmos3-Nano-Policy-DROID: - 给定来自DROID机器人平台的语言指令和视觉观测,生成用于操作和控制任务的机器人动作轨迹。 - Cosmos3-Super-Image2Video: - 给定一张或多张输入图像以及可选的文本指令,生成与提供的视觉内容一致的时域连贯视频序列。 - Cosmos3-Super-Text2Image: - 给定文本输入,生成与描述一致的高保真图像。 ### https://huggingface.co/nvidia/Cosmos3-Edge#license许可协议 本模型采用OpenMDW1.1 (https://openmdw.ai/license/1-1/) 发布 ### https://huggingface.co/nvidia/Cosmos3-Edge#deployment-geography部署地域 全球 ### https://huggingface.co/nvidia/Cosmos3-Edge#use-case用例 物理AI:涵盖机器人、自动驾驶车辆 (AV) 以及智能空间环境,包括工业和工厂规模应用。 ### https://huggingface.co/nvidia/Cosmos3-Edge#release-date发布日期 Hugging Face 2026年7月20日,通过https://huggingface.co/collections/nvidia/cosmos3 GitHub 2026年7月20日,通过https://github.com/nvidia/cosmos ## https://huggingface.co/nvidia/Cosmos3-Edge#model-architecture模型架构 **架构类型:**Transformer **网络架构:**Mixture-of-Transformers (MoT) Cosmos3 是一个基于 Mixture-of-Transformers (MoT) 架构的全模态基础模型,包含两个互补的Transformer tower:一个用于离散token生成的自回归Transformer,以及一个用于连续多模态生成的扩散Transformer。推理时,文本通过标准的下一个token自回归解码生成,而图像、视频、音频和动作等非文本模态则通过迭代去噪合成。这种统一架构使Cosmos3能够在单一框架内建模异构模态,同时保留最适合每种模态的生成机制。 **本模型基于以下框架开发:**Cosmos Framework (https://github.com/nvidia/cosmos-framework) 可训练模型参数数量: 发布日期:2026年7月20日 - Cosmos3-Edge:4B - Cosmos3-Edge-Policy-DROID:4B - Cosmos3-Super-Image2Video-4Step:64B - Cosmos3-Super-Text2Image-4Step:64B 发布日期:2026年5月31日 - Cosmos3-Nano:16B - Cosmos3-Super:64B - Cosmos3-Nano-Policy-DROID:16B - Cosmos3-Super-Image2Video:64B - Cosmos3-Super-Text2Image:64B ## https://huggingface.co/nvidia/Cosmos3-Edge#inputoutput-specifications输入/输出规格 - 生成器输入- **输入类型:**文本、图像、动作轨迹 - 输入格式:- 文本:字符串 - 图像:jpg、png、jpeg、webp - 动作:JSON — 形状为 (T, D) 的二维数组,其中 T 是帧数,D 是具身特定维度 - 输入参数:- 文本:一维 (1D) - 图像:二维 (2D) - 动作轨迹:二维 (2D) - 与输入相关的其他属性:- 图像输入为 RGB 颜色(每通道8位,sRGB色彩空间);不支持灰度输入。 - 动作输入是一个逐帧的机器人/智能体状态或控制值序列(例如,关节位置、夹爪状态、相机位姿)。完整输入是一个形状为 (T, D) 的二维数组,其中 T 是帧数,D 是下面列出的具身特定维度。 - 输入动作仅支持兼容的具身类型,包括通用相机运动 (9D)、自动驾驶车辆 (9D)、自我中心运动 (57D)、单 Franka Panda 臂配 RobotiQ 夹爪 (10D)、双 Franka Panda 臂配 RobotiQ 夹爪 (20D)、Agibot (29D)、UR (10D)、Google robot (10D)、WidowX 250 (10D)、UMI (10D)。 - 输入大小和长度限制:- **文本:**4096个token - **图像:**256p和480p分辨率,支持以下宽高比之一(16:9、4:3、1:1、3:4、9:16) - **动作:**16 – 400序列长度 - 生成器输出- **输出类型:**图像、视频、动作、文本 - 输出格式:- 图像:JPG - 视频:MP4 - 动作:JSON - 文本:字符串 - 输出参数:- 图像:二维 (2D) - 视频:三维 (3D) - 动作:二维 (2D) - 文本:一维 (1D) - 与输出相关的其他属性:- 生成的视频为MP4文件,其分辨率、帧率和时长由输入指定。 - 视频生成支持256p和480p分辨率,12–30 fps,以及50–150帧。这些通过请求中的 sizefpsnum_frames 字段设置。 - 生成的动仅支持兼容的具身类型,包括通用相机运动 (9D)、自动驾驶车辆 (9D)、自我中心运动 (57D)、单 Franka Panda 臂配 RobotiQ 夹爪 (10D)、双 Franka Panda 臂配 RobotiQ 夹爪 (20D)、Agibot (29D)、UR (10D)、Google robot (10D)、WidowX 250 (10D)、UMI (10D)。 - 视频:按输入指定的FPS输出的mp4格式 - 图像:JPEG - 推理器输入- **输入类型:**文本、文本+图像、文本+视频 - 输入格式:- 文本:字符串 - 图像:jpg、png、jpeg、webp - 视频:mp4 - 输入参数:- 文本:一维 (1D) - 图像:二维 (2D) - 视频:三维 (3D) - 与输入相关的其他属性:- 视频输入建议帧率为4 fps。 - 支持最长256K token的长上下文输入。 - 输入大小和长度限制:- **文本:**最多256K token(上下文窗口)。 - **图像:**标准输入图像格式;以文件或URL形式传入。 - **视频:**mp4格式,建议4 fps。 - 推理器输出- **输出类型:**文本 - 输出格式:- 文本:字符串 - 输出参数:- 文本:一维 (1D) - 与输出相关的其他属性:- 建议推理输出使用默认 max_tokens=4096+;可请求更长的输出。 - 推理输出可能包括结构化的思维链、2D/3D点定位以及基于视觉任务的边界框坐标。 视频内容将输入文本描述可视化为简短的动画场景,在指定的时间约束内捕捉关键元素。 我们的AI模型设计并优化为在NVIDIA GPU加速系统上运行。通过利用NVIDIA的硬件(例如GPU核心)和软件框架(例如CUDA库),与纯CPU解决方案相比,该模型实现了更快的训练和推理时间。 ## https://huggingface.co/nvidia/Cosmos3-Edge#software-integration软件集成 运行时引擎: - PyTorch (https://github.com/nvidia/cosmos3) 支持的硬件微架构兼容性: - NVIDIA Ampere - NVIDIA Blackwell - NVIDIA Hopper 操作系统: - Linux(我们尚未在其他操作系统上进行测试。) **注意:**仅测试了BF16精度。其他精度如FP4、FP8和FP16未获官方支持。 将基础模型和微调模型集成到AI系统中需要额外的测试,使用特定用例的数据以确保安全和有效部署。遵循V模型方法论,在单元级和系统级进行迭代测试和验证对于降低风险、满足技术和功能需求,并在部署前确保符合安全和道德标准至关重要。 ## https://huggingface.co/nvidia/Cosmos3-Edge#training-testing-and-evaluation-datasets训练、测试和评估数据集 ### https://huggingface.co/nvidia/Cosmos3-Edge#dataset-overview数据集概述 - **总大小:**13亿数据点 - **数据集总数:**393个数据集条目 - **数据集划分:**训练 [100%],测试 [不适用 — 评估基准单独使用],验证 [不适用 — 评估基准单独使用] - **训练数据收集时间周期:**2024–2026 - **测试数据收集时间周期:**不适用(标准公共基准) - **验证数据收集时间周期:**不适用(标准公共基准) 来自内外部来源的原始数据通过多个阶段的策展、过滤和质量审查转换为训练就绪数据。数据采集涵盖多样化的多模态来源——机器人、自动驾驶、工业环境、室内外场景、不同光照和天气条件、相机视角、物体类别以及人类活动——以扩大对物理AI运行环境的覆盖。自动过滤管道移除损坏、重复、低质量和受限内容。预处理过程中应用元数据分析、启发式规则和模型辅助分类器来标记异常分布和低多样性子集。人工审查补充自动过滤,用于选定数据集、基准构建和定向质量分析。数据集在模态和任务类别之间平衡——视觉推理、文生图、文生视频、图生视频、视频迁移、动作条件生成及动作指令生成——以减少狭窄领域的过度表征。合成和仿真驱动的增强补充了对稀有物理交互和边缘场景的覆盖。对整个语料库应用重复数据删除和溯源追踪。生成的已处理数据在训练开始前通过模态特定的预处理器转换为模型就绪的token化或编码表示。 训练数据集经过多层自动和人工防护措施,旨在减少有害或违反政策内容的存在,涉及类别包括武器及武器相关教学内容、犯罪计划、儿童性虐待材料 (CSAM)、非自愿亲密图像 (NCII)、涉及未成年人的性内容、骚扰、仇恨言论、亵渎、威胁和煽动暴力、自残或自杀相关内容以及血腥暴力。数据来源在纳入训练语料库之前,会审查其许可兼容性、来源以及是否符合内部数据治理和安全政策。 自动过滤管道结合多种检测策略:对已知CSAM和NCII参考数据库进行哈希匹配;基于分类器的审核模型,针对露骨性内容、仇恨言论、暴力、武器图像及其他受限类别进行训练;文本数据中针对犯罪计划、威胁和自残短语的关键词和正则表达式筛选;用于源级风险信号的元数据和来源启发式方法;以及基于嵌入的异常检测以发现超出预期分布的样本。人工审查和定向审计补充自动过滤,用于选定数据集、基准构建和安全性敏感评估。对于多模态物理AI数据(机器人、自动驾驶、工业场景),额外过滤针对无效动作轨迹、物理上不可信的交互以及不安全的控制序列。合成和仿真生成的数据在纳入前通过内部验证进行评估。训练后应用基准评估和红队测试,以揭示世界生成、推理和动作任务中剩余的安全差距。没有大规模数据过滤过程能够保证完全清除所有有害内容;残留风险可能依然存在,特别是在罕见边缘情况或开放世界部署环境中。发布后持续进行监控和数据集审查。 数据模态和训练数据大小 模态推理数据样本计数生成数据样本计数文本22M不适用图像19M767M视频1M348M动作不适用7M 按数据集的数据收集方法 - 混合:自动/传感器、合成、自动化 按数据集的标注方法 - 混合:人工、自动化 **属性:**训练、测试和评估数据集由多样化的多模态视频、图像、动作、合成和传感器条件数据组成,这些数据来源于NVIDIA自有数据以及公开可用的、商业许可宽松的数据集。这些数据集经过策展以排除已知受限内容,并支持构建一个全模态模型,该模型学习在世界推理和生成任务中生成关于动态物理环境的推理内容。 ### https://huggingface.co/nvidia/Cosmos3-Edge#public-datasets公开数据集 数据集样本数OpenImage1.2MCoyo700M100MYouTube视频340MUMI4.5M ### https://huggingface.co/nvidia/Cosmos3-Edge#private-datasets私有数据集 数据集样本数

相似文章

nvidia/Cosmos3-Nano

Hugging Face Models Trending

NVIDIA 发布 Cosmos3-Nano,一个用于物理 AI 的全能世界模型,能够从文本、图像、视频和动作输入生成视频、图像、音频和动作指令,面向机器人、自动驾驶和智能空间应用。

nvidia/Cosmos3-Super

Hugging Face Models Trending

NVIDIA 发布了 Cosmos3,这是一套用于物理AI的全模态世界基础模型,能够从多种输入生成视频、图像、音频和动作指令,并提供针对不同任务(如策略学习和图像到视频生成)的版本。

介绍 Cosmos 3 Edge

Hugging Face Blog

NVIDIA 发布了 Cosmos 3 Edge,一个40亿参数的开源世界模型,专为边缘设备设计,帮助机器人和视觉AI代理理解周围环境、实时推理并生成动作。它在同类模型中实现了领先的吞吐量和准确度。

nvidia/Cosmos3-Super-Image2Video

Hugging Face Models Trending

NVIDIA 发布 Cosmos3-Super-Image2Video,该模型能够根据输入图像和文本指令生成时间上连贯的视频序列,是面向物理 AI 应用的 Cosmos 3 全模态世界模型平台的一部分。

Nvidia Cosmos 3

Hacker News Top

NVIDIA 开源了 Cosmos 3,这是一个物理AI的前沿基础模型,将推理、世界生成和动作生成统一在单一的 Mixture-of-Transformers 架构中,并发布了用于机器人、自动驾驶和仓库监控的模型检查点、数据集和训练脚本。