Cosmos 3: 用于物理AI的全模态世界模型

Hugging Face Daily Papers 论文

摘要

Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。

我们推出Cosmos 3系列全模态世界模型,专为在统一的混合Transformer架构内联合处理与生成语言、图像、视频、音频和动作序列而设计。通过支持高度灵活的输入输出配置,Cosmos 3无缝统一了物理AI的关键模态——实际上将视觉语言模型、视频生成器、世界模拟器和世界动作模型整合到一个单一框架中。我们的评估表明,Cosmos 3在多样化的理解和生成任务上建立了新的最先进水平,证明了全模态世界模型可作为具身智能体的可扩展、通用骨干网。在技术报告撰写时,我们后训练的Cosmos 3模型被Artificial Analysis评为最佳开源文本到图像和图像到视频模型,并被RoboArena评为最佳策略模型。为了加速物理AI的开放研究与部署,我们在Linux Foundation的OpenMDW-1.1许可证下提供了代码、模型检查点、精选合成数据集和评估基准,地址为https://github.com/nvidia/cosmos和https://huggingface.co/collections/nvidia/cosmos3。项目网站位于https://research.nvidia.com/labs/cosmos-lab/cosmos3。
查看原文
查看缓存全文

缓存时间: 2026/06/04 03:41

论文页面 - Cosmos 3:面向物理AI的全模态世界模型

来源:https://huggingface.co/papers/2606.02800 发布于6月1日

#1 今日论文 (https://huggingface.co/papers/date/2026-06-04) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Cosmos 3 是一个全模态世界模型,通过统一的混合Transformer架构处理和生成多种数据类型,在各种理解和生成任务中取得了最先进的性能。

我们推出了 Cosmos 3,一系列 全模态世界模型 (https://huggingface.co/papers?q=omnimodal%20world%20models),旨在统一的 混合Transformer架构 (https://huggingface.co/papers?q=mixture-of-transformers%20architecture) 中联合处理和生成语言、图像、视频、音频以及动作序列。通过支持高度灵活的输入-输出配置,Cosmos 3 无缝统一了 物理AI (https://huggingface.co/papers?q=Physical%20AI) 所需的关键模态——有效地将 视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)、视频生成器 (https://huggingface.co/papers?q=video%20generators)、世界模拟器 (https://huggingface.co/papers?q=world%20simulators) 和 世界动作模型 (https://huggingface.co/papers?q=world-action%20models) 整合到单一框架中。我们的评估表明,Cosmos 3 在多种理解和生成任务上树立了新的最先进水平,证明了 全模态世界模型 (https://huggingface.co/papers?q=omnimodal%20world%20models) 作为 具身智能体 (https://huggingface.co/papers?q=embodied%20agents) 的可扩展、通用骨干网络的潜力。我们后训练的 Cosmos 3 模型在撰写技术报告时,被 Artificial Analysis 评为最佳开源文本到图像和图像到视频模型,并被 RoboArena 评为最佳策略模型。为了加速 物理AI (https://huggingface.co/papers?q=Physical%20AI) 的开放研究与部署,我们在 Linux 基金会的 OpenMDW-1.1 (https://openmdw.ai/license/1-1/) 许可下,于 https://github.com/nvidia/cosmos (https://github.com/nvidia/cosmos) 和 https://huggingface.co/collections/nvidia/cosmos3 (https://huggingface.co/collections/nvidia/cosmos3) 提供我们的代码、模型检查点、精选合成数据集和评估基准。项目网站位于 https://research.nvidia.com/labs/cosmos-lab/cosmos3 (https://research.nvidia.com/labs/cosmos-lab/cosmos3)。

查看 arXiv 页面 (https://arxiv.org/abs/2606.02800) | 查看 PDF (https://arxiv.org/pdf/2606.02800) | 项目页面 (https://research.nvidia.com/labs/cosmos-lab/cosmos3/) | GitHub 8.68k (https://github.com/NVIDIA/cosmos) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02800)

引用本文的模型 (0)

暂无模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.02800 以将其链接到此页面。

引用本文的数据集 (0)

暂无数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.02800 以将其链接到此页面。

引用本文的 Spaces (0)

暂无 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.02800 以将其链接到此页面。

包含本文的收藏集 (0)

暂无收藏集包含此论文

请将此论文添加到 收藏集 (https://huggingface.co/new-collection) 中以将其链接到此页面。

相似文章

nvidia/Cosmos3-Super

Hugging Face Models Trending

NVIDIA 发布了 Cosmos3,这是一套用于物理AI的全模态世界基础模型,能够从多种输入生成视频、图像、音频和动作指令,并提供针对不同任务(如策略学习和图像到视频生成)的版本。

nvidia/Cosmos3-Nano

Hugging Face Models Trending

NVIDIA 发布 Cosmos3-Nano,一个用于物理 AI 的全能世界模型,能够从文本、图像、视频和动作输入生成视频、图像、音频和动作指令,面向机器人、自动驾驶和智能空间应用。

Cosmos 3 如何帮助物理 AI 在行动前思考

NVIDIA Blog

NVIDIA 宣布推出 Cosmos 3,这是一个开放的世界基础模型,结合了视觉推理、多模态生成和动作预测,帮助机器人、自动驾驶车辆和 AI 代理理解并预测现实世界的动态。