Cosmos 3: 用于物理AI的全模态世界模型
摘要
Cosmos 3是NVIDIA推出的一系列全模态世界模型,采用统一的混合Transformer架构联合处理语言、图像、视频、音频和动作序列,在物理AI的理解和生成任务上达到了最先进水平。
查看缓存全文
缓存时间: 2026/06/04 03:41
论文页面 - Cosmos 3:面向物理AI的全模态世界模型
来源:https://huggingface.co/papers/2606.02800 发布于6月1日
#1 今日论文 (https://huggingface.co/papers/date/2026-06-04) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Cosmos 3 是一个全模态世界模型,通过统一的混合Transformer架构处理和生成多种数据类型,在各种理解和生成任务中取得了最先进的性能。
我们推出了 Cosmos 3,一系列 全模态世界模型 (https://huggingface.co/papers?q=omnimodal%20world%20models),旨在统一的 混合Transformer架构 (https://huggingface.co/papers?q=mixture-of-transformers%20architecture) 中联合处理和生成语言、图像、视频、音频以及动作序列。通过支持高度灵活的输入-输出配置,Cosmos 3 无缝统一了 物理AI (https://huggingface.co/papers?q=Physical%20AI) 所需的关键模态——有效地将 视觉语言模型 (https://huggingface.co/papers?q=vision-language%20models)、视频生成器 (https://huggingface.co/papers?q=video%20generators)、世界模拟器 (https://huggingface.co/papers?q=world%20simulators) 和 世界动作模型 (https://huggingface.co/papers?q=world-action%20models) 整合到单一框架中。我们的评估表明,Cosmos 3 在多种理解和生成任务上树立了新的最先进水平,证明了 全模态世界模型 (https://huggingface.co/papers?q=omnimodal%20world%20models) 作为 具身智能体 (https://huggingface.co/papers?q=embodied%20agents) 的可扩展、通用骨干网络的潜力。我们后训练的 Cosmos 3 模型在撰写技术报告时,被 Artificial Analysis 评为最佳开源文本到图像和图像到视频模型,并被 RoboArena 评为最佳策略模型。为了加速 物理AI (https://huggingface.co/papers?q=Physical%20AI) 的开放研究与部署,我们在 Linux 基金会的 OpenMDW-1.1 (https://openmdw.ai/license/1-1/) 许可下,于 https://github.com/nvidia/cosmos (https://github.com/nvidia/cosmos) 和 https://huggingface.co/collections/nvidia/cosmos3 (https://huggingface.co/collections/nvidia/cosmos3) 提供我们的代码、模型检查点、精选合成数据集和评估基准。项目网站位于 https://research.nvidia.com/labs/cosmos-lab/cosmos3 (https://research.nvidia.com/labs/cosmos-lab/cosmos3)。
查看 arXiv 页面 (https://arxiv.org/abs/2606.02800) | 查看 PDF (https://arxiv.org/pdf/2606.02800) | 项目页面 (https://research.nvidia.com/labs/cosmos-lab/cosmos3/) | GitHub 8.68k (https://github.com/NVIDIA/cosmos) | 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.02800)
引用本文的模型 (0)
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.02800 以将其链接到此页面。
引用本文的数据集 (0)
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.02800 以将其链接到此页面。
引用本文的 Spaces (0)
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.02800 以将其链接到此页面。
包含本文的收藏集 (0)
暂无收藏集包含此论文
请将此论文添加到 收藏集 (https://huggingface.co/new-collection) 中以将其链接到此页面。
相似文章
@mli0603: 这就是Physical AI的关键时刻!我们正式宣布Cosmos 3:面向Physical AI的全模态世界模型 - Cosm…
宣布Cosmos 3,一个面向Physical AI的全模态世界模型,能够在统一架构中理解和生成语言、图像、视频、音频和动作。
nvidia/Cosmos3-Super
NVIDIA 发布了 Cosmos3,这是一套用于物理AI的全模态世界基础模型,能够从多种输入生成视频、图像、音频和动作指令,并提供针对不同任务(如策略学习和图像到视频生成)的版本。
nvidia/Cosmos3-Nano
NVIDIA 发布 Cosmos3-Nano,一个用于物理 AI 的全能世界模型,能够从文本、图像、视频和动作输入生成视频、图像、音频和动作指令,面向机器人、自动驾驶和智能空间应用。
Cosmos 3 如何帮助物理 AI 在行动前思考
NVIDIA 宣布推出 Cosmos 3,这是一个开放的世界基础模型,结合了视觉推理、多模态生成和动作预测,帮助机器人、自动驾驶车辆和 AI 代理理解并预测现实世界的动态。
欢迎 NVIDIA Cosmos 3:首个用于物理AI推理与行为的开放全能模型
NVIDIA Cosmos 3 是一个面向物理AI的开放全能模型,它将世界生成、推理和行为生成统一到一个模型中,现已可在 Hugging Face 上获取,并提供多种资源。