@itsPaulAi: 哇哦,Nvidia刚刚发布了一个2.6B开源世界模型,你可以将单张图片、文本提示和轨迹转化为…
摘要
Nvidia发布了一个2.6B开源世界模型,能够从单张图片、文本提示和轨迹生成可控世界,并在单个GPU上运行。
哇哦,Nvidia刚刚发布了一个2.6B开源世界模型
你可以将单张图片、文本提示和轨迹转化为可控世界...
而且是在单个GPU上!
- 代码已发布在GitHub上
- 论文也已发表在arXiv上
你可以用它做很多事情,比如具身AI和机器人研究、仿真等。
因为它可以在单个GPU(如RTX 5090或H100)上运行,所以世界模型基本上人人都能用了!
查看缓存全文
缓存时间: 2026/05/16 07:14
哇,Nvidia 刚刚发布了一个 2.6B 开源世界模型
您可以将单张图片、文本提示和轨迹转化为可控世界…
而且只需一张 GPU!
- GitHub 上提供代码
- 论文也在 arxiv 上
您可以用它做很多事情,如具身人工智能和机器人研究、模拟等。
由于它可以在单张 GPU(如 RTX 5090 或 H100)上运行,这使得世界模型基本上对所有人都可及!
相似文章
@svpino: 这个世界生成模型太不可思议了。我上传了一张图片(左边的那张),它就创建了一个完整的3…
一位用户展示了Hyper3D WorldGen,这是一个AI模型,能从单张图片生成完整、可编辑的3D场景,突出其令人印象深刻的功能。
Genie风格的可交互世界模型,在单个5090上以19GB显存运行720p分辨率、16FPS
ABot-World-0是一个实时交互的世界模型,在单个NVIDIA RTX 5090 GPU上以19GB显存实现了720p分辨率、16FPS的视频生成,支持无限的动作条件世界展开,用于模拟和AI研究。
nvidia/Cosmos3-Super-Text2Image
NVIDIA 发布了 Cosmos3-Super-Text2Image,这是一个文生图模型,属于 Cosmos3 全模态世界模型平台的一部分,用于物理 AI,使机器能够理解和模拟物理世界。
NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型
NVIDIA推出OmniDreams,这是一个基于Cosmos扩散模型构建的生成式世界模型,用于实时动作条件视频生成,能够在复杂的未见场景中实现自动驾驶策略评估的闭环仿真。
ABot-World-0:在单台式机GPU上实现无限交互式世界展开
ABot-World-0是一个实时的、长时域交互式视频世界模型,可在单台式机GPU上运行,通过动作条件控制实现无限世界展开。