HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型

Hugging Face Daily Papers 论文

摘要

HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。

我们介绍 HY-World 2.0,一个多模态世界模型框架,它是对我们先前项目 HY-World 1.0 的升级。HY-World 2.0 支持多种输入模态,包括文本提示、单视图图像、多视图图像和视频,并生成三维世界表示。对于文本或单视图图像输入,该模型执行世界生成,合成高保真且可导航的三维高斯泼溅(3DGS)场景。这通过四个阶段的方法实现:a) 使用 HY-Pano 2.0 进行全景生成,b) 使用 WorldNav 进行轨迹规划,c) 使用 WorldStereo 2.0 进行世界扩展,d) 使用 WorldMirror 2.0 进行世界组合。具体来说,我们引入了关键创新,以提高全景保真度、实现三维场景理解和规划,并升级了 WorldStereo——我们基于关键帧且具有一致记忆的视图生成模型。我们还升级了 WorldMirror,一个用于通用三维预测的前馈模型,通过优化模型架构和学习策略,使其能够从多视图图像或视频进行世界重建。此外,我们引入了 WorldLens,一个高性能的 3DGS 渲染平台,具有灵活的与引擎无关的架构、自动 IBL 光照、高效的碰撞检测以及训练-渲染协同设计,支持交互式探索三维世界并带有角色支持。大量实验表明,HY-World 2.0 在几个基准测试中,在开源方法中达到了最先进的性能,其结果可与闭源模型 Marble 相媲美。我们发布所有模型权重、代码和技术细节,以促进可重复性并支持对三维世界模型的进一步研究。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:29

论文页面 - HY-World 2.0:用于重建、生成和仿真3D世界的多模态世界模型

来源:https://huggingface.co/papers/2604.14268 发布于 4月15日

#1 当日论文 (https://huggingface.co/papers/date/2026-04-17) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

HY-World 2.0 是一个多模态世界模型框架,利用专用模块进行全景图生成、轨迹规划、世界扩展与合成,并配合增强渲染平台实现交互式3D探索,从而从多种输入生成高保真3D高斯泼溅场景。

我们介绍了 HY-World 2.0,这是一个多模态世界模型 (https://huggingface.co/papers?q=multi-modal%20world%20model) 框架,它推进了我们之前的项目 HY-World 1.0。HY-World 2.0 支持多种输入模态,包括文本提示、单视角图像、多视角图像和视频,并产生3D世界表征 (https://huggingface.co/papers?q=3D%20world%20representations)。对于文本或单视角图像输入,模型执行世界生成,合成高保真、可导航的3D高斯泼溅 (https://huggingface.co/papers?q=3D%20Gaussian%20Splatting) (3DGS) 场景。这通过四阶段方法实现:a) 使用HY-Pano 2.0 (https://huggingface.co/papers?q=HY-Pano%202.0) 进行全景生成,b) 使用WorldNav (https://huggingface.co/papers?q=WorldNav) 进行轨迹规划,c) 使用WorldStereo 2.0 (https://huggingface.co/papers?q=WorldStereo%202.0) 进行世界扩展,d) 使用WorldMirror 2.0 (https://huggingface.co/papers?q=WorldMirror%202.0) 进行世界合成。具体来说,我们引入了关键创新以提升全景保真度,实现3D场景理解与规划,并升级了WorldStereo(我们基于关键帧的视角生成 (https://huggingface.co/papers?q=keyframe-based%20view%20generation) 模型,具有一致记忆)。我们还升级了WorldMirror(一个前馈模型 (https://huggingface.co/papers?q=feed-forward%20model) 用于通用3D预测),通过精炼模型架构和学习策略,实现了从多视角图像或视频进行世界重建。此外,我们引入了WorldLens(一个高性能3DGS渲染平台 (https://huggingface.co/papers?q=rendering%20platform)),具有灵活的引擎无关架构、自动IBL光照、高效碰撞检测以及训练-渲染协同设计,支持带角色功能的3D世界交互探索 (https://huggingface.co/papers?q=interactive%20exploration)。大量实验表明,HY-World 2.0 在多个基准测试中达到开源方法中的最先进性能,其结果可与闭源模型 Marble 相媲美。我们发布所有模型权重、代码和技术细节,以促进可复现性并支持3D世界模型的进一步研究。

查看 arXiv 页面 (https://arxiv.org/abs/2604.14268) 查看 PDF (https://arxiv.org/pdf/2604.14268) 项目页面 (https://3d-models.hunyuan.tencent.com/world/) GitHub 1.3k (https://github.com/Tencent-Hunyuan/HY-World-2.0) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.14268)

在您的agent中获取此论文:

hf papers read 2604\.14268

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2604.14268 以从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2604.14268 以从此页面链接。

引用此论文的 Spaces 1

包含此论文的收藏集 6

浏览包含此论文的 6 个收藏集 (https://huggingface.co/collections?paper=2604.14268)

相似文章

tencent/HY-World-2.0

Hugging Face Models Trending

HY-World 2.0 是腾讯开源的跨模态3D世界模型,能够从文本、图像和视频中重建和生成3D世界,生成可编辑的3D资产(网格/高斯泼溅),效果与闭源方法相当。

DreamX-World 1.0: 通用交互式世界模型

Hugging Face Daily Papers

DreamX-World 1.0 是一个通用的交互式文本/图像到视频世界模型,支持相机导航、场景持久化和跨多个领域的可提示事件,利用 E-PRoPE、因果强制和记忆条件场景持久化等新技术实现可控的长时程生成。