HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
摘要
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。
查看缓存全文
缓存时间: 2026/04/20 08:29
论文页面 - HY-World 2.0:用于重建、生成和仿真3D世界的多模态世界模型
来源:https://huggingface.co/papers/2604.14268 发布于 4月15日
#1 当日论文 (https://huggingface.co/papers/date/2026-04-17) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
HY-World 2.0 是一个多模态世界模型框架,利用专用模块进行全景图生成、轨迹规划、世界扩展与合成,并配合增强渲染平台实现交互式3D探索,从而从多种输入生成高保真3D高斯泼溅场景。
我们介绍了 HY-World 2.0,这是一个多模态世界模型 (https://huggingface.co/papers?q=multi-modal%20world%20model) 框架,它推进了我们之前的项目 HY-World 1.0。HY-World 2.0 支持多种输入模态,包括文本提示、单视角图像、多视角图像和视频,并产生3D世界表征 (https://huggingface.co/papers?q=3D%20world%20representations)。对于文本或单视角图像输入,模型执行世界生成,合成高保真、可导航的3D高斯泼溅 (https://huggingface.co/papers?q=3D%20Gaussian%20Splatting) (3DGS) 场景。这通过四阶段方法实现:a) 使用HY-Pano 2.0 (https://huggingface.co/papers?q=HY-Pano%202.0) 进行全景生成,b) 使用WorldNav (https://huggingface.co/papers?q=WorldNav) 进行轨迹规划,c) 使用WorldStereo 2.0 (https://huggingface.co/papers?q=WorldStereo%202.0) 进行世界扩展,d) 使用WorldMirror 2.0 (https://huggingface.co/papers?q=WorldMirror%202.0) 进行世界合成。具体来说,我们引入了关键创新以提升全景保真度,实现3D场景理解与规划,并升级了WorldStereo(我们基于关键帧的视角生成 (https://huggingface.co/papers?q=keyframe-based%20view%20generation) 模型,具有一致记忆)。我们还升级了WorldMirror(一个前馈模型 (https://huggingface.co/papers?q=feed-forward%20model) 用于通用3D预测),通过精炼模型架构和学习策略,实现了从多视角图像或视频进行世界重建。此外,我们引入了WorldLens(一个高性能3DGS渲染平台 (https://huggingface.co/papers?q=rendering%20platform)),具有灵活的引擎无关架构、自动IBL光照、高效碰撞检测以及训练-渲染协同设计,支持带角色功能的3D世界交互探索 (https://huggingface.co/papers?q=interactive%20exploration)。大量实验表明,HY-World 2.0 在多个基准测试中达到开源方法中的最先进性能,其结果可与闭源模型 Marble 相媲美。我们发布所有模型权重、代码和技术细节,以促进可复现性并支持3D世界模型的进一步研究。
查看 arXiv 页面 (https://arxiv.org/abs/2604.14268) 查看 PDF (https://arxiv.org/pdf/2604.14268) 项目页面 (https://3d-models.hunyuan.tencent.com/world/) GitHub 1.3k (https://github.com/Tencent-Hunyuan/HY-World-2.0) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.14268)
在您的agent中获取此论文:
hf papers read 2604\.14268
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2604.14268 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2604.14268 以从此页面链接。
引用此论文的 Spaces 1
包含此论文的收藏集 6
浏览包含此论文的 6 个收藏集 (https://huggingface.co/collections?paper=2604.14268)
相似文章
tencent/HY-World-2.0
HY-World 2.0 是腾讯开源的跨模态3D世界模型,能够从文本、图像和视频中重建和生成3D世界,生成可编辑的3D资产(网格/高斯泼溅),效果与闭源方法相当。
DreamX-World 1.0: 通用交互式世界模型
DreamX-World 1.0 是一个通用的交互式文本/图像到视频世界模型,支持相机导航、场景持久化和跨多个领域的可提示事件,利用 E-PRoPE、因果强制和记忆条件场景持久化等新技术实现可控的长时程生成。
SimWorlds:用于动态3D场景创作的多智能体系统
SimWorlds是一个多智能体框架,能够通过自然语言生成动态、可编辑的4D场景。它利用Blender特定的程序化知识以及规划-编码-审查工作流,性能优于先前基线。
MoVerse: 实时视频世界建模与全景高斯脚手架
MoVerse 通过创建360°全景图和3D高斯脚手架,从单张图像生成实时交互式视频,利用基于扩散的技术实现高效渲染。
WorldAct: 将单体3D世界激活为可交互的以对象为中心的场景
WorldAct是一个框架,利用多模态智能体和几何重建技术,将静态的3D生成环境转换为可编辑、可交互的以对象为中心的场景,支持对象级编辑和具身任务执行。