WorldAct: 将单体3D世界激活为可交互的以对象为中心的场景
摘要
WorldAct是一个框架,利用多模态智能体和几何重建技术,将静态的3D生成环境转换为可编辑、可交互的以对象为中心的场景,支持对象级编辑和具身任务执行。
查看缓存全文
缓存时间: 2026/05/18 06:24
论文页面 - WorldAct: 将整体3D世界激活为可交互的以对象为中心的场景
来源:https://huggingface.co/papers/2605.15843
摘要
WorldAct框架通过多模态智能体与几何重建技术,将静态生成的3D环境转化为可编辑、可交互的场景。
近期的3D世界建模(https://huggingface.co/papers?q=3D%20world%20modeling)系统基于生成式场景合成(https://huggingface.co/papers?q=generative%20scene%20synthesis)(如Marble),能够创建连贯且可探索的3D环境,但其输出通常是静态的整体资产,编辑性和物理交互能力有限。这限制了它们在沉浸式内容创作和具身模拟(https://huggingface.co/papers?q=embodied%20simulation)中的应用——在这些场景中,生成的世界需要被主动修改和操作。为应对这一挑战,我们提出WorldAct,一个将静态生成的3D世界转换为可编辑且可交互场景的框架。WorldAct使用多模态智能体引导场景分解(https://huggingface.co/papers?q=scene%20decomposition),识别可操作对象(https://huggingface.co/papers?q=actionable%20objects),重建几何对齐的对象级网格(https://huggingface.co/papers?q=object-level%20meshes)以支持交互,并通过3D修补(https://huggingface.co/papers?q=3D%20inpainting)恢复剩余背景。生成的场景支持对象级编辑(https://huggingface.co/papers?q=object-level%20editing)、碰撞感知操控(https://huggingface.co/papers?q=collision-aware%20manipulation)以及具身任务执行,同时保持全局场景的连贯性。实验表明,WorldAct比原始生成场景支持更丰富的交互场景,为可编辑和可交互的3D世界模型提供了一条实用路径。
查看arXiv页面(https://arxiv.org/abs/2605.15843)查看PDF(https://arxiv.org/pdf/2605.15843)项目页面(https://sjtu-deepvisionlab.github.io/WorldAct/)GitHub3(https://github.com/SJTU-DeepVisionLab/WorldAct)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15843)
在你的智能体中获取这篇论文:
hf papers read 2605\.15843
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2605.15843 即可从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.15843 即可从此页面链接。
引用此论文的 Spaces0
没有Space链接到此论文
在Space README.md中引用 arxiv.org/abs/2605.15843 即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
ActWorld:从可探索到可交互的世界模型——基于动作感知记忆
ActWorld提出了一种分块自回归世界模型,具有层次化动作感知记忆,支持物体交互与导航,解决了现有交互世界模型中的数据和记忆瓶颈问题。
Micro-World - 动作控制的交互世界模型 - AMD
AMD 发布了 Micro-World,这是一个基于 Wan2.1 系列构建的动作控制交互世界模型,并提供了开源权重、代码和精心整理的数据集,用于可控世界建模。
WorldCraft:从相机导航到交互式视频世界模型中的物体操控
WorldCraft扩展了交互式视频世界模型,通过专门的控制流水线,在保持相机导航能力的同时实现物体级别的轨迹控制。
SceneCode:用于可编辑室内场景(含铰接物体)的可执行世界程序
SceneCode 将自然语言提示转化为可执行代码,生成可交互、可用于仿真的室内场景(含铰接物体),实现细粒度的可控性与按需资产创建。
HY-World 2.0:用于重建、生成和模拟三维世界的多模态世界模型
HY-World 2.0 是一个多模态世界模型框架,通过全景生成、轨迹规划和场景组合等专用模块,从文本、图像和视频中生成高保真度的三维高斯泼溅场景,在开源方法中实现了最先进的性能。