Lucida:组合式真实到模拟场景建模的解析、生成与放置

Hugging Face Daily Papers 论文

摘要

Lucida提出了一种用于组合式室内场景重建的方法,该方法通过解析、生成和放置分配需求,利用VLM策略从杂乱的捕获中创建高保真、可编辑的副本。

组合式场景建模旨在将真实室内场景恢复为完整的、可编辑的对象资产,按照观察到的排列方式,为机器人仿真和具身AI提供真实环境的仿真就绪副本,其对象可单独操作。现有管道将任务分解为三个步骤——将观察解析为实例、为每个实例生成资产,并将每个资产放回——但每个步骤都假设一个杂乱捕获很少提供的输入:准确的实例几何、无遮挡视图以及与观察精确匹配的资产。我们提出Lucida,它保持此顺序但重新分配需求,因此每个步骤只消耗真实捕获可靠提供的内容,精度在管道结束时达到,而非在开始时要求。Lucida将视频解析为场景图,其节点携带每个实例的多视图证据,从每个实例的证据生成完整资产,并使用GizmoAct放置资产,这是一种VLM策略,将放置视为多轮GUI交互,在闭环中操纵对象的gizmo,并自行决定何时达到对齐。在场景级3D对象检测、对象姿态估计和场景重建方面,Lucida在R2S-Scene上将mAP比Boxer提高了69%,在CA-1M上将[email protected]从57.8%提升至83.4%,并将场景F-Score从SAM3D的0.794增加到0.924。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:51

论文页面 - Lucida:面向可组合现实到仿真场景建模的解析、生成与放置方法

来源:https://huggingface.co/papers/2608.30821

摘要

Lucida 通过将流程需求分配至解析、资产生成和 VLM 引导放置环节,提升了可组合室内场景重建的质量,能够从杂乱的捕获数据中生成高保真、可编辑的场景复制品。

可组合场景建模旨在将真实室内场景恢复为完整、可编辑的对象资产,并按观察到的布局进行排列,从而为机器人仿真和具身 AI 提供一个可操作仿真就绪的真实环境复制品,其物体可单独操控。现有流程将任务分解为三个步骤——将观察结果解析为实例、为每个实例生成资产、以及将每个资产放回原处——但每一步都假设了杂乱捕获数据很少能提供的输入:精确的实例几何信息、无遮挡视角,以及与观察结果精确匹配的资产。我们提出了 Lucida,它保留了这一顺序但重新分配了需求,使得每一步仅消耗真实捕获数据可可靠提供的信息,精度在流程末端达到,而非在开始时就被要求。Lucida 将视频解析为场景图(https://huggingface.co/papers?q=scene%20graph),其节点携带每个实例的多视角证据(https://huggingface.co/papers?q=multi-view%20evidence),根据其证据为每个实例生成完整资产,并使用 GizmoAct(https://huggingface.co/papers?q=GizmoAct)进行资产放置——这是一种 VLM 策略(https://huggingface.co/papers?q=VLM%20policy),将放置过程建模为多轮 GUI 交互(https://huggingface.co/papers?q=multi-turn%20GUI%20interaction),在闭环中操作物体的 Gizmo,并自行决定何时对齐完成。在场景级 3D 物体检测(https://huggingface.co/papers?q=3D%20object%20detection)、物体位姿估计(https://huggingface.co/papers?q=object%20pose%20estimation)和场景重建(https://huggingface.co/papers?q=scene%20reconstruction)方面,Lucida 在 R2S-Scene 数据集上相比 Boxer 将 mAP 提升了 69%,在 CA-1M 数据集上将 ADD-SB(https://huggingface.co/papers?q=ADD-SB)@0.05 从 57.8% 提高到 83.4%,并将场景 F-Score(https://huggingface.co/papers?q=F-Score)从 SAM3D 的 0.794 提升至 0.924。

查看 arXiv 页面 (https://arxiv.org/abs/2608.30821) 查看 PDF (https://arxiv.org/pdf/2608.30821) 项目页面 (https://lucida-r2s.github.io/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.30821)

引用此论文的模型 0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.30821 以从此页面链接它。

引用此论文的数据集 0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.30821 以从此页面链接它。

引用此论文的 Space 0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.30821 以从此页面链接它。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

将3D生成模型用于自回归布局生成

Hugging Face Daily Papers

LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。