Lucida:组合式真实到模拟场景建模的解析、生成与放置
摘要
Lucida提出了一种用于组合式室内场景重建的方法,该方法通过解析、生成和放置分配需求,利用VLM策略从杂乱的捕获中创建高保真、可编辑的副本。
查看缓存全文
缓存时间: 2026/09/01 11:51
论文页面 - Lucida:面向可组合现实到仿真场景建模的解析、生成与放置方法
来源:https://huggingface.co/papers/2608.30821
摘要
Lucida 通过将流程需求分配至解析、资产生成和 VLM 引导放置环节,提升了可组合室内场景重建的质量,能够从杂乱的捕获数据中生成高保真、可编辑的场景复制品。
可组合场景建模旨在将真实室内场景恢复为完整、可编辑的对象资产,并按观察到的布局进行排列,从而为机器人仿真和具身 AI 提供一个可操作仿真就绪的真实环境复制品,其物体可单独操控。现有流程将任务分解为三个步骤——将观察结果解析为实例、为每个实例生成资产、以及将每个资产放回原处——但每一步都假设了杂乱捕获数据很少能提供的输入:精确的实例几何信息、无遮挡视角,以及与观察结果精确匹配的资产。我们提出了 Lucida,它保留了这一顺序但重新分配了需求,使得每一步仅消耗真实捕获数据可可靠提供的信息,精度在流程末端达到,而非在开始时就被要求。Lucida 将视频解析为场景图(https://huggingface.co/papers?q=scene%20graph),其节点携带每个实例的多视角证据(https://huggingface.co/papers?q=multi-view%20evidence),根据其证据为每个实例生成完整资产,并使用 GizmoAct(https://huggingface.co/papers?q=GizmoAct)进行资产放置——这是一种 VLM 策略(https://huggingface.co/papers?q=VLM%20policy),将放置过程建模为多轮 GUI 交互(https://huggingface.co/papers?q=multi-turn%20GUI%20interaction),在闭环中操作物体的 Gizmo,并自行决定何时对齐完成。在场景级 3D 物体检测(https://huggingface.co/papers?q=3D%20object%20detection)、物体位姿估计(https://huggingface.co/papers?q=object%20pose%20estimation)和场景重建(https://huggingface.co/papers?q=scene%20reconstruction)方面,Lucida 在 R2S-Scene 数据集上相比 Boxer 将 mAP 提升了 69%,在 CA-1M 数据集上将 ADD-SB(https://huggingface.co/papers?q=ADD-SB)@0.05 从 57.8% 提高到 83.4%,并将场景 F-Score(https://huggingface.co/papers?q=F-Score)从 SAM3D 的 0.794 提升至 0.924。
查看 arXiv 页面 (https://arxiv.org/abs/2608.30821) 查看 PDF (https://arxiv.org/pdf/2608.30821) 项目页面 (https://lucida-r2s.github.io/) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.30821)
引用此论文的模型 0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.30821 以从此页面链接它。
引用此论文的数据集 0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.30821 以从此页面链接它。
引用此论文的 Space 0
无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.30821 以从此页面链接它。
包含此论文的收藏集 0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
SceneMosaic:通过混合代理布局演化实现高效多样的仿真就绪场景生成
SceneMosaic结合了学习的图像先验与视觉语言代理,高效生成多样且物理有效的室内场景,相较于现有方法实现了24倍加速和物理有效性的提升。
Code-as-Room:通过代理代码合成从俯视图图像生成3D房间
一种名为Code-as-Room的新型基于MLLM的代理框架,通过将俯视图图像转换为可执行的Blender代码,利用带有跨阶段记忆的结构化执行引擎来维持上下文,从而生成3D室内房间。
Roomer:面向3D室内布局合成的反思式对象锚定模型编辑与修复
Roomer是一个反思式修复框架,用于识别和修复3D室内布局中的局部违规,它使用视觉语言模型规划器和确定性求解器,并引入了新的基准Roomer-CC和Roomer-Eval。
SimFoundry:模块化与自动化场景生成用于策略学习与评估
SimFoundry 是一个模块化系统,可从视频自动化真实到仿真场景构建,生成数字孪生体并保留功能属性的变体,用于零样本机器人策略训练,实现了向真实世界任务的强迁移和高仿真到真实性能预测。
将3D生成模型用于自回归布局生成
LaviGen是一个框架,它重用3D生成模型进行自回归3D布局生成,使用改进的3D扩散模型和dual-guidance self-rollout蒸馏机制,在LayoutVLM基准上实现了比最先进方法高19%的物理合理性和快65%的计算速度。