Roomer:面向3D室内布局合成的反思式对象锚定模型编辑与修复

Hugging Face Daily Papers 论文

摘要

Roomer是一个反思式修复框架,用于识别和修复3D室内布局中的局部违规,它使用视觉语言模型规划器和确定性求解器,并引入了新的基准Roomer-CC和Roomer-Eval。

现有的室内布局生成器生成的布局整体上看似合理,但仍可能保留局部违规问题,例如碰撞、越界放置、开口被遮挡以及流通受阻。以往的大多数工作侧重于全场景合成或场景级优化,而在识别责任对象和局部修复受影响区域方面的支持有限。我们提出了Roomer,一个反思式修复框架,将这些违规问题视为稀疏的、基于对象的修复问题。Roomer将布局编码为``RoState'',并使用``RoReview''将测量到的违规与相关对象绑定。一个基于几何条件的视觉语言模型规划器提出结构化的局部编辑,而一个确定性求解器对其进行验证,并在需要时生成有限数量的候选编辑。只有全场景验证确认候选编辑能够解决目标违规且不引入新的硬性违规或破坏受保护约束时,该候选才会被采纳。我们在Roomer-CC上训练规划器,这是一个受控损坏数据集,将错误布局与基于对象的违规证据及已知可行的逆向StatePatches配对。由于现有基准很少评估物理有效布局是否可用,我们引入了Roomer-Eval来评估分布质量、物理有效性和实际可用性。实验表明,Roomer在保留有效区域的同时修复残留违规,提升了物理有效性和可用性,并且能够跨外部生成器迁移。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - Roomer: 反思性对象接地模型编辑与修复,用于3D室内布局合成

来源: https://huggingface.co/papers/2608.01973 作者:

,

,

,

,

,

,

,

,

, ,

,

摘要

现有的室内布局生成器能够生成整体上合理的布局,但仍可能保留局部违规行为,例如碰撞、超出边界放置、开口受阻和流通被阻断。大多数先前的工作侧重于全场景合成或场景级优化,对于识别责任对象和局部修复受影响区域的支持有限。我们提出了 Roomer,一个反思性修复框架,将这些违规行为视为稀疏的、对象接地的修复问题。Roomer 将布局编码为 ``RoState’‘,并使用 ``RoReview’’ 将测得的违规行为与相关对象绑定。一个几何条件化的视觉-语言模型规划器提出结构化的局部编辑,而一个确定性求解器对其进行验证,并在需要时生成有限的一组候选编辑。只有当全场景验证确认该候选编辑能够解决目标违规行为且不产生新的硬违规或破坏受保护约束时,该候选编辑才会被提交。我们在 Roomer-CC 上训练规划器,这是一个受控破坏数据集,将故障布局与对象接地的违规证据和已知可行的逆状态补丁配对。由于现有基准很少评估物理有效布局是否可用,我们引入了 Roomer-Eval 来评估分布质量、物理有效性和实际可用性。实验表明,Roomer 修复残余违规行为的同时保留有效区域,改善物理有效性和可用性,并能跨外部生成器迁移。

查看 arXiv 页面 (https://arxiv.org/abs/2608.01973) 查看 PDF (https://arxiv.org/pdf/2608.01973) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01973)

在你的 agent 中获取这篇论文:

hf papers read 2608\.01973

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.01973,即可从本页面链接到它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.01973,即可从本页面链接到它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.01973,即可从本页面链接到它。

包含此论文的集合 1

相似文章

Architect-Ant:可编辑的建筑平面图自动家具布局

arXiv cs.AI

本文提出了Architect-Ant,一个可编辑的建筑平面图自动家具布局框架,以及一个包含270个带家具标注的平面图的精选数据集(AntPlan-270)。该方法使用微调的视觉语言模型和领域特定语言生成几何有效且功能合理的家具布局,并可光栅化为蓝图风格图像。

MirrorWorld:驯服视频扩散模型以生成镜面反射

Hugging Face Daily Papers

MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。

将3D建模与空间推理解耦

arXiv cs.LG

本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。