Roomer:面向3D室内布局合成的反思式对象锚定模型编辑与修复
摘要
Roomer是一个反思式修复框架,用于识别和修复3D室内布局中的局部违规,它使用视觉语言模型规划器和确定性求解器,并引入了新的基准Roomer-CC和Roomer-Eval。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - Roomer: 反思性对象接地模型编辑与修复,用于3D室内布局合成
来源: https://huggingface.co/papers/2608.01973 作者:
,
,
,
,
,
,
,
,
, ,
,
摘要
现有的室内布局生成器能够生成整体上合理的布局,但仍可能保留局部违规行为,例如碰撞、超出边界放置、开口受阻和流通被阻断。大多数先前的工作侧重于全场景合成或场景级优化,对于识别责任对象和局部修复受影响区域的支持有限。我们提出了 Roomer,一个反思性修复框架,将这些违规行为视为稀疏的、对象接地的修复问题。Roomer 将布局编码为 ``RoState’‘,并使用 ``RoReview’’ 将测得的违规行为与相关对象绑定。一个几何条件化的视觉-语言模型规划器提出结构化的局部编辑,而一个确定性求解器对其进行验证,并在需要时生成有限的一组候选编辑。只有当全场景验证确认该候选编辑能够解决目标违规行为且不产生新的硬违规或破坏受保护约束时,该候选编辑才会被提交。我们在 Roomer-CC 上训练规划器,这是一个受控破坏数据集,将故障布局与对象接地的违规证据和已知可行的逆状态补丁配对。由于现有基准很少评估物理有效布局是否可用,我们引入了 Roomer-Eval 来评估分布质量、物理有效性和实际可用性。实验表明,Roomer 修复残余违规行为的同时保留有效区域,改善物理有效性和可用性,并能跨外部生成器迁移。
查看 arXiv 页面 (https://arxiv.org/abs/2608.01973) 查看 PDF (https://arxiv.org/pdf/2608.01973) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.01973)
在你的 agent 中获取这篇论文:
hf papers read 2608\.01973
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.01973,即可从本页面链接到它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.01973,即可从本页面链接到它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.01973,即可从本页面链接到它。
包含此论文的集合 1
相似文章
Code-as-Room:通过代理代码合成从俯视图图像生成3D房间
一种名为Code-as-Room的新型基于MLLM的代理框架,通过将俯视图图像转换为可执行的Blender代码,利用带有跨阶段记忆的结构化执行引擎来维持上下文,从而生成3D室内房间。
Architect-Ant:可编辑的建筑平面图自动家具布局
本文提出了Architect-Ant,一个可编辑的建筑平面图自动家具布局框架,以及一个包含270个带家具标注的平面图的精选数据集(AntPlan-270)。该方法使用微调的视觉语言模型和领域特定语言生成几何有效且功能合理的家具布局,并可光栅化为蓝图风格图像。
MirrorWorld:驯服视频扩散模型以生成镜面反射
MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。
将3D建模与空间推理解耦
本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。
HRO:基于大型语言模型的零样本物体目标导航层次化房间到物体框架
提出了HRO,一种由大型语言模型驱动的层次化框架,用于零样本物体目标导航,模拟人类从粗到细的空间推理,在Gibson和HM3D数据集上实现了卓越的成功率和泛化能力。