Mira-Scene:用于生成式三维场景的像素对齐布局

Hugging Face Daily Papers 论文

摘要

Mira-Scene 引入了一个组合式三维场景重建框架,使用像素对齐的规范坐标图进行精确的对象布局,在布局精度上相较于现有方法实现了显著提升。

单幅图像的三维对象生成现在能够产生高保真资产,但将其准确放置到连贯的场景布局中仍然是一个未解决的挑战。一个核心难点在于对象布局的表示方式。整体方法将放置吸收到场景级生成过程中,牺牲了对象级别的细节。组合方法通过将几何与布局解耦来保持对象保真度,但通常将布局参数化为稀疏、无界的姿态变量,这些变量难以学习,并且在场景级监督稀缺的情况下泛化能力差。我们提出了Mira-Scene,一个组合式三维场景重建框架,它用密集、有界的对应恢复替代了稀疏姿态回归。其核心是规范坐标图(CCM),一个像素对齐的字段,将每个可见对象像素映射到对象有界规范空间中的表面坐标。当与来自单目几何估计的场景空间点云图(PCM)配对时,CCM诱导出密集的规范到场景对应关系,通过鲁棒的几何对从中恢复对象变换。因为CCM在有界规范空间中操作,它提供了一个稳定的预测目标,可以从可扩展的对象级三维数据中训练,而无需场景级布局标注。Mira-Scene进一步引入了一个多模态扩散变换器,联合生成对象几何和CCM,使用具有共享注意力和位置编码的模态特定专家流来促进几何-布局一致性。在室内、室外、合成和真实场景上的实验表明,Mira-Scene在布局精度上显著优于强基线,使用有限的开源训练数据,在3D-IoU上实现了39.8%的相对增益,在2D-IoU上实现了16.5%的相对增益,相对于SAM3D。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:25

论文页面 - Mira-Scene:基于像素对齐布局的生成式三维场景

来源:https://huggingface.co/papers/2609.23796

摘要

单张图像的三维物体生成现已能产出高保真资产,然而将这些资产精确地放置到连贯的场景布局中,仍然是一个悬而未决的挑战。其核心难点在于物体布局的表征方式。整体性方法将放置问题融入场景级生成过程中,牺牲了物体级细节。组合式方法通过解耦几何与布局来保持物体保真度,但通常将布局参数化为稀疏、无界的位姿变量,这既难以学习,在场景级监督稀疏的情况下泛化能力也很差。我们提出了 Mira-Scene,一个组合式三维场景重建框架,它用稠密、有界的对应关系恢复替代了稀疏的位姿回归。其核心是规范坐标映射(Canonical Coordinate Map,CCM),一个像素对齐的场,将每个可见物体像素映射到其物体有界规范空间中的表面坐标。当与来自单目几何估计的场景空间点云映射(Scene-space PointCloud Map,PCM)配对时,CCM 可诱导出稠密的规范-场景对应关系,通过鲁棒的几何对齐从中恢复物体变换。由于 CCM 在有界规范空间中操作,它提供了一个稳定、可扩展的预测目标,可以利用可扩展的物体级三维数据进行训练,而无需场景级布局标注。Mira-Scene 进一步引入了一个多模态扩散 Transformer,它联合生成物体几何和 CCM,利用具有共享注意力和位置编码的模态特定专家流,以促进几何-布局的一致性。在室内、室外、合成和野外场景上的实验表明,Mira-Scene 在布局精度上显著优于强基线模型,使用有限的开源训练数据,在 3D-IoU 和 2D-IoU 上分别取得了相对于 SAM3D 的 39.8% 和 16.5% 的相对增益。

查看 arXiv 页面 (https://arxiv.org/abs/2609.23796)查看 PDF (https://arxiv.org/pdf/2609.23796)项目页面 (https://sunyangtian.github.io/Mira-Scene-web/)GitHub 仓库 (https://github.com/VAST-AI-Research/Mira-Scene)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23796)

在你的智能体中获取这篇论文:

hf papers read 2609.23796

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.23796 以从此页面进行链接。

引用此论文的数据集 0

暂无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.23796 以从此页面进行链接。

引用此论文的 Space 0

暂无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.23796 以从此页面进行链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面进行链接。

相似文章

Pixal3D:基于图像的像素对齐3D生成

Hugging Face Daily Papers

Pixal3D提出了一种像素对齐的3D生成方法,通过反向投影条件化建立直接的像素到3D对应关系,从而提高保真度,解决了规范空间生成中的问题。

PixWorld:在像素空间中统一3D场景生成与重建

Hugging Face Daily Papers

PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。