Mira-Scene:用于生成式三维场景的像素对齐布局
摘要
Mira-Scene 引入了一个组合式三维场景重建框架,使用像素对齐的规范坐标图进行精确的对象布局,在布局精度上相较于现有方法实现了显著提升。
查看缓存全文
缓存时间: 2026/09/22 07:25
论文页面 - Mira-Scene:基于像素对齐布局的生成式三维场景
来源:https://huggingface.co/papers/2609.23796
摘要
单张图像的三维物体生成现已能产出高保真资产,然而将这些资产精确地放置到连贯的场景布局中,仍然是一个悬而未决的挑战。其核心难点在于物体布局的表征方式。整体性方法将放置问题融入场景级生成过程中,牺牲了物体级细节。组合式方法通过解耦几何与布局来保持物体保真度,但通常将布局参数化为稀疏、无界的位姿变量,这既难以学习,在场景级监督稀疏的情况下泛化能力也很差。我们提出了 Mira-Scene,一个组合式三维场景重建框架,它用稠密、有界的对应关系恢复替代了稀疏的位姿回归。其核心是规范坐标映射(Canonical Coordinate Map,CCM),一个像素对齐的场,将每个可见物体像素映射到其物体有界规范空间中的表面坐标。当与来自单目几何估计的场景空间点云映射(Scene-space PointCloud Map,PCM)配对时,CCM 可诱导出稠密的规范-场景对应关系,通过鲁棒的几何对齐从中恢复物体变换。由于 CCM 在有界规范空间中操作,它提供了一个稳定、可扩展的预测目标,可以利用可扩展的物体级三维数据进行训练,而无需场景级布局标注。Mira-Scene 进一步引入了一个多模态扩散 Transformer,它联合生成物体几何和 CCM,利用具有共享注意力和位置编码的模态特定专家流,以促进几何-布局的一致性。在室内、室外、合成和野外场景上的实验表明,Mira-Scene 在布局精度上显著优于强基线模型,使用有限的开源训练数据,在 3D-IoU 和 2D-IoU 上分别取得了相对于 SAM3D 的 39.8% 和 16.5% 的相对增益。
查看 arXiv 页面 (https://arxiv.org/abs/2609.23796)查看 PDF (https://arxiv.org/pdf/2609.23796)项目页面 (https://sunyangtian.github.io/Mira-Scene-web/)GitHub 仓库 (https://github.com/VAST-AI-Research/Mira-Scene)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.23796)
在你的智能体中获取这篇论文:
hf papers read 2609.23796
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
暂无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.23796 以从此页面进行链接。
引用此论文的数据集 0
暂无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.23796 以从此页面进行链接。
引用此论文的 Space 0
暂无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.23796 以从此页面进行链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面进行链接。
相似文章
SceneMosaic:通过混合代理布局演化实现高效多样的仿真就绪场景生成
SceneMosaic结合了学习的图像先验与视觉语言代理,高效生成多样且物理有效的室内场景,相较于现有方法实现了24倍加速和物理有效性的提升。
Pixal3D:基于图像的像素对齐3D生成
Pixal3D提出了一种像素对齐的3D生成方法,通过反向投影条件化建立直接的像素到3D对应关系,从而提高保真度,解决了规范空间生成中的问题。
PixWorld:在像素空间中统一3D场景生成与重建
PixWorld提出了一种统一的像素空间扩散方法,用于3D场景重建与生成,通过直接的图像级监督和几何感知特征对齐,克服了潜在空间方法的局限性。该方法优于先前的生成方法,并达到了与最先进的重建方法相当的性能。
Lucida:组合式真实到模拟场景建模的解析、生成与放置
Lucida提出了一种用于组合式室内场景重建的方法,该方法通过解析、生成和放置分配需求,利用VLM策略从杂乱的捕获中创建高保真、可编辑的副本。
HARMONY: 用于单目图像到场景合成的分层代理推理
HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。