SceneAligner:基于3D场景的真实世界平面图定位

Hugging Face Daily Papers 论文

摘要

介绍SceneAligner,一种用于平面图定位的深度学习方法,利用3D场景重建和跨模态对应学习,在数据有限的真实环境中工作。

许多公共建筑都提供带有“您在这里”指示的平面图,以帮助访客确定方向。平面图定位旨在通过计算确定视觉观察在平面图内的拍摄位置,从而在计算上复制这一功能。然而,现有方法通常假设受控的小规模环境和精确的矢量化平面图,限制了它们在大型建筑和栅格化平面图中的操作能力。在这项工作中,我们提出了一种在真实场景中进行平面图定位的方法,该方法将任务建立在重建的场景3D表示之上。给定一个无约束的图像集合,我们的方法重建一个重力对齐的3D场景,并将其投影到一个作为平面图代理的2D密度图中。然后,平面图定位被表述为通过2D相似变换将代理与输入平面图对齐。为了弥合密度图与建筑平面图之间的外观差距,我们调整了一个2D基础模型来学习跨模态对应,引入了一种微调方案,该方案在保持结构一致性的同时鼓励语义对齐的匹配。广泛的实验表明,与先前方法相比有显著改进,包括在仅使用单张输入图像的极端稀疏设置中也是如此。我们的代码和数据将公开提供。
查看原文
查看缓存全文

缓存时间: 2026/05/22 06:34

论文页面 - SceneAligner: 3D-Grounded Floorplan Localization in the Wild

来源:https://huggingface.co/papers/2605.22581

摘要

一种用于平面图定位的深度学习方法,该方法利用3D场景重建和跨模态对应学习,在数据有限的真实环境中工作。

许多公共建筑会提供带有“您在此处“指示的平面图,以帮助访客定位。平面图定位试图通过计算方式重现这一能力,即确定视觉观测是在平面图的哪个位置捕获的。然而,现有方法通常假设受控的小规模环境和精确的矢量化平面图,限制了其在大型建筑和栅格化平面图上的应用能力。在这项工作中,我们提出了一种在野外进行平面图定位的方法,将该任务建立在重建的场景3D表示之上。给定一个不受约束的图像集合,我们的方法重建一个重力对齐的3D场景,并将其投影到二维密度图上,作为平面图代理。然后将平面图定位问题表述为通过二维相似变换将该代理与输入平面图对齐。为了弥合密度图与建筑平面图之间的外观差距,我们适配了一个二维基础模型来学习跨模态对应关系,引入了一种微调方案,在保持结构一致性的同时鼓励语义对齐的匹配。大量实验表明,与先前方法相比,我们的方法有显著改进,即使在仅有单张输入图像的极端稀疏场景下也是如此。我们的代码和数据将公开发布。

查看arXiv页面 (https://arxiv.org/abs/2605.22581) 查看PDF (https://arxiv.org/pdf/2605.22581) 项目页面 (https://cornell-vailab.github.io/SceneAligner) GitHub1 (https://github.com/Cornell-VAILab/SceneAligner) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22581)

在你的代理中获取这篇论文:

hf papers read 2605.22581

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2605.22581即可从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2605.22581即可从此页面链接。

引用此论文的Spaces0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2605.22581即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章