SceneAligner:基于3D场景的真实世界平面图定位
摘要
介绍SceneAligner,一种用于平面图定位的深度学习方法,利用3D场景重建和跨模态对应学习,在数据有限的真实环境中工作。
查看缓存全文
缓存时间: 2026/05/22 06:34
论文页面 - SceneAligner: 3D-Grounded Floorplan Localization in the Wild
来源:https://huggingface.co/papers/2605.22581
摘要
一种用于平面图定位的深度学习方法,该方法利用3D场景重建和跨模态对应学习,在数据有限的真实环境中工作。
许多公共建筑会提供带有“您在此处“指示的平面图,以帮助访客定位。平面图定位试图通过计算方式重现这一能力,即确定视觉观测是在平面图的哪个位置捕获的。然而,现有方法通常假设受控的小规模环境和精确的矢量化平面图,限制了其在大型建筑和栅格化平面图上的应用能力。在这项工作中,我们提出了一种在野外进行平面图定位的方法,将该任务建立在重建的场景3D表示之上。给定一个不受约束的图像集合,我们的方法重建一个重力对齐的3D场景,并将其投影到二维密度图上,作为平面图代理。然后将平面图定位问题表述为通过二维相似变换将该代理与输入平面图对齐。为了弥合密度图与建筑平面图之间的外观差距,我们适配了一个二维基础模型来学习跨模态对应关系,引入了一种微调方案,在保持结构一致性的同时鼓励语义对齐的匹配。大量实验表明,与先前方法相比,我们的方法有显著改进,即使在仅有单张输入图像的极端稀疏场景下也是如此。我们的代码和数据将公开发布。
查看arXiv页面 (https://arxiv.org/abs/2605.22581) 查看PDF (https://arxiv.org/pdf/2605.22581) 项目页面 (https://cornell-vailab.github.io/SceneAligner) GitHub1 (https://github.com/Cornell-VAILab/SceneAligner) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.22581)
在你的代理中获取这篇论文:
hf papers read 2605.22581
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2605.22581即可从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2605.22581即可从此页面链接。
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2605.22581即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
DoGMA: A Central-Dogma-Guided Foundation Model for Multi-Omics Alignment and Multi-Task Learning in Oncology
DoGMA is a central-dogma-guided foundation model for pan-cancer multi-omics analysis, using a Transformer-MoE architecture with directed attention to align DNA-RNA-protein flows and pretraining via masked hierarchical omics reconstruction. It shows strong performance across cancer representation learning, survival prediction, and metastasis prediction tasks.
@michaelwangelo:今天,我们推出Prodigy Research(YC S26),前沿AI交易研究实验室。我们正在训练世界上最优秀的…
Prodigy Research,一家由YC S26支持的初创公司,宣布推出其前沿AI交易研究实验室,声称要训练一个顶级量化金融基础模型,其表现优于顶级交易员和主要指数。
@casper_hansen_:如果 Muse Spark 1.2 采用 Apache 2.0 许可证,并且确实是一个不靠刷榜的优秀模型,我就会填写道歉表格…
一位用户对 Meta 宣布开源 Muse Glimmer 以及即将推出的 Muse Spark 1.2 做出回应,称如果 Spark 1.2 采用 Apache 2.0 许可证且确实很出色,他就会道歉。
Meta 即将发布其最新基础模型 Muse Spark 1.2 的权重。
Meta 正准备发布其最新基础模型 Muse Spark 1.2 的权重,该模型将可供广泛使用。
Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin
This paper introduces a method to predict middle-layer attention in multimodal LLMs to prune visual tokens efficiently, using question-contrastive teacher selection and cross-modal attention distillation.