CIPER: 跨视图图像检索与姿态估计的统一框架

Hugging Face Daily Papers 论文

摘要

CIPER是一个统一的Transformer框架,能够联合执行城市级跨视图图像检索和精确的三自由度(3-DoF)姿态估计,克服了级联管道的局限性。

跨视图地理定位通过将地面图像与航拍图像数据库进行匹配来估计地面图像的地理位置。现有方法要么通过大规模检索,要么通过精确姿态估计来处理这一问题,但无法同时做到两者:基于检索的方法能以降低定位精度为代价实现大范围搜索,而姿态估计方法仅能在狭窄的搜索空间内实现高精度。简单地将这些流程级联起来会导致误差传播和特征表示不一致。我们将跨视图地理定位视为一个统一问题,要求同时实现城市级检索和精确的三自由度(3-DoF)姿态估计。我们提出了CIPER(Cross-view Image-retrieval and Pose-estimation transformER),一种单一架构,通过相互有益的特征学习联合执行这两项任务。CIPER使用共享的Transformer编码器和任务特定的令牌(token),将全局检索特征与空间定位线索分离。为了弥合地面与航拍视图之间巨大的领域差距,我们引入了一个双向Transformer姿态解码器,该解码器利用地面特征作为空间查询进行双向交叉注意力。集合预测策略进一步在统一的多任务目标下实现了稳定的三自由度回归。在VIGOR、KITTI和Ford Multi-AV上的实验展示了其竞争性性能,尤其是在受限视场和任意方向条件下。代码可在 https://github.com/yurimjeon1892/CIPER 获取。
查看原文
查看缓存全文

缓存时间: 2026/06/09 12:41

论文页面 - CIPER: 跨视角图像检索与姿态估计的统一框架

来源:https://huggingface.co/papers/2606.05011

摘要

CIPER 是一个统一的跨视角地理定位框架,能够同时执行城市级检索和精确的三自由度姿态估计,其核心是共享的 Transformer 编码器和双向姿态解码器。

跨视角地理定位(https://huggingface.co/papers?q=Cross-view%20geo-localization)通过将地面图像与航拍图像数据库进行匹配来估计其地理位置。现有方法要么进行大规模检索(https://huggingface.co/papers?q=large-scale%20retrieval),要么进行精确姿态估计(https://huggingface.co/papers?q=precise%20pose%20estimation),但无法同时兼顾两者:基于检索的方法能够实现大范围搜索,但牺牲了定位精度;而姿态估计方法仅在狭窄的搜索空间内达到高精度。简单地将这些流程级联会导致误差传播和特征表示不一致。我们将跨视角地理定位(https://huggingface.co/papers?q=cross-view%20geo-localization)形式化为一个统一问题,要求同时实现城市级检索和精确的三自由度姿态估计。为此,我们提出了 CIPER(跨视角图像检索与姿态估计 Transformer),这是一种单一的架构,通过互利特征学习联合执行两项任务。CIPER 使用共享的 Transformer 编码器(https://huggingface.co/papers?q=transformer%20encoder)和任务特定标记(https://huggingface.co/papers?q=task-specific%20tokens)来解耦全局检索特征与空间定位线索。为了弥合地面视角与航拍视角之间的巨大领域差距,我们引入了一个双向 Transformer 姿态解码器(https://huggingface.co/papers?q=two-way%20transformer%20pose%20decoder),它利用地面特征作为空间查询进行双向交叉注意力(https://huggingface.co/papers?q=cross-attention)计算。此外,一种集合预测策略(https://huggingface.co/papers?q=set%20prediction%20strategy)进一步实现了在统一多任务目标(https://huggingface.co/papers?q=multi-task%20objective)下的稳定三自由度回归。在 VIGOR、KITTI 和 Ford Multi-AV 数据集上的实验展示了其竞争力的性能,尤其是在有限视场角和任意朝向条件下。代码已开源:https://github.com/yurimjeon1892/CIPER。

查看 arXiv 页面(https://arxiv.org/abs/2606.05011)查看 PDF(https://arxiv.org/pdf/2606.05011)GitHub 0(https://github.com/yurimjeon1892/CIPER)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05011)

在您的 agent 中获取本文:

hf papers read 2606.05011

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型 0

暂无模型关联本文

请在模型 README.md 中引用 arxiv.org/abs/2606.05011 以在此页面建立链接。

引用本文的数据集 0

暂无数据集关联本文

请在数据集 README.md 中引用 arxiv.org/abs/2606.05011 以在此页面建立链接。

引用本文的 Spaces 0

暂无 Space 关联本文

请在 Space README.md 中引用 arxiv.org/abs/2606.05011 以在此页面建立链接。

包含本文的收藏 0

暂无收藏包含本文

请将本文添加到一个收藏(https://huggingface.co/new-collection)中以在此页面建立链接。

相似文章

基于多视角基础模型的统一全景几何估计

Hugging Face Daily Papers

PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。

CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖

Hugging Face Daily Papers

本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。