CIPER: 跨视图图像检索与姿态估计的统一框架
摘要
CIPER是一个统一的Transformer框架,能够联合执行城市级跨视图图像检索和精确的三自由度(3-DoF)姿态估计,克服了级联管道的局限性。
查看缓存全文
缓存时间: 2026/06/09 12:41
论文页面 - CIPER: 跨视角图像检索与姿态估计的统一框架
来源:https://huggingface.co/papers/2606.05011
摘要
CIPER 是一个统一的跨视角地理定位框架,能够同时执行城市级检索和精确的三自由度姿态估计,其核心是共享的 Transformer 编码器和双向姿态解码器。
跨视角地理定位(https://huggingface.co/papers?q=Cross-view%20geo-localization)通过将地面图像与航拍图像数据库进行匹配来估计其地理位置。现有方法要么进行大规模检索(https://huggingface.co/papers?q=large-scale%20retrieval),要么进行精确姿态估计(https://huggingface.co/papers?q=precise%20pose%20estimation),但无法同时兼顾两者:基于检索的方法能够实现大范围搜索,但牺牲了定位精度;而姿态估计方法仅在狭窄的搜索空间内达到高精度。简单地将这些流程级联会导致误差传播和特征表示不一致。我们将跨视角地理定位(https://huggingface.co/papers?q=cross-view%20geo-localization)形式化为一个统一问题,要求同时实现城市级检索和精确的三自由度姿态估计。为此,我们提出了 CIPER(跨视角图像检索与姿态估计 Transformer),这是一种单一的架构,通过互利特征学习联合执行两项任务。CIPER 使用共享的 Transformer 编码器(https://huggingface.co/papers?q=transformer%20encoder)和任务特定标记(https://huggingface.co/papers?q=task-specific%20tokens)来解耦全局检索特征与空间定位线索。为了弥合地面视角与航拍视角之间的巨大领域差距,我们引入了一个双向 Transformer 姿态解码器(https://huggingface.co/papers?q=two-way%20transformer%20pose%20decoder),它利用地面特征作为空间查询进行双向交叉注意力(https://huggingface.co/papers?q=cross-attention)计算。此外,一种集合预测策略(https://huggingface.co/papers?q=set%20prediction%20strategy)进一步实现了在统一多任务目标(https://huggingface.co/papers?q=multi-task%20objective)下的稳定三自由度回归。在 VIGOR、KITTI 和 Ford Multi-AV 数据集上的实验展示了其竞争力的性能,尤其是在有限视场角和任意朝向条件下。代码已开源:https://github.com/yurimjeon1892/CIPER。
查看 arXiv 页面(https://arxiv.org/abs/2606.05011)查看 PDF(https://arxiv.org/pdf/2606.05011)GitHub 0(https://github.com/yurimjeon1892/CIPER)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05011)
在您的 agent 中获取本文:
hf papers read 2606.05011
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型 0
暂无模型关联本文
请在模型 README.md 中引用 arxiv.org/abs/2606.05011 以在此页面建立链接。
引用本文的数据集 0
暂无数据集关联本文
请在数据集 README.md 中引用 arxiv.org/abs/2606.05011 以在此页面建立链接。
引用本文的 Spaces 0
暂无 Space 关联本文
请在 Space README.md 中引用 arxiv.org/abs/2606.05011 以在此页面建立链接。
包含本文的收藏 0
暂无收藏包含本文
请将本文添加到一个收藏(https://huggingface.co/new-collection)中以在此页面建立链接。
相似文章
基于多视角基础模型的统一全景几何估计
PaGeR 适配了多视角透视基础模型 Depth Anything 3,利用固定的立方体贴图表示,从单张等距柱状投影图像中预测尺度不变深度、度量深度、表面法线和天空分割,同时保持 VRAM 和运行时间恒定。本文还发布了 ZüriPano 和 PanoInfinigen 数据集。
Scal3R:用于可扩展在线三维重建的高效多相对姿态查询
Scal3R 通过使用带有轻量级令牌和位姿图优化的多参考相对姿态查询,改善了长视频的在线三维重建,减少了漂移并实现了最先进的性能。
CM-EVS:稀疏全景RGB-D位姿数据用于完整场景覆盖
本文提出了COVER,一种无需训练的方法,用于将3D资产转换为具有完整场景覆盖和低冗余度的稀疏全景RGB-D位姿数据,并介绍了包含36,373个来自室内和室外场景的精选帧的CM-EVS数据集。
检索前思考:通过战略规划与自我批评实现鲁棒的零样本组合图像检索
介绍了一种无需训练的零样本组合图像检索框架PEC-CIR,该框架采用Planner-Executor-Critic架构,通过将查询构建组织为多阶段推理流程来提高检索精度。
ReViV:从单目第一人称视频中重建观看者与场景的四维动态
ReViV是一个统一的整体性第一人称4D重建框架,它通过掩码生成式第一人称Transformer,从单目RGB视频中同时重建观看者(身体、手、视线)和场景(深度、相机轨迹)的动态,实现了最先进的准确性和效率。