CLIP在区域性地理定位中学到了什么?适配后视觉线索与场景配置的探究
摘要
本文研究了将CLIP适配用于区域性地理定位,发现通过利用完整的场景配置而非粗糙的地理线索,编码器适配提高了准确性。
查看缓存全文
缓存时间: 2026/08/25 04:24
# CLIP在区域地理定位中学到了什么?适配后的视觉线索与场景配置探究 来源:https://arxiv.org/html/2608.21761 作者:Yeonsoo Park(单位:USC IMSC San Francisco, USA;邮箱:[email protected]),Abdullah Alfarrarjeh(单位:German Jordanian University Amman, Jordan;邮箱:[email protected]),Seon Ho Kim(*通讯作者,单位:Integrated Media Systems Center (IMSC), University of Southern California Los Angeles, USA;邮箱:[email protected]) ###### 摘要 大量的街景图像为城市环境提供了丰富的视觉信息,但从中提取细粒度的地理信息仍然具有挑战性。特别是,细粒度的区域地理定位很困难,因为邻近区域通常共享粗略的地理线索。我们在一个大都市区域内研究区域地理定位,并探究预训练的CLIP特征是否足以进行区域区分,以及适配后哪些视觉信息支撑了性能的提升。我们使用来自大洛杉矶地区八个区域的9,085张街景图像,比较了零样本CLIP、冻结编码器读数、部分编码器更新、低秩适配(LoRA)和完全微调。冻结读数的性能接近39.03%的零样本准确率,而编码器适配则达到了75.94%–82.10%。完全微调还将到预测区域中心的平均距离从12.30公里减少到3.86公里。我们通过语义线索移除、使用边缘图和模糊进行的外观简化,以及使用图块打乱进行的场景配置破坏来探究这些性能增益。适配模型在边缘和模糊图像上达到了更高的准确率,并且在图块打乱后改变了42.92%–45.56%的预测,而冻结方法的变化率为10.79%–14.60%。然而,适配并未提高外观简化后性能保留的比例,同时植被和天空仍然具有重要影响。Caltech101的对照实验进一步表明,对打乱的敏感性并非地理定位所独有。总体而言,编码器适配显著提高了邻近区域的区分能力,并与对完整场景配置更高的敏感性相关,但没有证据表明仅粗略结构就足以用于预测。这些结论涉及的是已知位置附近视角的变化,而非地理上分离的泛化能力。 ###### 索引术语: 视觉地理定位、CLIP适配、区域地理定位、场景配置、视觉干预、视觉-语言模型 参考标题图1:研究设计与动机问题。我们首先评估在CLIP适配程度递增下的区域地理定位。性能比较促使我们分析与适配相关的视觉信息。互补的干预措施测量了特定线索的依赖性、外观简化后保留的信息以及对布局破坏的敏感性。其综合解释同时考虑了场景配置敏感性和外观线索依赖性。 ## I 引言 视觉地理定位旨在从图像的视觉内容推断其拍摄地点。这一能力在图像组织、导航、地理信息检索以及大规模视觉数据分析等应用中非常有用。现有方法以多种方式构建该问题,包括图像检索、坐标估计和地理分类[11 (https://arxiv.org/html/2608.21761#bib.bib4), 23 (https://arxiv.org/html/2608.21761#bib.bib5), 22 (https://arxiv.org/html/2608.21761#bib.bib8)]。例如,PlaNet将世界划分为自适应的地理单元,并预测与输入图像相关的单元[25 (https://arxiv.org/html/2608.21761#bib.bib3)]。最近,预训练的视觉-语言模型通过文本地表示地理概念提供了一种灵活的替代方案。基于CLIP的方法,如StreetCLIP、GeoCLIP、PIGEON和AddressCLIP,在多种地理尺度上展示了有前景的地理定位性能[19 (https://arxiv.org/html/2608.21761#bib.bib1), 9 (https://arxiv.org/html/2608.21761#bib.bib7), 22 (https://arxiv.org/html/2608.21761#bib.bib8), 10 (https://arxiv.org/html/2608.21761#bib.bib9), 27 (https://arxiv.org/html/2608.21761#bib.bib10)]。 尽管取得了这些进展,但在广泛地理区域的成功地理定位并不一定意味着模型能够以高精度区分邻近地点。在大尺度上,地点可能通过相对显著的视觉线索区分,例如图像中的语言、与气候相关的特征(如天空和植被)、道路系统或街道层面的建筑风格。当候选地点位于同一都市区内时,这些线索可能变得不那么独特。邻近区域通常共享许多相同的视觉特征,迫使模型依赖于更微妙的局部线索组合。因此,理解预训练表征是否包含足够信息进行此类细粒度区分——如果不足,模型通过适配学习了哪些额外信息——对于刻画现代地理定位系统的能力非常重要。 我们通过*区域地理定位*来研究这一设定,我们将其定义为在单个大都市区域内选定区域之间的分类。我们关注大洛杉矶地区,那里的邻近区域共享许多广泛的地理特征,同时在街景外观、植被、城市形态和其他局部视觉模式方面仍表现出差异。我们的基准数据集包含八个类别,涵盖市政当局、社区和行政区,我们统称为区域。这些区域旨在为细粒度地理区分提供一个聚焦的测试平台;它们并不覆盖整个洛杉矶,也不应被解释为代表所有城市或都市环境。 这一设定引出了我们的第一个问题:细粒度的区域信息是否已经可以从预训练的CLIP表征中获取,还是需要修改图像编码器才能提取?为回答这个问题,我们比较了对预训练模型进行不同程度修改的适配策略。这些包括零样本CLIP、冻结编码器文本得分(LP-T)和线性分类器(LP-C)读数、对最终编码器块的部分更新(Partial Update)、LoRA[14 (https://arxiv.org/html/2608.21761#bib.bib14)]和完全微调(Full-FT)。这种梯度使我们能够区分仅学习新输出映射的方法和修改视觉表征本身的方法。我们观察到这两种模式之间存在显著差异:冻结读数接近零样本基线,而编码器级适配将准确率从39.03%提高到高达82.10%。因此,在我们的设定中,强大的区域区分能力主要是在允许预训练视觉表征适配时才出现。 编码器适配带来的巨大提升引出了第二个互补的问题:适配后哪些视觉信息变得更加重要?高分类准确率本身并不能揭示模型如何区分邻近区域。街景包含许多潜在的信息信号,从单个对象和环境特征到场景元素的总体排列。例如,两个区域可能包含相似的车辆、植被、建筑和道路,但这些元素通常共同出现的方式不同。因此,我们研究适配是否主要改变了模型对特定视觉线索、精细外观信息还是更广泛的场景配置的敏感性。 为了使这个问题在实验上可行,我们使用受控干预来选择性地改变不同形式的视觉信息。我们移除文本、车辆、植被和天空,作为互补且语义可解释的线索,这些线索在八个区域中的普遍程度不同,移除它们可以在很大程度上保留周围场景。我们没有单独移除定义更大场景的组成部分(如道路和建筑),因为这将需要大量的修复工作,并可能显著改变场景几何。此外,边缘和模糊变换在保留场景粗略组织的部分的同时减少了精细外观信息,而图块打乱则保留了局部图像内容但破坏了其全局排列。这里,我们使用*空间结构*时采用了刻意限定的含义:图像内视觉元素的粗略组织和相对分布,而非三维几何、符号空间关系或一般空间推理。 这些干预提供了模型行为的互补视角。线索移除测量对特定语义元素的依赖;边缘和模糊输入测试在详细外观减少时仍保留多少预测信息;图块打乱测试预测是否依赖于局部内容的完整排列。我们使用准确率以及两种归一化的行为度量来总结这些效应。*保留率*,定义为变换后的准确率除以原始准确率,衡量干预后保留了多少性能;而*预测变化率*衡量预测标签改变的样本比例。我们使用外观简化下的保留率来检查粗略结构信息是否足以支撑预测,使用打乱下的变化率来检查对场景配置的敏感性。图1 (https://arxiv.org/html/2608.21761#S0.F1)总结了整体实验设计。 我们的结果揭示了对结构敏感性与结构充分性之间的重要区别。编码器适配后,模型在边缘和模糊变换的图像上达到了更高的绝对准确率,并且在图块打乱时更频繁地改变其预测。然而,一旦详细外观被移除,它们并未保留更大比例的原始性能。与此同时,环境外观线索,如植被和天空,仍然具有重要影响。匹配的Caltech101对照实验进一步表明,对打乱的敏感性并非地理定位所独有,因为破坏空间排列也会影响通用物体识别。综合来看,这些观察表明,适配使区域预测更依赖于完整的场景配置,但并未使结构信息单独变得足以进行准确预测。相反,适配模型似乎受益于场景配置和基于外观线索的结合。 我们的结论有意限定于本文考虑的评估环境。特别是,训练集和测试集包含相同坐标和邻近视角的图像。因此,实验测量的是对已知位置附近视角变化的鲁棒性,而非对地理上分离、先前未见区域的泛化能力。在此范围内,本研究使用区域地理定位作为受控环境,不仅研究CLIP是否能适配以区分视觉上相似的邻近地点,还研究支持其预测的视觉证据在适配后如何变化。 我们做出了三个主要贡献。 - •我们确立了在评估的大洛杉矶环境中,冻结读数方法与编码器级适配在细粒度区域地理定位上的显著性能差距。 - •我们开发了一种互补的基于干预的分析方法,使用语义线索移除、外观简化和布局破坏,结合准确率、保留率和预测变化率,来区分对场景结构的敏感性与该结构的充分性。 - •我们表明,编码器适配与对完整场景配置更高的敏感性相关,但没有证据表明结构信息单独变得足够;环境和基于外观的线索对区域预测仍然重要。 更广泛地说,这项工作将细粒度的地理预测与表征适配的研究联系起来。我们并非将提高准确率视为终点,而是使用受控干预来探究哪些信息伴随着这些增益,以及当该信息被破坏时模型行为如何改变。第二节回顾了相关工作。第三节至第五节分别描述了区域地理定位任务、适配方法和探针协议。第六节至第九节呈现了实验结果、讨论、局限性和结论。 ## II 相关工作 ### II-A 视觉地理定位 视觉地理定位使用分类、检索、坐标预测或它们的组合。PlaNet在地理单元上学习分类器[25 (https://arxiv.org/html/2608.21761#bib.bib3)];Deep Img2GPS结合了分类特征与检索和密度估计[23 (https://arxiv.org/html/2608.21761#bib.bib5)];以数据为中心的工作研究了图像场景定位[1 (https://arxiv.org/html/2608.21761#bib.bib6)]。OSV-5M强调全球覆盖和严格的地理训练-测试分离[2 (https://arxiv.org/html/2608.21761#bib.bib11)]。我们独立收集的洛杉矶数据集未使用OSV-5M图像;OSV-5M则提供了地理分离的方法论先例。 ### II-B 用于地理定位的CLIP适配 CLIP提供了可迁移的图像-文本表征[19 (https://arxiv.org/html/2608.21761#bib.bib1)]。StreetCLIP研究了开放域零样本地理定位[9 (https://arxiv.org/html/2608.21761#bib.bib7)];GeoCLIP将图像与连续的GPS表征对齐[22 (https://arxiv.org/html/2608.21761#bib.bib8)];PIGEON结合了语义地理单元、对比预训练和检索优化[10 (https://arxiv.org/html/2608.21761#bib.bib9)];AddressCLIP研究了城市范围的地址预测[27 (https://arxiv.org/html/2608.21761#bib.bib10)]。这些工作确立了基于CLIP的地理预测。我们的重点不是一个新的城市规模应用,而是受控干预下与适配增益相关的视觉信息;预测性能本身并不能识别该信息。 ### II-C 探究对象关系与空间排列 下游准确率本身并不意味着关系理解。Attribution, Relation, and Order (ARO) 基准探究属性、关系和词序[28 (https://arxiv.org/html/2608.21761#bib.bib12)],而SpatialCLIP则针对更广泛的三维启发式空间理解[24 (https://arxiv.org/html/2608.21761#bib.bib13)]。我们的干预仅测试粗略的场景配置敏感性和特定外观线索依赖性;没有单一的破坏能建立一般的空间推理能力。这促使我们采用一个受控环境,在其中可以共同检验适配和预测敏感性。 ## III 任务与数据集 ### III-A 洛杉矶特定数据集与操作定义 我们通过Google Maps API构建了一个洛杉矶街景数据集;它并非源自OSV-5M[2 (https://arxiv.org/html/2608.21761#bib.bib11)]。令 \(\mathcal{D}=\{(x_i, y_i, g_i)\}_{i=1}^{N_{\mathcal{D}}}\) 包含图像 \(x_i\),K=8个区域标签 \(y_i\),以及坐标 \(g_i\),其中 \(N_{\mathcal{D}}=9,085\)。类别包括洛杉矶市中心、帕萨迪纳、比佛利山庄、圣莫尼卡、好莱坞、长滩、威尼斯海滩和韩国城。其中四个是建制市,其他是公认的社区或行政区;我们将它们统称为区域,并将任务表述为大洛杉矶地区的子区域分类。 图2 (https://arxiv.org/html/2608.21761#S3.F2)总结了...
相似文章
多模态视觉语言模型中的人类区域适应性
本文介绍了人类区域适应性,这是一种优化视觉语言模型以适应特定区域情境同时保持全局泛化能力的范式。作者提出了GG-EZ,一种利用区域数据过滤和模型合并的适应方法,在三种视觉语言架构上为东南亚地区展示了5-15%的文化相关性提升。
OSMGraphCLIP:从OpenStreetMap图学习全局位置表示
OSMGraphCLIP是一种模型,它使用基于图的编码器和与球谐位置编码器的对比对齐,从OpenStreetMap数据中学习全局位置嵌入。该模型在多种地理空间任务中表现出色,通常能够达到甚至超越基于卫星的方法。
CLIP:连接文本与图像
CLIP 是 OpenAI 的视觉语言模型,从互联网上的文本-图像对中学习,实现零样本视觉分类,无需任务特定的训练数据。它通过减少对昂贵标注数据集的依赖并提高现实世界泛化能力,解决了传统计算机视觉的主要局限性。
视觉世界实验中的注视行为可用现成的语言-视觉编码器建模
本文提出使用现成的CLIP风格多模态编码器,结合双模态归因方法来预测视觉世界实验中的注视行为,无需微调即可成功复现一项关于人类预测加工的开创性研究。
CLAM: Causal Spatial Disaggregation to Infer Local Effects From Coarse Data
This paper introduces CLAM, a method for estimating localized causal effects from coarse-resolution data by jointly learning causal mechanisms and a disaggregation mapping, with applications in public health and environmental policy.