对应用地球观测中组合图像检索的基准测试

Hugging Face Daily Papers 论文

摘要

本文提出了一个地球观测中组合图像检索的统一基准,评估了视觉-语言骨干网络,并引入了一个以变化为中心的灾害监测数据集(xView2-CIR),强调了与基于属性检索相比的独特挑战。

遥感组合图像检索(RSCIR)能够通过组合参考图像与文本修饰符的查询,在大型卫星图像档案中进行搜索。尽管RSCIR提供了灵活的表达目标检索意图的界面,但现代组合方法在地球观测(EO)图像中的可迁移性及其对实际地球观测工作流的相关性仍未被充分探索。我们通过一个统一基准和面向应用的研究来填补这一空白。首先,我们系统性地调整并评估了六种视觉-语言骨干网络下具有代表性的组合图像检索方法,在PatternCom上采用标准化协议,分析了它们在骨干网络、组合策略和查询类型上的行为。其次,我们引入了xView2-CIR,一个面向灾害与损害监测的以变化为中心的数据集,其中检索基于场景身份和目标事件后状态。我们的结果表明,无需训练的组合方法为地球观测检索提供了强大且可扩展的基线,而以变化为中心的检索呈现出与基于属性检索不同的挑战,特别是在需要保留场景身份方面。总体而言,本研究为RSCIR建立了一个实用基准,并将组合检索定位为遥感图像检索、档案探索和变化分析的补充工具。数据集和代码可在https://github.com/billpsomas/rscir获取。
查看原文
查看缓存全文

缓存时间: 2026/06/01 11:21

论文页面 - 面向地球观测应用的组合图像检索基准测试

来源:https://huggingface.co/papers/2605.24442

摘要

遥感组合图像检索方法在多个视觉-语言骨干网络和一个新的变化中心数据集上进行了评估,证明了它们在地球观测应用中的有效性,同时突出了与传统基于属性的检索相比独特的挑战。

遥感组合图像检索(https://huggingface.co/papers?q=Remote%20sensing%20composed%20image%20retrieval)(RSCIR) 能够利用将参考图像与文本修饰符结合的组合查询,在大型卫星图像档案中进行搜索。尽管 RSCIR 提供了表达目标检索意图的灵活接口,但现代组合方法在地球观测 (EO) 图像上的可迁移性及其与运行中的 EO 工作流程的相关性仍未得到充分探索。我们通过一个统一的基准测试和面向应用的研究来填补这一空白。首先,我们在标准化协议下,系统地调整并评估了六种视觉-语言骨干网络(https://huggingface.co/papers?q=vision-language%20backbones)在 PatternCom(https://huggingface.co/papers?q=PatternCom)上的代表性组合图像检索方法,分析了它们在骨干网络、组合策略和查询类型上的行为。其次,我们引入了 xView2-CIR(https://huggingface.co/papers?q=xView2-CIR),一个面向灾害与损伤监测的变化中心数据集,其中检索以场景身份(https://huggingface.co/papers?q=scene%20identity)和目标事件后状态为条件。我们的结果表明,免训练组合方法为 EO 检索提供了强大且可扩展的基线,而变化中心检索(https://huggingface.co/papers?q=change-centric%20retrieval)与基于属性的检索(https://huggingface.co/papers?q=attribute-based%20retrieval)面临不同的挑战,特别是由于需要保持场景身份(https://huggingface.co/papers?q=scene%20identity)。总体而言,本研究为 RSCIR 建立了一个实用的基准测试,并将组合检索定位为遥感图像检索、档案探索和变化分析的补充工具。数据集和代码可在 https://github.com/billpsomas/rscir 获取。

查看 arXiv 页面(https://arxiv.org/abs/2605.24442)查看 PDF(https://arxiv.org/pdf/2605.24442)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.24442)

在您的代理中获取此论文:

hf papers read 2605\.24442

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到该论文

在模型 README.md 中引用 arxiv.org/abs/2605.24442 以从此页面链接。

引用此论文的数据集0

没有数据集链接到该论文

在数据集 README.md 中引用 arxiv.org/abs/2605.24442 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接到该论文

在 Space README.md 中引用 arxiv.org/abs/2605.24442 以从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。

相似文章

DataComp-VLM:面向视觉语言模型的改进型开放数据集

Hugging Face Daily Papers

本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。