对应用地球观测中组合图像检索的基准测试
摘要
本文提出了一个地球观测中组合图像检索的统一基准,评估了视觉-语言骨干网络,并引入了一个以变化为中心的灾害监测数据集(xView2-CIR),强调了与基于属性检索相比的独特挑战。
查看缓存全文
缓存时间: 2026/06/01 11:21
论文页面 - 面向地球观测应用的组合图像检索基准测试
来源:https://huggingface.co/papers/2605.24442
摘要
遥感组合图像检索方法在多个视觉-语言骨干网络和一个新的变化中心数据集上进行了评估,证明了它们在地球观测应用中的有效性,同时突出了与传统基于属性的检索相比独特的挑战。
遥感组合图像检索(https://huggingface.co/papers?q=Remote%20sensing%20composed%20image%20retrieval)(RSCIR) 能够利用将参考图像与文本修饰符结合的组合查询,在大型卫星图像档案中进行搜索。尽管 RSCIR 提供了表达目标检索意图的灵活接口,但现代组合方法在地球观测 (EO) 图像上的可迁移性及其与运行中的 EO 工作流程的相关性仍未得到充分探索。我们通过一个统一的基准测试和面向应用的研究来填补这一空白。首先,我们在标准化协议下,系统地调整并评估了六种视觉-语言骨干网络(https://huggingface.co/papers?q=vision-language%20backbones)在 PatternCom(https://huggingface.co/papers?q=PatternCom)上的代表性组合图像检索方法,分析了它们在骨干网络、组合策略和查询类型上的行为。其次,我们引入了 xView2-CIR(https://huggingface.co/papers?q=xView2-CIR),一个面向灾害与损伤监测的变化中心数据集,其中检索以场景身份(https://huggingface.co/papers?q=scene%20identity)和目标事件后状态为条件。我们的结果表明,免训练组合方法为 EO 检索提供了强大且可扩展的基线,而变化中心检索(https://huggingface.co/papers?q=change-centric%20retrieval)与基于属性的检索(https://huggingface.co/papers?q=attribute-based%20retrieval)面临不同的挑战,特别是由于需要保持场景身份(https://huggingface.co/papers?q=scene%20identity)。总体而言,本研究为 RSCIR 建立了一个实用的基准测试,并将组合检索定位为遥感图像检索、档案探索和变化分析的补充工具。数据集和代码可在 https://github.com/billpsomas/rscir 获取。
查看 arXiv 页面(https://arxiv.org/abs/2605.24442)查看 PDF(https://arxiv.org/pdf/2605.24442)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.24442)
在您的代理中获取此论文:
hf papers read 2605\.24442
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到该论文
在模型 README.md 中引用 arxiv.org/abs/2605.24442 以从此页面链接。
引用此论文的数据集0
没有数据集链接到该论文
在数据集 README.md 中引用 arxiv.org/abs/2605.24442 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接到该论文
在 Space README.md 中引用 arxiv.org/abs/2605.24442 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接。
相似文章
MultiView-Bench:一种面向VLMs的世界中心多视角集成诊断基准
MultiView-Bench是一个诊断基准,用于评估视觉语言模型将多个视角整合为一致3D心智模型的能力,揭示了3D空间推理中的系统性失败,并引入了ViewNavigator以缓解这些问题。
Urban-ImageNet: 大规模多模态数据集与城市空间感知评估框架
Urban-ImageNet是一个大规模多模态数据集和评估基准,用于从社交媒体图像进行城市空间感知,支持场景分类、跨模态检索和实例分割任务,覆盖中国24个城市的61个城市地点。
SynopticBench:评估视觉语言模型生成未来天气预报讨论的能力
本文介绍了SynopticBench,这是一个包含130万份以上天气预报讨论及其对应气象图像的数据集;同时提出了SPACE,一个用于评估VLM生成天气预报质量的全新评估框架。
检索前思考:通过战略规划与自我批评实现鲁棒的零样本组合图像检索
介绍了一种无需训练的零样本组合图像检索框架PEC-CIR,该框架采用Planner-Executor-Critic架构,通过将查询构建组织为多阶段推理流程来提高检索精度。
DataComp-VLM:面向视觉语言模型的改进型开放数据集
本文介绍了DataComp-VLM(DCVLM),这是一个用于评估视觉语言模型数据策展策略的综合基准。作者发现,数据混合而非数据过滤能显著提升性能,由此产生的DCVLM-Baseline数据集在33项下游任务中取得了最先进的结果。