标签
本文提出了一种无监督框架,结合流形学习和可解释图嵌入,以解决视觉表示中的几何和可解释性差距,提升图像检索和GCN分类任务的性能。
本文介绍了图像包组合(IBC),将图像检索从原子级匹配转向连贯图像包的动态组合,以解决传统方法的局限性。它提出了基准数据集 IBCBench 和智能体框架 BundleWeaver,该框架利用大型语言模型(LLMs)和视觉语言模型(VLMs)进行关系组合。
CIPER是一个统一的Transformer框架,能够联合执行城市级跨视图图像检索和精确的三自由度(3-DoF)姿态估计,克服了级联管道的局限性。
本文提出了一个地球观测中组合图像检索的统一基准,评估了视觉-语言骨干网络,并引入了一个以变化为中心的灾害监测数据集(xView2-CIR),强调了与基于属性检索相比的独特挑战。