检索前思考:通过战略规划与自我批评实现鲁棒的零样本组合图像检索
摘要
介绍了一种无需训练的零样本组合图像检索框架PEC-CIR,该框架采用Planner-Executor-Critic架构,通过将查询构建组织为多阶段推理流程来提高检索精度。
arXiv:2606.31222v1 Announce Type: new
摘要:组合图像检索需要通过将参考图像与文本修改指令相结合,从图像库中识别目标图像。在无需训练的零样本设置下,该任务依赖于在推理时于冻结的视觉-语言嵌入空间中构建面向检索的文本查询。现有方法主要采用单次生成策略,将参考上下文和修改文本融合为统一的描述。这种策略使得在生成过程中难以检测或纠正语义失真和遗漏。因此,参考属性的保留与文本需求的整合相互干扰,从而降低了检索精度。为解决这些挑战,我们提出了PEC-CIR,一种无需训练的框架,将查询构建组织为多阶段推理流程。该框架通过Planner-Executor-Critic架构运行,其中Planner提取显式约束,Executor生成多个候选目标描述,Critic根据约束符合性评估这些候选。通过将查询构建重新定义为分阶段的推理过程而非单次输出,PEC-CIR在检索前显式评估候选查询,从而减少生成错误的传播,进而提高检索稳定性。
查看缓存全文
缓存时间: 2026/07/01 05:37
# 检索前思考:通过策略规划与自我批评实现鲁棒的零样本组合图像检索
来源:https://arxiv.org/html/2606.31222
###### 摘要
组合图像检索需要从图库中识别目标图像,同时整合参考图像与文本修改指令。在免训练的零样本设置下,此任务依赖于在推理阶段于预训练的视觉-语言嵌入空间中构建面向检索的文本查询。现有方法主要采用单次生成策略,将参考上下文与修改文本融合为统一描述。这种策略难以在生成过程中检测或纠正语义扭曲与遗漏。因此,参考属性的保留与文本需求的整合相互干扰,导致检索精度下降。为解决这些问题,我们提出PEC-CIR,一个免训练框架,将查询构建结构化为多阶段推理管道。该框架通过规划器-执行器-评判器架构运行,其中规划器提取显式约束,执行器生成多个候选目标描述,评判器基于约束符合度评估这些候选。通过将查询构建重新定义为分阶段推理过程而非单次输出,PEC-CIR在检索前显式评估候选查询,减少生成错误的传播,从而提升检索稳定性。
###### 关键词:
组合图像检索、零样本学习、多模态大语言模型、智能推理
††期刊:模式识别\\隶属机构
\[label1\]机构=韩国大学人工智能系,城市=首尔,邮编=02841,国家=大韩民国
## 1 引言
组合图像检索(CIR)旨在通过整合参考图像与文本指令来检索目标图像\[42 (https://arxiv.org/html/2606.31222#bib.bib25),29 (https://arxiv.org/html/2606.31222#bib.bib44),12 (https://arxiv.org/html/2606.31222#bib.bib47),22 (https://arxiv.org/html/2606.31222#bib.bib45),36 (https://arxiv.org/html/2606.31222#bib.bib53)\]。与仅基于视觉相似性的传统检索不同,此任务要求在保留特定视觉属性的同时,根据文本提示修改特征\[43 (https://arxiv.org/html/2606.31222#bib.bib12),49 (https://arxiv.org/html/2606.31222#bib.bib10)\]。例如,在电子商务中,“相同设计但不同颜色且无标志”的查询体现了精确多模态整合的需求。这种跨模态协同使得用户能够表达细粒度偏好,从而检索到满足细微修改同时保持视觉一致性的图像\[16 (https://arxiv.org/html/2606.31222#bib.bib46),9 (https://arxiv.org/html/2606.31222#bib.bib48),15 (https://arxiv.org/html/2606.31222#bib.bib6)\]。组合式检索需求出现在各种应用领域,包括时尚、室内设计和个性化推荐,突显了CIR在现实场景中的实际意义。
参见图例图1:典型免训练CIR方法与所提PEC-CIR方法的比较。早期CIR研究依赖使用标注三元组(包括参考图像、修改文本和目标图像)的监督学习\[3 (https://arxiv.org/html/2606.31222#bib.bib27),55 (https://arxiv.org/html/2606.31222#bib.bib54)\]。尽管通过联合视觉-文本表示取得了强性能,监督框架需要大规模标注并产生大量计算成本。为最小化监督开销,近期工作探索了零样本CIR,利用预训练的视觉-语言模型进行多模态融合而无需任务特定训练\[1 (https://arxiv.org/html/2606.31222#bib.bib16),5 (https://arxiv.org/html/2606.31222#bib.bib24),33 (https://arxiv.org/html/2606.31222#bib.bib26)\]。值得注意的是,大型语言模型(LLM)和多模态大语言模型(MLLM)的整合因其先进的推理能力而成为一个突出范式,可将复杂多模态指令翻译为描述性目标表示。生成式策略产生目标图像的自然语言描述以用于后续文本到图像检索,从而实现灵活且免训练的推理过程\[28 (https://arxiv.org/html/2606.31222#bib.bib1),40 (https://arxiv.org/html/2606.31222#bib.bib22),52 (https://arxiv.org/html/2606.31222#bib.bib43),41 (https://arxiv.org/html/2606.31222#bib.bib2),6 (https://arxiv.org/html/2606.31222#bib.bib3)\]。
然而,现有生成式零样本框架存在三个结构性限制。首先,参考图像和文本指令的解耦处理限制了视觉上下文与编辑意图之间的显式跨模态交互。这种分离导致在保留或修改特定视觉属性方面产生歧义,从而造成不准确的检索结果。此外,文本生成的随机性在查询构建中引入了语义波动。概率解码导致关键视觉约束的遗漏或无关概念的引入,从而破坏检索一致性。最后,先前的范式不加批评地采用生成的输出作为最优解,忽视了不同候选之间检索质量的固有波动。这种缺乏判别性监督使得幻觉或语义错位得以无检查地传播至检索引擎,损害了免训练框架的鲁棒性。图1 (https://arxiv.org/html/2606.31222#S1.F1)(a)展示了现有免训练CIR方法的一个代表性失败案例,其中单次生成的查询仅捕捉了文本指令的部分方面,导致检索结果不匹配。
为解决这些挑战,我们提出PEC-CIR,一个鲁棒的免训练框架,将零样本查询构建重新定义为结构化推理管道。我们的框架将过程分解为三个相互关联的阶段:规划、执行和批评。规划器首先提取用于保留和修改的结构化约束,将推理锚定在视觉上下文中。然后执行器综合多种候选描述以缓解随机生成的波动。最后,评判器依据客观标准评估这些候选,确保只有满足严格检索要求的描述得以传播。多阶段设计稳定了查询构建,在FashionIQ\[47 (https://arxiv.org/html/2606.31222#bib.bib30)\] 和 CIRR\[26 (https://arxiv.org/html/2606.31222#bib.bib31)\] 基准上取得了一致的性能提升。
我们的贡献总结如下:
- 1. 我们提出PEC-CIR,一个免训练框架,将零样本CIR重新定义为多阶段推理管道,有效缓解了单次生成模型固有的波动性。
- 2. 我们引入了一种由反馈驱动循环促成的智能优化机制,通过严谨的视觉-文本验证防止幻觉的传播。
- 3. 在FashionIQ和CIRR基准上的实验结果表明,PEC-CIR取得了持续的性能提升,在免训练组合检索方法中达到了最先进的性能。
## 2 相关工作
### 2.1 组合图像检索
组合图像检索(CIR)旨在通过整合参考图像与文本修改指令来从图库中检索目标图像\[42 (https://arxiv.org/html/2606.31222#bib.bib25),29 (https://arxiv.org/html/2606.31222#bib.bib44),12 (https://arxiv.org/html/2606.31222#bib.bib47),27 (https://arxiv.org/html/2606.31222#bib.bib5),54 (https://arxiv.org/html/2606.31222#bib.bib7)\]。基本困难在于识别参考图像的哪些视觉属性需要保留,哪些需要根据指令进行修改。保留与修改的双重要求代表了复杂编辑意图的表达,并需要视觉与文本模态之间复杂的交互。早期CIR研究聚焦于监督学习设置,使用标注三元组(包括参考图像、修改文本和标记目标)进行训练\[46 (https://arxiv.org/html/2606.31222#bib.bib39),50 (https://arxiv.org/html/2606.31222#bib.bib40)\]。更广泛地说,监督跨模态检索还探索了通过标签感知图卷积、双对抗图神经网络和多标签对比学习来实现模态不变表示学习和语义关系建模\[31 (https://arxiv.org/html/2606.31222#bib.bib57),32 (https://arxiv.org/html/2606.31222#bib.bib58),30 (https://arxiv.org/html/2606.31222#bib.bib59)\]。尽管在标注三元组的分布内效果良好,监督设计本质上依赖大规模监督。因此,静态架构缺乏灵活性,无法适应新属性或组合,而无需额外的数据收集和模型重训练的巨大开销\[5 (https://arxiv.org/html/2606.31222#bib.bib24)\]。相关的零样本跨模态检索任务也在零样本草图图像检索(ZS-SBIR)中进行了研究,其中模型必须对齐草图和照片,同时泛化到未见类别。近期ZS-SBIR研究通过关系感知元学习、双向知识蒸馏以及带有双向挖掘的混合样本增强来解决这一挑战\[24 (https://arxiv.org/html/2606.31222#bib.bib60),10 (https://arxiv.org/html/2606.31222#bib.bib61),25 (https://arxiv.org/html/2606.31222#bib.bib62)\]。
### 2.2 零样本组合图像检索
#### 2.2.1 基于表示的方法
基于表示的框架专注于直接在预训练视觉-语言模型的嵌入空间中组合图像与指令特征\[2 (https://arxiv.org/html/2606.31222#bib.bib29),17 (https://arxiv.org/html/2606.31222#bib.bib23),48 (https://arxiv.org/html/2606.31222#bib.bib18),18 (https://arxiv.org/html/2606.31222#bib.bib9)\]。在向量融合范式中,参考图像和修改文本分别编码后,通过加权融合\[17 (https://arxiv.org/html/2606.31222#bib.bib23)\]、线性变换\[4 (https://arxiv.org/html/2606.31222#bib.bib36)\]或基于相似性的操作\[14 (https://arxiv.org/html/2606.31222#bib.bib37)\]进行组合。直接向量组合计算高效且需要极少的任务特定训练。然而,依赖预定义特征空间限制了表示复杂语义的能力,尤其在视觉和文本上下文需要深度整合的条件性修改下\[5 (https://arxiv.org/html/2606.31222#bib.bib24)\]。
#### 2.2.2 基于映射与反演的方法
基于映射的策略利用预训练的映射模块将视觉特征投影到词嵌入空间,将图像表示为伪词令牌以便整合到文本提示中\[35 (https://arxiv.org/html/2606.31222#bib.bib28),45 (https://arxiv.org/html/2606.31222#bib.bib19)\]。精细化的映射框架进一步融入细粒度视觉细节或外部知识以增强生成令牌的描述表达能力\[23 (https://arxiv.org/html/2606.31222#bib.bib20),38 (https://arxiv.org/html/2606.31222#bib.bib38)\]。相比之下,基于反演的方法在推理时采用迭代优化来识别在语言域中封装参考图像视觉上下文的文本嵌入\[1 (https://arxiv.org/html/2606.31222#bib.bib16)\]。然而,依赖预训练映射模块或迭代优化限制了对新颖概念的泛化能力,并产生大量计算开销。
#### 2.2.3 基于生成的方法
基于生成的零样本CIR近期兴起,利用LLM或MLLM直接从多模态输入中合成面向检索的描述\[40 (https://arxiv.org/html/2606.31222#bib.bib22)\]。近期工作进一步强调语义编辑过程本身,将相对文本视为参考图像与目标图像之间的语义增量,用于免训练零样本检索\[51 (https://arxiv.org/html/2606.31222#bib.bib56)\]。生成式管道重写指令或生成修改后的字幕,结果文本随后编码为检索查询。尽管为复杂修改提供了更强的表达灵活性,单次生成方法仍然对单一输出的波动性高度敏感\[6 (https://arxiv.org/html/2606.31222#bib.bib3)\]。直接将生成输出传播至检索阶段会使随机错误损害检索性能。我们的方法利用一个多阶段推理智能体,通过显式规划和自主批评来验证和优化检索查询。
### 2.3 基于智能体的推理范式
智能体推理的出现旨在通过缓解单步推理的约束来增强LLM模型的解决问题的能力\[53 (https://arxiv.org/html/2606.31222#bib.bib13),19 (https://arxiv.org/html/2606.31222#bib.bib42)\]。这些架构促进将复杂任务分解为模块化角色,包括规划、执行和自我反思,以支持基于中间结果的迭代决策。输出的迭代优化最小化了错误累积,对抗了过早生成相关的风险\[57 (https://arxiv.org/html/2606.31222#bib.bib8),56 (https://arxiv.org/html/2606.31222#bib.bib41)\]。
在组合图像检索(CIR)中,向多阶段推理的转变反映了管理零样本生成中固有随机性的努力\[40 (https://arxiv.org/html/2606.31222#bib.bib22)\]。近期研究调查了程序化步骤,如指令分析或基于启发式的重排序,以稳定检索结果\[41 (https://arxiv.org/html/2606.31222#bib.bib2),44 (https://arxiv.org/html/2606.31222#bib.bib33)\]。利用LLM进行查询合成的生成式管道允许初始生成错误未经内部验证便到达检索阶段\[28 (https://arxiv.org/html/2606.31222#bib.bib1),6 (https://arxiv.org/html/2606.31222#bib.bib3)\]。为解决对随机错误传播的敏感性,PEC-CIR整合了显式规划和自主批评以验证和优化检索查询。多阶段推理架构确保面向检索的约束在推理期间保持一致,为稳定零样本检索建立了一个原则性基础。
## 3 方法论
### 3.1 问题定义
给定参考图像 I_R 和修改文本 T_M,CIR旨在从图库 G = {I_i}_{i=1}^N 中检索目标图像 I_T。检索目标要求同时保留 I_R 的核心视觉身份并融入 T_M 中指定的语义变换。在免训练的零样本设置中,框架分别利用预训练的视觉-语言模型作为图像编码器 f_θ 和文本编码器 f_φ。为了桥接...(原文此处不完整,按已知内容继续翻译?但后面内容似乎没有给出,只到“To bridge”为止。可能原文章节在此处被截断?实际上原文在"3.1 Problem Definition"最后一段是“To bridge”开头,但后续没有提供。按照现有内容翻译即可)相似文章
PhotoCraft: 基于层次化自演化记忆的深度图像搜索智能体推理
PhotoCraft 提出了一种无需训练的层次化记忆系统,用于照片搜索智能体,集成了工作记忆、情景记忆和语义记忆,以维持长期上下文并在任务间迁移知识,在 DISBench 上取得了高达 18.5% 的提升。
对应用地球观测中组合图像检索的基准测试
本文提出了一个地球观测中组合图像检索的统一基准,评估了视觉-语言骨干网络,并引入了一个以变化为中心的灾害监测数据集(xView2-CIR),强调了与基于属性检索相比的独特挑战。
Critic-R: 使用指令调优检索器与自然语言内省反馈改进Agentic Search
Critic-R引入了一个框架,使用评判模型在推理智能体和检索器之间提供内省反馈,在推理和训练时间同时提升智能体搜索性能,且无需重新训练智能体。
CIPER: 跨视图图像检索与姿态估计的统一框架
CIPER是一个统一的Transformer框架,能够联合执行城市级跨视图图像检索和精确的三自由度(3-DoF)姿态估计,克服了级联管道的局限性。
PixelEyes:解耦感知与推理,实现精准视觉证据搜寻
PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。