PhotoCraft: 基于层次化自演化记忆的深度图像搜索智能体推理

arXiv cs.CL 论文

摘要

PhotoCraft 提出了一种无需训练的层次化记忆系统,用于照片搜索智能体,集成了工作记忆、情景记忆和语义记忆,以维持长期上下文并在任务间迁移知识,在 DISBench 上取得了高达 18.5% 的提升。

arXiv:2606.03099v1 公告类型:新 摘要:深度图像搜索需要对丰富的上下文线索进行多步推理,例如时间、地点和事件关系。然而,大多数现有的基于LLM的智能体是无状态且反应式的,缺乏持久记忆来维持长期上下文或在任务间迁移经验,这常常导致执行漂移和经验隔离。为了解决这些限制,我们提出了PhotoCraft,一种无需训练的、用于照片搜索智能体的层次化记忆系统。受人类认知启发,PhotoCraft为MLLM配备了工作记忆、情景记忆和语义记忆,在推理过程中动态调用这些记忆,以在多步推理和答案生成中保持逻辑一致性和知识可迁移性。在DISBench上的大量实验表明,PhotoCraft在不同MLLM骨干网络上持续提高了上下文感知检索能力,取得了高达18.5%的提升,并有效缓解了无记忆深度图像搜索中的关键瓶颈,为构建可靠且可泛化的多模态搜索智能体提供了一条实用路径。
查看原文
查看缓存全文

缓存时间: 2026/06/03 09:37

# PhotoCraft:基于层次化自演化记忆的深度图像搜索智能体推理 来源:https://arxiv.org/html/2606.03099 Kailin Lyu1,2,3,†,Zhiqiang Yuan1,†,§,Jianwei He2,Qiwei Yan1,Xuanbo Su2,Nanxing Hu1 Yang Liu1,Ce Hao3,Shengqian Qin5,Lianyu Hu4,∗,Jinchao Zhang1,∗,Jie Zhou1 1模式识别中心,微信AI,腾讯公司 2中国科学院自动化研究所 3中关村研究院 4南洋理工大学 5上海交通大学 ###### 摘要 深度图像搜索需要对丰富的上下文线索(如时间、地点和事件关系)进行多步推理。然而,现有的大语言模型(LLM)智能体大多是无状态且反应式的,缺乏持久记忆来维持长程上下文或在任务间迁移经验,这常常导致执行漂移和经验隔离。为解决这些限制,我们提出了PhotoCraft,一种为照片搜索智能体设计的免训练、层次化记忆系统。受人类认知启发,PhotoCraft为多模态大语言模型(MLLM)配备了工作记忆、情景记忆和语义记忆,在推理过程中动态调用这些记忆,以在多步推理和答案生成过程中保持逻辑一致性和知识可迁移性。在DISBench上的大量实验表明,PhotoCraft在多种MLLM基座上持续提高了上下文感知检索能力,最高提升达18.5%,并有效缓解了无记忆深度图像搜索中的关键瓶颈,为构建可靠且可泛化的多模态搜索智能体提供了实用路径。我们的代码将开源。 PhotoCraft:基于层次化自演化记忆的深度图像搜索智能体推理 22Equal contribution. §Tech Lead. * Corresponding authors. ‡\ddagger This work was done during Kailin Lyu's internship at WeChat AI, Tencent Inc under guidance of Zhiqiang Yuan. ## 1 引言 在现实世界的个人照片检索中,用户很少仅仅依赖精确的视觉描述。相反,他们通过推理时间、地点和跨图像关联等上下文线索来检索图像。为捕捉这一设定,深度图像搜索 (Deng et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib1)) 将图像检索重新定义为对个人视觉历史的自主探索任务。如图1 (https://arxiv.org/html/2606.03099#S1.F1) 所示,深度图像搜索并非基于语义相似性 (Song et al., 2025b (https://arxiv.org/html/2606.03099#bib.bib3); Datta et al., 2008c (https://arxiv.org/html/2606.03099#bib.bib4)) 将文本查询与每张图像独立匹配,而是强调上下文感知检索,这要求模型能够:(1) 整合视觉内容、时空元数据和跨事件关联;(2) 根据用户意图规划工具辅助的搜索轨迹;(3) 构建证据链以定位目标图像。这些特征共同使得多步上下文推理成为MLLM的关键能力。 参见图注 图1:从语义匹配到自演化、意图感知图像检索的范式转变。(a) 语义检索依赖于显式的查询-图像重叠。(b) ImageSeeker执行迭代上下文推理,但其无记忆设计在多轮后性能下降。(c) PhotoCraft在整个多步推理过程中更新记忆,实现更可靠的检索。 参见图注 图2:无记忆搜索智能体的两个基本瓶颈与PhotoCraft的层次化记忆解决方案。 为弥合被动检索与主动探索之间的差距,现有的搜索智能体框架 (Deng et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib1)) 采用配备预先编排工具和有限上下文压缩机制的MLLM,以实现一定程度的多步交互。然而,尽管它们具有强大的推理能力,MLLM的无状态特性使其无法在单个情节内维持连贯的多步上下文,也无法跨任务积累知识 (Wu et al., 2025 (https://arxiv.org/html/2606.03099#bib.bib2); Jiang et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib35))。这种记忆缺失在搜索智能体中沿着两个关键维度引入了根本性瓶颈: ● ❶任务内推理一致性不足:如图2 (https://arxiv.org/html/2606.03099#S1.F2)(a) 所示,缺乏动态聚焦引导和有效的记忆压缩,智能体会忘记或误用早期步骤的关键证据,导致跨步骤约束不一致,从而破坏推理链并引发执行漂移。 ● ❷跨任务编排灵活性有限:受限于单一路径执行模式,智能体必须为每个新查询从头开始重新规划,使得策略迁移困难。如图2 (https://arxiv.org/html/2606.03099#S1.F2)(b) 所示,即使在成功解决结构相似的查询后,智能体仍可能在新任务上意外失败,导致经验隔离。 相比之下,人类自然依赖层次化记忆系统来支持动态交互、持续适应和问题解决能力的持续提升。这自然引出一个核心问题:如何为智能体构建一个层次化记忆系统,以持续增强任务内推理鲁棒性和跨任务编排灵活性? 为解决此问题,我们诉诸认知心理学,特别是Atkinson-Shiffrin记忆理论 (Atkinson and Shiffrin, 1968 (https://arxiv.org/html/2606.03099#bib.bib5)):人类认知依赖于三个互补的记忆系统。工作记忆支持短期情境意识,情景记忆将当前过程与历史目标联系起来,语义记忆则实现抽象知识表征与泛化。虽然这一认知理论揭示了人类认知的本质,但它可以平滑地转化为搜索智能体的架构原则。工作记忆维持最近的推理结果和智能体状态,以实现稳定的短期推理。情景记忆将当前过程与目标意图和步骤级规划联系起来,在多步推理中支持反思性自我修正。语义记忆将成功模式提炼为可重用的原则,用于当前决策和未来复用。基于这一启发,我们提出PhotoCraft,一个免训练、持续演化的三流推理框架,可无缝集成到多模态搜索智能体中。如图2 (https://arxiv.org/html/2606.03099#S1.F2)(c) 所示,PhotoCraft由三个互补的记忆系统组成:工作记忆、情景记忆和语义记忆。我们首先设计一个动态缓冲区,用于维护与目标相关的约束摘要、对话历史和状态快照,从而实现工作记忆以跟踪当前任务状态和中间上下文。在多步推理过程中,智能体进一步与多模态工具协作以定位证据、解读结果并进行反思性修正,逐步形成情景记忆,从而增强基于MLLM的任务理解和推理一致性。在此基础上,我们引入一种技能抽象机制,将成功轨迹提炼为可复用的结构化策略。对于每个新查询,PhotoCraft动态检索相关技能,并将轻量级方向性指引注入当前上下文以模拟语义记忆,从而实现鲁棒的策略迁移,同时保持自主探索能力,并从一个一次性求解器演变为一个持续改进的自演化系统。不同记忆模块的互补集成进一步提升了多步推理一致性和跨任务可迁移性。在DISBench (Deng et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib1)) 上的大量实验表明,我们的方法在多种基模型上持续改进了上下文感知的图像检索,并有效缓解了无记忆推理的局限性。我们的贡献如下: - 我们识别出执行漂移和经验隔离是深度图像搜索中的两个关键瓶颈,并提出了PhotoCraft,一个免训练且自演化的框架。 - 我们为搜索智能体提出了一种层次化记忆系统,其不同功能和机制受认知心理学启发。该设计提升了情境意识和推理一致性。 - 大量定量和定性实验表明,该框架显著提升了上下文推理和跨任务泛化能力。 ## 2 相关工作 图像检索。图像检索旨在根据用户查询从大规模图像集合中识别相关的视觉内容 (Song et al., 2025b (https://arxiv.org/html/2606.03099#bib.bib3); Datta et al., 2008b (https://arxiv.org/html/2606.03099#bib.bib6))。最近的视觉-语言预训练模型在共享嵌入空间中对齐图像和文本,并通过相似性匹配检索候选,实现了可扩展的开放词汇视觉搜索 (Zhu et al., 2024 (https://arxiv.org/html/2606.03099#bib.bib7); Li et al., 2022 (https://arxiv.org/html/2606.03099#bib.bib8))。扩展方法如组合图像检索 (Tu et al., 2025 (https://arxiv.org/html/2606.03099#bib.bib10); Song et al., 2025a (https://arxiv.org/html/2606.03099#bib.bib13)) 和推理增强检索 (Cui et al., 2025 (https://arxiv.org/html/2606.03099#bib.bib14); Cheng et al., 2025a (https://arxiv.org/html/2606.03099#bib.bib16)) 进一步引入文本修改、查询重写或外部知识来捕捉复杂的用户意图。然而,大多数方法仍然独立地对每个候选进行评分,这使得它们对视觉上明确的目标有效,但对于依赖上下文的检索则不足。因此,Deng等人 (Deng et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib1)) 试图通过深度图像搜索范式来解决这一问题,该范式将检索形式化为智能体的语料库探索。然而,它依赖于无状态的MLLM交互,削弱了长程推理并限制了泛化能力。相比之下,PhotoCraft引入了一种具有记忆意识的智能检索框架,该框架能维护中间证据、建模跨图像依赖关系,并在视觉历史上实现稳定推理。 多模态任务的智能体推理。基于LLM和MLLM的智能体系统最近已成为处理需要顺序决策和自适应信息搜索的任务的重要范式 (Dorri et al., 2018 (https://arxiv.org/html/2606.03099#bib.bib17); Li et al., 2024 (https://arxiv.org/html/2606.03099#bib.bib18))。它们不依赖单次推理,而是分解目标、调用工具、更新记忆 (Yao et al., 2023 (https://arxiv.org/html/2606.03099#bib.bib19)),并根据新证据优化推理。该范式已被应用于多模态问答 (Hu et al., 2023 (https://arxiv.org/html/2606.03099#bib.bib25); Jin et al., 2025 (https://arxiv.org/html/2606.03099#bib.bib20))、具身智能 (Cheng et al., 2025b (https://arxiv.org/html/2606.03099#bib.bib24); Orr and Dutta, 2023 (https://arxiv.org/html/2606.03099#bib.bib21)) 和长上下文视频理解 (Shen et al., 2025 (https://arxiv.org/html/2606.03099#bib.bib23); Yin et al., 2025 (https://arxiv.org/html/2606.03099#bib.bib22))。ImageSeeker (Deng et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib1)) 首次探索了使用位置定位和视觉检查等工具进行智能体图像检索,并在DISBench上进行了评估。然而,它依赖于预先编排的迭代上下文推理,而其无记忆设计在多轮后效果下降。相比之下,受认知心理学启发 (Atkinson and Shiffrin, 1968 (https://arxiv.org/html/2606.03099#bib.bib5)),我们为深度图像检索智能体提出了一种层次化记忆系统,使不同的记忆模块能够增强语料库检索中的推理。 ## 3 方法 在深度图像搜索中,单个查询通常需要数十次工具调用和推理步骤。然而,正如1节 (https://arxiv.org/html/2606.03099#S1) 所述,基于MLLM的无状态智能体存在记忆瓶颈,会导致任务内执行漂移并阻碍跨任务经验迁移。为解决这个问题,我们提出了PhotoCraft,一种配备层次化自演化记忆系统的搜索智能体。受人类认知层次化组织的启发,该系统沿着感知、反思和泛化的抽象谱系结构化为三个互补组件:工作记忆、情景记忆和语义记忆。MLLM作为核心控制器,在迭代循环中自主编排一套多模态工具(例如视觉验证),同时持续维护记忆系统,逐步缩小搜索空间并定位目标图像。PhotoCraft的概述如图3 (https://arxiv.org/html/2606.03099#S3.F3) 所示,工具细节在附录A.2.1 (https://arxiv.org/html/2606.03099#A1.SS2.SSS1) 中提供。 参见图注 图3:PhotoCraft概述及其推理流程示例。 ### 3.1 任务形式化 我们将深度图像搜索形式化为一个上下文感知的集合检索任务。给定用户的视觉历史语料库 $C=\{I_1,I_2,\ldots,I_N\}$,每张图像 $I_i=(v_i,m_i)$ 由视觉内容 $v_i$ 和元数据 $m_i$ 组成,其中 $m_i$ 包含时间戳 $\tau_i$ 和地理坐标 $g_i$。当接收到自然语言查询 $Q$ 时,系统需要预测一个目标子集 $R \subseteq C$,该子集包含所有满足 $Q$ 语义意图的图像。与独立对每张图像进行评分的传统检索范式不同,深度图像搜索需要对联合后验 $P(R \mid Q, C)$ 进行建模,其中单个图像的相关性可能取决于语料库中其他图像提供的上下文线索。在此任务中,查询以文本形式提供,而视觉参考被统一转换为文本描述。这种设计要求模型首先在 $C$ 中识别视觉锚点,然后基于这些锚点进行时空推理,使得任务比直接视觉匹配更具挑战性。 ### 3.2 层次化自演化记忆 ![[无标题图像]](https://arxiv.org/html/2606.03099v1/Figure/working_mem.png) 工作记忆。受人类工作记忆及其对任务相关信息的选择性维持的启发,我们认为有意义的短期记忆不应通过固定的保留窗口来衡量,而应通过其在持续推理过程中保持有效状态信息的能力来衡量。因此,与在固定上下文窗口内进行常规自由形式压缩不同 (Deng et al., 2026 (https://arxiv.org/html/2606.03099#bib.bib1)),我们引入了保真度保护的工作记忆 $\mathcal{M}_{\mathrm{work}}$,这是一种轻量级记忆压缩机制,用于保留短期推理状态。具体而言,当上下文接近窗口限制时,记忆模块 $f_{\mathrm{mem}}$ 将消息历史 $\mathcal{H}_c=\{m_1,\ldots,m_T\}$ 压缩为三种互补的摘要: $S=f_{\mathrm{mem}}(\mathcal{H}_c,Q)=S_{\mathrm{digest}} \oplus S_{\mathrm{session}} \oplus S_{\mathrm{working}}$ (1) 这里,$S_{\mathrm{digest}}$ 保留步骤级操作和结果以实现可追溯性,$S_{\mathrm{session}}$ 记录关键决策和可复用的启发式策略以实现战略连贯性,而 $S_{\mathrm{work$

相似文章

智能体的自改进记忆(6分钟阅读)

TLDR AI

Perplexity Brain是一个记忆系统,它构建了一个跨任务、项目、决策、文件和来源的持久上下文图,使智能体能够从相关上下文开始,而不是从头开始,从而提高答案正确性并降低任务成本。