RRM:经验驱动的反思性检索记忆用于长时程多模态推理
摘要
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
arXiv:2607.28156v1 公告类型:新
摘要:现有的多模态长期记忆代理使用外部记忆来克服长视频可用上下文有限的限制。然而,大多数方法强调存储什么,而不是应如何检索存储的记忆。当检索变得不准确或反复无法获得有用证据时,现有代理缺乏从先前任务轨迹中诊断失败并调整未来搜索策略的机制。我们引入了反思性检索记忆(RRM),一种用于长时程多模态推理的反思性记忆框架。RRM用反思性经验记忆增强以实体为中心的多模态记忆图,该记忆从历史任务轨迹中提炼可迁移的程序性检索知识。与保留当前视频事实证据的情境记忆和语义记忆不同,反思性经验记忆捕获跨任务可复用的搜索策略。RRM将检索到的经验转换为查询级指导,而答案生成仍仅以从当前视频中新检索到的事实证据为条件。生命周期管理机制进一步通过使用频率、复用反馈和时间衰减来调节经验记忆,从而减少冗余和噪声。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long上持续优于先前的最先进方法,证明了反思性检索记忆对长时程多模态推理的有效性。
查看缓存全文
缓存时间: 2026/07/31 10:04
# 面向长时程多模态推理的经验驱动反思性检索记忆
Source: https://arxiv.org/html/2607.28156
###### 摘要
现有的多模态长时记忆智能体利用外部记忆来克服长视频中上下文有限的挑战。然而,大多数方法侧重于存储什么,而非应如何检索存储的记忆。当检索变得不准确或反复无法获取有效证据时,现有智能体缺乏从先前任务轨迹中诊断失败并调整未来搜索策略的机制。我们提出反思性检索记忆(Reflective Retrieval Memory, RRM),一种面向长时程多模态推理的反思性记忆框架。RRM 用一个反思性经验记忆层增强以实体为中心的多模态记忆图,该记忆层从历史任务轨迹中提炼可迁移的程序性检索知识。与保留当前视频事实证据的情景记忆和语义记忆不同,反思性经验记忆捕获跨任务可复用的搜索策略。RRM 将检索到的经验转化为查询级引导,而答案生成仅以从当前视频中最新检索到的事实证据为条件。一种生命周期管理机制进一步通过使用频率、复用反馈和时间衰减来调节经验记忆,从而减少冗余和噪声。RRM 在 M3-Bench-Robot、M3-Bench-Web 和 Video-MME-Long 上持续优于之前的最先进方法,证明了反思性检索记忆对长时程多模态推理的有效性。
参见图 1:RRM 的动机和检索工作流程。从先前成功和失败任务中提炼的程序性检索经验提供查询级引导,以解决检索异常并从当前视频记忆中获取缺失证据。
## 引言
多模态大语言模型(MLLMs)在视频理解、跨模态问答和具身推理中展示了强大的感知和推理能力(Bai et al.2025 (https://arxiv.org/html/2607.28156#bib.bib1); Xu et al.2025 (https://arxiv.org/html/2607.28156#bib.bib21); Reid et al.2024 (https://arxiv.org/html/2607.28156#bib.bib12); OpenAI2024 (https://arxiv.org/html/2607.28156#bib.bib11))。然而,连续的长期场景对这些模型提出了更高的要求。在家庭机器人和持续环境感知等应用中,智能体必须在一个连续的视频流中保留视觉、语义和时间信息,同时能够在多个任务中准确定位与当前问题相关的证据。然而,长视频包含大量冗余信息,关键证据稀疏地分布在相隔较远的时间片段中(Song et al.2024 (https://arxiv.org/html/2607.28156#bib.bib15); He et al.2024 (https://arxiv.org/html/2607.28156#bib.bib4); Fu et al.2025 (https://arxiv.org/html/2607.28156#bib.bib3))。与此同时,尽管最近的模型扩展了名义上下文窗口,现有模型在长输入上的有效上下文容量仍然有限,难以可靠地定位和使用相关证据,尤其在长视频理解领域更是如此(Liu et al.2024 (https://arxiv.org/html/2607.28156#bib.bib9); Hsieh et al.2024 (https://arxiv.org/html/2607.28156#bib.bib6); Wu et al.2024 (https://arxiv.org/html/2607.28156#bib.bib20))。因此,长时程多模态推理的核心瓶颈不仅仅在于如何保留更多历史信息,还在于如何从大规模记忆中可靠地检索支撑证据,并利用先前任务的经验进一步改进未来的证据获取。
从历史任务轨迹中学习已成为语言智能体持续适应的重要手段。现有方法从反馈中生成言语反思、从成功和失败的经验中提取可复用的洞察,或归纳出可复用的工作流以引导后续推理和动作生成(Shinn et al.2023 (https://arxiv.org/html/2607.28156#bib.bib14); Zhao et al.2024 (https://arxiv.org/html/2607.28156#bib.bib26); Wang et al.2025 (https://arxiv.org/html/2607.28156#bib.bib18); Cao et al.2026 (https://arxiv.org/html/2607.28156#bib.bib2))。然而,一个长视频推理轨迹包含两种不同的信息。一种是由特定任务的事实组成,如人物、地点和事件;另一种则捕获了相关证据是如何被检索到的。直接复用完整轨迹可能会引入不相关或冲突的历史上下文,可能导致智能体被导向当前视频中不存在的实体,或鼓励其根据先前任务的信息作答,而非检索新证据(Shi et al.2023 (https://arxiv.org/html/2607.28156#bib.bib13); Hong et al.2024 (https://arxiv.org/html/2607.28156#bib.bib5))。因此,可迁移的对象应该是检索过程本身,而非历史答案或其支撑事实。
如图 1 (https://arxiv.org/html/2607.28156#S0.F1) 所示,RRM 从历史任务轨迹中提取可复用的检索经验,而非保留特定任务的答案。例如,在先前的一个任务中,问题询问 Blondie 在探索独克宗古城后去了哪里,智能体成功定位了后续目的地——普达措国家公园。该轨迹中可迁移的信息并非目的地本身,而是其底层的检索策略:定位已知事件,并在后续时间片段中搜索事件转换的证据。类似地,失败的轨迹可以揭示关于无效查询、重复搜索或证据覆盖不足的诊断信息。通过将成功和失败的轨迹抽象为检索策略,RRM 可以在未来任务中重新引导证据搜索,而无需将历史视频中的事实引入当前视频的推理。RRM 遵循"先预测、后更新"的协议。对于每个任务,预测在任务后反馈可用之前即被最终确定并记录。因此,所产生的经验只能影响后续任务,从而在预测和经验更新之间建立时间隔离。
基于上述观察,我们提出反思性检索记忆(RRM),一个面向长时程多模态推理的框架。RRM 建立在 M3-Agent (Long et al.2026 (https://arxiv.org/html/2607.28156#bib.bib10)) 的图结构长期记忆之上,在保留当前视频事实证据的情景记忆和语义记忆之外,增加了一个从历史任务轨迹中持续提炼的反思性经验记忆。通过对成功和失败的检索轨迹进行反思,RRM 抽象出可迁移的证据需求、查询模式、失败原因和修正策略,而非保留历史答案或视频特定事实。为防止任务特定的历史信息干扰当前推理,RRM 将经验建模为一种查询级检索控制信号。检索到的经验由经验选择器进行过滤,转化为中性的检索焦点,并仅用于构建后续的内存查询。它们永远不会被直接插入答案生成上下文。通过这种方式,智能体可以跨任务复用程序性检索知识,同时确保最终预测始终基于从当前视频中检索到的事实证据。
随着任务持续处理,反思性经验记忆可能会积累冗余、过时或无效的条目。因此,我们引入了一种在线生命周期管理机制,根据实际复用情况、任务反馈和时间衰减动态估计经验效用。相似的经验被合并,而无效条目在明确的容量控制下被裁剪,从而使经验记忆在长任务流中保持紧凑和可靠。
我们的贡献总结如下:
- • 我们提出 RRM,一个从历史任务轨迹中学习可迁移的程序性检索知识以改进长时程多模态推理中的跨任务检索的框架。
- • 我们引入了一种查询级经验复用机制,将历史经验转化为检索控制信号,并仅用于查询构建,从而防止任务特定的历史信息直接影响答案生成。
- • 我们在 M3-Bench-Robot、M3-Bench-Web 和 Video-MME-Long 上进行了大量实验,RRM 持续优于强基线,分别提升了 9.1%、5.8% 和 7.4%。
## 相关工作
参见图 2:RRM 的总体架构:(a) 当前视频事实记忆,(b) 带有在线查询反思和触发式仅查询经验复用的反思性检索控制,以及 (c) 带有证据隔离复用的反思性经验记忆。
多模态长视频理解与记忆增强智能体。长视频中的关键证据通常稀疏地分布在不同时间片段中。现有研究主要通过视频表示压缩和主动证据检索来降低长上下文处理的成本。MovieChat (Song et al.2024 (https://arxiv.org/html/2607.28156#bib.bib15)) 将长视频表示压缩为稀疏记忆,而 MA-LMM (He et al.2024 (https://arxiv.org/html/2607.28156#bib.bib4)) 则在线处理视频并在记忆库中维护历史视觉信息。VideoAgent (Wang et al.2024 (https://arxiv.org/html/2607.28156#bib.bib17)) 将长视频问答表述为迭代搜索过程。M3-Agent (Long et al.2026 (https://arxiv.org/html/2607.28156#bib.bib10)) 进一步构建了以实体为中心的情景记忆和语义记忆,并通过"搜索-回答"控制器检索任务相关证据,而 WorldMM (Yeo et al.2026 (https://arxiv.org/html/2607.28156#bib.bib23)) 探索了跨不同模态和时间尺度的动态记忆访问。这些方法显著提高了长视频信息的存储和可访问性。然而,它们的检索机制主要针对当前视频或当前任务内的证据获取而设计,很少利用历史任务轨迹来学习可跨任务复用的检索策略。相比之下,RRM 在保留当前视频事实记忆的同时,引入了一个独立的反思性经验记忆,持续积累和复用程序性检索知识。
基于经验与自进化的智能体记忆。经验驱动的智能体将历史轨迹和环境反馈转化为可复用的反思、经验或工作流。Reflexion (Shinn et al.2023 (https://arxiv.org/html/2607.28156#bib.bib14)) 从任务反馈中生成自然语言反思,ExpeL (Zhao et al.2024 (https://arxiv.org/html/2607.28156#bib.bib26)) 从成功和失败的轨迹中提取可复用经验,Agent Workflow Memory (Wang et al.2025 (https://arxiv.org/html/2607.28156#bib.bib18)) 从历史执行轨迹中归纳可复用的工作流。ReMe (Cao et al.2026 (https://arxiv.org/html/2607.28156#bib.bib2)) 进一步研究了结构化经验的复用、更新和持续进化。RRM 与这些方法的主要区别在于经验被引入推理过程的位置。RRM 不是将历史经验直接暴露于推理或答案生成上下文,而是将其转化为查询级检索引导。最终答案则完全从当前视频记忆中检索到的事实证据生成。这种设计减少了不相关或冲突历史上下文的影响,并在图 3 (https://arxiv.org/html/2607.28156#Sx4.F3)(a) 中进行了实证检验。
## 方法
RRM 的核心思想是从历史任务轨迹中提炼可迁移的程序性检索经验,以改进长时程多模态推理中的证据获取。RRM 之所以是反思性的,是因为它检查检索轨迹如何成功或失败,并将由此产生的诊断转化为后续证据获取的可复用引导。RRM 保留当前视频事实记忆(图 2(a)),并通过在线查询反思和异常触发的经验复用(图 2(b) 和 (c))扩展其"搜索-回答"过程。检索到的经验被转化为查询级引导,而最终预测仅基于从当前视频中检索到的事实证据。任务完成后,从检索轨迹中提取新经验,并通过在线生命周期机制进行维护,形成一个跨任务检索优化循环。
### 预备知识
RRM 构建在 M3-Agent(Long et al. 2026)的记忆构建和控制推理流程之上。连续视听流被组织为一个以实体为中心的多模态图GiG\_\{i\},其情景记忆保留具有时间锚定的事件观察,其语义记忆抽象实体属性和关系。对于任务ii,控制器在检索步骤tt发出查询xi,tx\_\{i,t\},并获得
Ei,t=Search(Gi,xi,t)E\_\{i,t\}=\mathrm{Search}(\mathcal{G}\_\{i\},x\_\{i,t\})。(1)
其中Ei,tE\_\{i,t\}表示检索到的证据。"搜索-回答"过程在控制器策略下迭代,直到生成答案或检索预算耗尽。RRM 保留这一事实检索主干,并仅在检测到检索失败时增强查询构建,利用先前任务轨迹中的反思性经验来改进未来的证据获取。
### 三层记忆架构
如图 2 (https://arxiv.org/html/2607.28156#Sx2.F2)(a) 和 (c) 所示,RRM 将长期记忆组织为三个层次:情景记忆、语义记忆和反思性经验记忆。
##### 当前视频事实记忆。
如图 2 (https://arxiv.org/html/2607.28156#Sx2.F2)(a) 所示,情景记忆和语义记忆完全由当前视频的多模态观察构建,共同形成事实记忆图Gi\mathcal{G}\_\{i\}。情景记忆以时间锚定的视频片段和事件为基本单元,而语义记忆抽象更高层次的实体属性和关系。二者共同将当前视频中的实体、事件和关系组织为一个以实体为中心的多模态记忆图,用于证据检索。
##### 反思性经验记忆。
如图 2 (https://arxiv.org/html/2607.28156#Sx2.F2)(c) 所示,反思性经验记忆构成一个独立的第三层,将已完成的检索轨迹压缩为面向未来任务的程序性知识。与由当前视频构建的情景记忆和语义记忆不同,它从历史检索轨迹和任务反馈中提炼而来。它存储可迁移的证据需求、查询模式、检索失败模式和查询调整策略,而非历史视频中的特定人物、事件、答案或结论。因此,它描述的是应如何获取相关证据,而非先前视频中发生了什么。
为维持事实信息与程序性经验之间的清晰边界,反思性经验记忆保持独立于当前视频事实图。历史经验永远不会被写入情景记忆或语义记忆,仅作为查询级检索控制信号使用。这种隔离使得检索策略的跨任务迁移成为可能,同时相似文章
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
MemReread:通过记忆引导的重读增强智能体长上下文推理
MemReread 提出了一种长上下文推理方法,通过分解问题和重读文本来恢复被丢弃的信息,避免了中间检索,实现了线性时间复杂度。该方法在长上下文推理任务上优于基线框架。
MemReranker:面向智能体记忆检索的推理感知重排序
MemReranker 是一个针对智能体记忆检索设计的推理感知重排序模型家族(0.6B/4B),通过结合 LLM 知识蒸馏技术解决语义相似性匹配的局限性,从而提升模型的时间与因果推理能力。
ReflectWorld-MM:面向实体的多模态记忆系统,用于开放式视频流
ReflectWorld-MM 是一个面向实体的多模态记忆系统,专为开放式视频流设计,采用受人类记忆理论启发的分层长期记忆,在六个基准测试中达到了最先进的准确率。
MER-R1: 通过慢速-快速思维协同的多模态情感推理
本文介绍了MER-R1,一个通过协同快速和慢速思维进行多模态情感识别的强化学习框架。它通过双目标解耦和慢速-快速置信度校准,联合优化召回率和精确率,从而实现了最先进的性能。