从多模态经验中学会学习
摘要
本文介绍了AutoMMemo,一个使多模态智能体能够自动设计记忆机制(可表达为可执行的备忘录程序)以从多模态交互轨迹中学习的框架,在GUI/Web导航和视觉推理基准上优于无记忆和固定记忆基线。
arXiv:2605.16857v1 公告类型:新
摘要:经验驱动学习已成为一种有前景的范式,使智能体能够通过积累和重用过往经验从交互轨迹中改进。然而,现有方法主要在文本环境中开发,并依赖手动设计的记忆模式,限制了其在多模态环境中的适用性。在现实场景中,经验本质上是多模态的,涉及感知、推理和行动中的异构信号,这使得有效的记忆设计更加具有挑战性。特别是,最优的结构化和利用多模态经验的方式高度依赖任务并随时间演化,导致固定记忆设计不足。在这项工作中,我们提出了一种新范式——从多模态经验中学会学习,将记忆设计从预定义组件转变为自适应和可学习的过程。我们的框架使智能体能够基于任务需求和交互历史动态构建、组织和利用记忆,有效学习如何结构化经验以提升性能。实验表明,自适应记忆设计显著提升了智能体在多模态任务上的性能和泛化能力,凸显了学习记忆机制在经验驱动学习中的关键作用。
查看缓存全文
缓存时间: 2026/05/19 06:36
# 从多模态经验中学习如何学习 来源:https://arxiv.org/html/2605.16857 隋星宇¹, 赵维翔¹, 唐永鑫¹, 赵妍妍¹, 吴阳², 涂丹丹², 秦兵¹ ¹哈尔滨工业大学, ²华为技术有限公司 \{xysui, wxzhao, yyzhao\}@ir\.hit\.edu\.cn
###### 摘要
多模态智能体越来越多地与接近真实世界的环境进行交互,并生成涵盖感知、推理和行动的丰富轨迹。一个关键的研究方向是如何将这些原始的多模态轨迹转化为可重用的经验,以提高未来任务的表现。现有的经验驱动学习方法主要发展于文本设置,通常依赖人工设计的记忆模式,这使得它们对于需要跨模态、时间尺度和抽象层次组合异构信号的多模态经验效果不佳。我们提出 **AutoMMemo**,一个通用框架,使智能体能够自动设计记忆机制,用于从多模态经验中学习。**AutoMMemo** 将每种记忆机制表示为一个可执行的**备忘录程序**,该程序定义了如何存储、组织和检索过去的片段。它通过一个迭代的“先更新再检索”评估、反思引导的变异以及预算感知的树搜索过程来发现有效的备忘录程序。在 GUI/网页导航和多模态视觉推理基准上的实验表明,**AutoMMemo** 在维持合理的 token 和交互成本的同时,持续提升了智能体相对于无记忆智能体和固定记忆基线的表现。迁移和搜索过程分析进一步证明,学到的记忆设计捕获了可重用的经验结构,并逐步优化了检索相关性。这些结果凸显了自适应记忆设计作为多模态经验驱动学习的一个关键优化目标。
## 1 引言
近年来,多模态大语言模型(MLLMs)的进展使智能体能够主动探索并交互于更接近真实世界的环境 (Yao et al., 2023; Durante et al., 2024; Li et al., 2025b)。此类交互自然产生大量轨迹,捕获了感知、推理和行动中的丰富信号。因此,一个核心研究问题是如何将这些原始交互轨迹转化为可重用的经验,从而持续提升智能体表现 (Shinn et al., 2023; Silver and Sutton, 2025)。在此背景下,通过记忆机制进行经验驱动的学习已成为一种有前景的范式,使智能体能够跨任务积累、组织和重用经验 (Gao et al., 2025; Fang et al., 2025)。因此,智能体的有效性不再仅由其底层模型决定,而越来越多地取决于它如何表示和利用其经验 (Dou et al., 2025)。
然而,现有的经验驱动学习范式主要在文本设置中发展 (Zhao et al., 2024; Zhang et al., 2025a; Xia et al., 2026),其对多模态环境的扩展尚待充分探索。这导致了根本性的不匹配:在真实世界场景中,经验本质上是多模态的,来源于涉及视觉、语言和行动动态等多种信号的交互 (Driess et al., 2023; Sarch et al., 2024)。这些信号在模态、时间范围和语义抽象上各不相同,形成了结构化和非结构化信息的复杂混合。因此,设计用于经验学习的有效记忆系统需要做出一系列紧密耦合的决策,例如存储什么、如何表示、如何组织以及何时检索。对于多模态经验,这些决策尤其具有挑战性,因为有用信息可能分布于不同时间尺度和抽象层次的视觉观察、语言推理和行动轨迹之中 (Hu et al., 2025)。
尽管存在这种复杂性,现有方法大多依赖于人工设计的记忆模式,具有固定的、预定义的经验表示和检索格式。虽然这些方法在受控环境中有效,但本质上依赖于人类先验,缺乏跨任务、模态和环境的适应灵活性。结果往往导致次优的经验利用:不恰当的经验表示可能要么丢弃关键信号(如细粒度视觉线索 (Bo et al., 2025; Jiang et al., 2026)),要么引入过多噪声 (Li et al., 2025a; Zhu et al., 2026),最终阻碍学习效率和泛化能力。
这些局限性指向一个更深层的问题:结构化和利用多模态经验的最优方式本质上是任务依赖的,并且随着环境和智能体自身的变化而随时间演变。因此,多模态智能体中的记忆设计不应被视为一次性工程决策,而应是一个持续演化的过程。基于这一洞察,我们认为有效的多模态经验驱动学习不仅需要积累或检索经验,更需要学习如何自适应地结构化和利用经验。与现有操作固定记忆设计的方法不同,这将焦点转向一个更高级的目标:使智能体能够调整自身记忆策略以改进学习。这一观点与人类学习一致,人类根据情境和目标不断改进如何组织、抽象和回忆经验 (Cohen and Eichenbaum, 1993; Eichenbaum, 2017)。
为此,我们提出 **AutoMMemo**,一个通用框架,使智能体能够自动设计用于从多模态经验中学习的记忆。不依赖固定记忆模式,**AutoMMemo** 将每种记忆机制表示为一个可执行的**备忘录程序**,该程序指定如何存储、组织和检索过去的多模态片段以供未来任务使用。这种抽象提供了统一的记忆接口,同时保持内部设计空间的开放性,允许智能体探索多种结构化与利用经验的策略。**AutoMMemo** 通过迭代的评估、反思、变异和选择过程来发现有效的备忘录程序。每个候选程序在“先更新再检索”协议下进行评估,该协议衡量其构建的记忆是否在保留任务上提升了表现。然后,使用由此产生的轨迹和检索到的记忆,由一个元智能体诊断弱点并生成改进的后代。为了在有限评估预算下使搜索高效,**AutoMMemo** 采用预算感知的树搜索策略,平衡对已有希望程序的重评估与新记忆设计的探索。
实验表明,自适应学习到的记忆机制在 GUI/网页导航和多模态视觉推理基准上持续提升了智能体表现。与无记忆智能体和人工固定的记忆设计相比,**AutoMMemo** 发现的备忘录程序带来了更强的任务表现,同时维持了合理的交互和 token 成本。进一步的迁移分析显示,有效的记忆策略并非仅仅过拟合于单一基准或模型,而是能在不同环境和执行智能体间提供可测量的收益。此外,我们的搜索过程分析揭示,**AutoMMemo** 通过保留有用经验模式、去除噪声或冗余信息,并逐步提升检索相关性,从而逐步优化记忆设计。这些结果共同表明,记忆设计本身是多模态智能体优化的关键对象,且学习如何结构化和检索经验能够显著超越固定记忆模式下的经验驱动学习。
## 2 相关工作
**借助记忆进行经验学习**。记忆增强的经验学习已成为使智能体从过去交互中改进的核心范式 (Gao et al., 2025; Fang et al., 2025)。现有方法主要聚焦于从交互轨迹中提取和表示经验,且大多依赖人工设计的记忆模式。在文本设置中,经验通常以预定义形式表示,如洞见 (Shinn et al., 2023; Zhao et al., 2024; Fu et al., 2024; Zhang et al., 2025a)、技能 (Wang et al., 2024; Chen et al., 2024; Xia et al., 2026) 或结构化工作流 (Wang et al., 2025)。这些表示实现了经验重用,但由设计固定,需要人工指定。近期工作通过引入额外感官信号将此范式扩展到多模态设置 (Sarch et al., 2024; Chhikara et al., 2025; Yuan et al., 2026; Chen et al., 2026)。例如,Bo 等人 (2025);Jiang 等人 (2026) 用视觉信息增强经验提取,而 Liu 等人 (2025) 通过图结构记忆建模跨模态依赖关系。尽管有这些扩展,它们仍然依赖预定义记忆格式和人工设计的表示结构。
**自动记忆设计**。为克服人工设计记忆模式的局限性,近期工作探索自动记忆设计,即智能体学习优化自身记忆。在文本设置中,现有方法可根据设计空间大致分类。第一类工作在受限设计空间内操作,记忆使用预定义组件定义。这些组件可能对应单一形式的经验 (Zhou et al., 2026; Zhang et al., 2026; Huang et al., 2026),或多种预定义记忆结构的组合 (Zhang et al., 2025b),并在此基础上进行优化或选择。第二类工作探索更开放的设计空间,记忆以可执行程序或策略形式定义并优化 (Xiong et al., 2026; Pan et al., 2026)。尽管有这些进展,现有方法仍主要局限于纯文本环境,难以泛化到多模态经验。一项并行研究将自动记忆设计扩展到多模态设置 (Liu et al., 2026);然而,它主要针对问答任务,使得学习可泛化且灵活的多模态经验记忆机制这一更广泛挑战仍未解决。
参见图注
图 1:**AutoMMemo** 概览。它在可执行备忘录程序上搜索,这些程序指定如何存储和检索多模态经验。每个候选程序通过“先更新再检索”协议在保留任务上评估,由此产生的轨迹和分数用于推导基于反思的改进洞见以进行程序变异。预算感知的树搜索维护一个备忘录结构树,并决定是重新评估现有节点还是生成新后代。
## 3 方法
我们提出 **AutoMMemo**,一个用于从多模态经验中学习自适应记忆机制的通用框架。如图 1 所示,**AutoMMemo** 包含四个阶段。首先,我们定义一个统一的备忘录程序接口,保持评估可比性的同时使内部记忆机制保持开放(第 3.1 节)。其次,我们使用“先更新再检索”协议评估每个候选程序,衡量该程序能否将过去片段转化为对保留任务有用的上下文(第 3.2 节)。第三,我们利用执行证据诊断记忆失败并将程序变异为改进的后代(第 3.3 节)。最后,我们通过树搜索策略分配有限的评估预算,平衡对现有程序的重新测试与新记忆设计的探索(第 3.4 节)。
### 3.1 可执行备忘录程序
一个备忘录程序 \(m\) 是一个可执行的 Python 程序,包含两个操作:\(m.\mathrm{update}(e)\) 和 \(m.\mathrm{retrieve}(e)\),其中 \(e\) 表示一个片段记录器。更新操作将过去经验纳入内部记忆状态,而检索操作为新任务返回一个记忆载荷。该接口固定了记忆的外部契约,但使内部机制保持开放。片段记录器提供多模态经验的统一表示。它可以包含任务指令、视觉观察、环境状态、行动历史、模型消息、任务特定元数据和最终结果。检索到的记忆载荷可能包含文本摘要、视觉参考、结构化元数据或多模态嵌入。文本字段注入到智能体提示中,而视觉参考可作为额外的视觉输入提供。
在此抽象下,一个备忘录程序可以实现不同的记忆策略:存储什么、如何总结轨迹、如何索引文本和视觉观察、如何将状态与行动和结果关联、以及如何排序检索到的记忆。程序可以使用一组受控的通用原语,例如嵌入模型、多模态模型调用、向量存储、图工具和轻量级数据库。在搜索过程中,执行智能体、环境和评估器是固定的;只有备忘录程序被优化。因此,每个候选程序根据相同评估协议下的下游奖励进行评判。
### 3.2 先更新再检索评估
给定一个候选备忘录程序 \(m\),**AutoMMemo** 评估它能否将过去的多模态经验转化为对未来任务有用的上下文。令 \(\mathcal{D}_{u}\) 为一组更新片段,\(\mathcal{D}_{r}\) 为一组不相交的检索时任务。更新片段通过相似文章
AutoMem: 作为认知技能的记忆自动化学习
AutoMem 引入了一个框架,将记忆管理作为 LLM 的可训练技能进行自动化学习,通过优化记忆结构和熟练度,将长期任务的性能提升 2-4 倍。
MemEye:面向多模态智能体记忆的视觉中心评估框架
MemEye 是一个视觉中心的评估框架,通过衡量 8 个生活场景任务中的视觉证据粒度和检索复杂度来评估多模态智能体记忆。该框架揭示了当前架构在保留细粒度视觉细节和推理随时间变化的状态方面仍然存在困难。
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
MementoGUI:学习智能体多模态记忆控制以支持长时域GUI代理
MementoGUI 提出了一种用于 GUI 代理的插件式智能体记忆框架,该框架使用学习到的控制器进行选择性记忆管理与检索,通过压缩的视觉与文本表示提升了长期任务的性能。
AdMem:面向任务求解智能体的高级记忆系统
本文介绍AdMem,一种面向基于LLM的智能体的统一记忆框架,整合语义记忆、情景记忆和程序性记忆,并采用双层短期与长期存储结构,通过多智能体架构实现自动记忆生成与自适应检索。实验表明,该方法在长程多轮任务中提升了鲁棒性和成功率。