MindMemOS:面向AI智能体的可移植、自进化记忆操作系统层
摘要
本文介绍了MindMemOS,一个面向AI智能体的可移植、自进化记忆操作系统层,采用统一的实体-属性-时间结构,并具备记忆精炼和技能进化算法。它在LOCOMO和PersonaMem基准上取得了显著准确率,并将SpreadsheetBench性能提升了9.2个百分点。
arXiv:2608.12428v1 公告类型:新
摘要:记忆是AI智能体的核心组成部分,使其能够积累经验、保持个性化并适应长期交互。然而,现有的记忆系统在开发后往往保持不变,限制了其通过持续使用来调整记忆模型、组织策略和程序性知识的能力。我们提出了MindMemOS,一个可移植且自进化的记忆操作系统层,使用统一的实体-属性-时间结构来组织开放世界信息。MindMemOS支持场景自适应记忆建模、高阶模式发现、自主记忆精炼和持续技能进化。其MindMemEvolve算法采用验证驱动的进化搜索来优化目标场景的记忆模式,而dreaming机制通过合并冗余记录和解决冲突来整合累积的记忆。此外,隐式纠正反馈作为人在环路信号,用于识别和修正可能不准确或不对齐的记忆。其MindSkillEvolve算法进一步将智能体执行轨迹转化为可重用且逐步精炼的技能。MindMemOS在LOCOMO上达到94.03%的准确率,在PersonaMem上达到70.63%。MindSkillEvolve相比初始技能基线,将SpreadsheetBench成功率提升了9.2个百分点。
查看缓存全文
缓存时间: 2026/08/14 09:25
# MindMemOS:为AI智能体打造的可移植自进化记忆操作层 来源:https://arxiv.org/html/2608.12428 2026年8月12日 ![[无标题图片]](https://arxiv.org/html/2608.12428v1/figures/noah_ark_logo_cropped.png) MindMemOS:为AI智能体打造的可移植自进化记忆操作层 MindMemOS团队 华为诺亚方舟实验室 ## 摘要 记忆是AI智能体的核心组成部分,使智能体能够积累经验、保持个性化,并在长期交互中不断适应。然而,现有的记忆系统在开发完成后往往固定不变,限制了其通过持续使用来调整记忆模型、组织策略和程序性知识的能力。我们提出了MindMemOS,一个可移植且自进化的记忆操作层,采用统一的实体–属性–时间结构来组织开放世界信息。MindMemOS支持场景自适应记忆建模、高阶模式发现、自主记忆精炼以及持续技能进化。其MindMemEvolve算法采用验证驱动的进化搜索,针对目标场景优化记忆模式,同时通过“梦境”(Dreaming)机制整合累积的记忆,合并冗余记录并解决冲突。此外,隐式纠正反馈作为人在环路(human-in-the-loop)信号,用于识别和修正可能不准确或不对齐的记忆。其MindSkillEvolve算法进一步将智能体执行轨迹转化为可复用且逐步精炼的技能。MindMemOS在LOCOMO上达到94.03%的准确率,在PersonaMem上达到70.63%。MindSkillEvolve使SpreadsheetBench的成功率相比初始技能基线提升了9.2个百分点。 [![[无标题图片]](https://arxiv.org/html/2608.12428v1/figures/github-mark.png)https://github.com/mindscale-noah/MindMemOS](https://github.com/mindscale-noah/MindMemOS) 参考图注 图1:(a)LOCOMO——总体准确率(%)。灰色:基线。蓝色:MindMemOS。(b)PersonaMem——总体准确率(%)。(c)梦境(GPT-5-mini)——左侧:事实整合(FactConsolidation)总体准确率。右侧:梦境前后活跃记忆量(AMCR 22.5%)。(d)技能进化——SpreadsheetBench成功率(%)。 ## 1 引言 基于大语言模型(LLM)的智能体正越来越多地集成到软件工程、办公自动化、信息处理以及其他知识密集型工作流中。诸如OpenClaw等系统支持在个人电脑上执行任务[22 (https://arxiv.org/html/2608.12428#bib.bib21)],而包括Claude Code[2 (https://arxiv.org/html/2608.12428#bib.bib22)]、OpenAI Codex CLI[21 (https://arxiv.org/html/2608.12428#bib.bib23)]和OpenCode[1 (https://arxiv.org/html/2608.12428#bib.bib24)]在内的编码智能体框架则协助用户完成长周期软件开发任务。随着这些智能体参与重复交互,它们需要保留用户偏好、先前获取的知识、任务相关资源以及程序性经验,这些已超出单个上下文窗口的容量。因此,记忆充当外部信息基质,支持长期个性化、知识复用和经验积累[12 (https://arxiv.org/html/2608.12428#bib.bib27),4 (https://arxiv.org/html/2608.12428#bib.bib26),36 (https://arxiv.org/html/2608.12428#bib.bib25)]。 现有关于智能体记忆的研究大致沿两个方向展开:记忆模型和记忆系统。记忆模型将需保留的信息编码到模型参数或潜在表示中。基于参数的方法通过适配器、快速参数或测试时训练机制纳入定制信息[3 (https://arxiv.org/html/2608.12428#bib.bib5),38 (https://arxiv.org/html/2608.12428#bib.bib6),31 (https://arxiv.org/html/2608.12428#bib.bib7)],而潜在记忆方法则在专用表示空间中维护信息,例如G-MemLLM[29 (https://arxiv.org/html/2608.12428#bib.bib29)]、MemoryLLM[28 (https://arxiv.org/html/2608.12428#bib.bib3)]、G-Memory[30 (https://arxiv.org/html/2608.12428#bib.bib8)]和LatentMem[8 (https://arxiv.org/html/2608.12428#bib.bib10)]。这些方法可以改善依赖记忆的推理,但通常依赖于特定模型的架构或额外的训练流程,这可能限制其跨基础模型和智能体运行时的可移植性。动态记忆管理方法进一步通过元进化、强化学习和基于技能的机制来优化组织[32 (https://arxiv.org/html/2608.12428#bib.bib9),34 (https://arxiv.org/html/2608.12428#bib.bib11),33 (https://arxiv.org/html/2608.12428#bib.bib12)],但仍然与特定训练课程或任务环境紧密耦合,限制了跨领域迁移能力。 记忆系统则将信息外部化为文本或结构化存储,并使用LLM驱动的工作流进行记忆提取、检索和维护。代表性系统包括Mem0[5 (https://arxiv.org/html/2608.12428#bib.bib1)]、memU[20 (https://arxiv.org/html/2608.12428#bib.bib32)]、Zep[25 (https://arxiv.org/html/2608.12428#bib.bib13)]、Mirix[27 (https://arxiv.org/html/2608.12428#bib.bib14)]、MemOS[17 (https://arxiv.org/html/2608.12428#bib.bib2)]、EverOS[10 (https://arxiv.org/html/2608.12428#bib.bib15)]、MemBrain[6 (https://arxiv.org/html/2608.12428#bib.bib30)]和VikingMem[7 (https://arxiv.org/html/2608.12428#bib.bib16)]。一些系统主要强调事实记忆的提取与检索,而以经验为导向的方法(如ExpeL[37 (https://arxiv.org/html/2608.12428#bib.bib4)]和SCOPE[23 (https://arxiv.org/html/2608.12428#bib.bib31)])则专注于总结可复用的任务知识或优化程序性指导。这些系统证明了外部记忆的实用价值,但其记忆提取策略、建模结构和组织策略通常针对特定场景配置,在部署后基本保持不变[35 (https://arxiv.org/html/2608.12428#bib.bib28)]。 这种僵化性带来了三个挑战。首先,非结构化的记忆表示可能具有可移植性,但对细粒度组织和时间推理的支持有限;而手工设计的模式可以捕获特定于场景的信息,但在目标领域变化时需要大量调整。其次,持续累积的记忆可能包含冗余、过时信息和相互冲突的陈述,需要在在线提取和检索之外进行系统性维护[15 (https://arxiv.org/html/2608.12428#bib.bib19),16 (https://arxiv.org/html/2608.12428#bib.bib20)]。第三,记忆内容和程序性技能通常分开管理,难以将累积的执行经验转化为可复用且逐步精炼的智能体能力。 为应对这些挑战,我们提出了MindMemOS,一个为AI智能体打造的可移植自进化记忆操作层。MindMemOS使用统一的实体–属性–时间结构对开放世界信息进行建模,同时支持免建模和模式引导的记忆生成。一个紧凑的搜索模块通过混合稀疏–稠密匹配以及实体、属性、关系和时间关联的双向遍历来检索信息。在此表示之上,MindMemOS引入了四种互补的进化机制。MindMemEvolve使用验证驱动的进化搜索,使记忆模式适应目标场景,并发现与任务相关的一阶和更高阶属性。Dreaming(梦境)在离线时段整合累积的记忆,通过合并冗余记录、解决冲突并保留来源信息;而Feedback(反馈)则利用用户的纠正信号来识别和修正可能不准确或不对齐的记忆。MindSkillEvolve进一步将智能体执行轨迹转化为可复用的技能更新,通过无监督或分数引导的精炼实现。 我们的主要贡献如下: 1. **场景自适应记忆建模**。我们引入了一种实体–属性–时间记忆结构,将事实、关系、画像和时间信息组织在统一表示中。同一系统既支持开放域的普通摄取(vanilla ingestion),也支持模式引导的提取,从而无需改变周围的智能体接口即可调整记忆建模。 2. **主动记忆模式发现**。我们提出了MindMemEvolve,一种LLM引导的进化搜索算法,利用任务特定的评估信号优化记忆模式。通过错误信息驱动的突变、探索性突变、交叉和选择,它调整实体和属性定义,并发现与目标场景相关的更高阶模式。 3. **持续记忆精炼**。我们引入了梦境机制,在离线时段整合累积的记忆,通过合并冗余记录、解决冲突并保留来源信息。互补地,显式和隐式反馈机制利用用户的纠正信号来识别和修正可能不准确或不对齐的记忆,同时区分临时任务纠正与持久记忆更新。 4. **经验驱动的技能进化**。我们引入了MindSkillEvolve,它从累积的使用经验中持续精炼技能。该算法分析智能体执行轨迹,识别有效策略和反复出现的失败,并通过无监督或分数引导的进化将其转化为带版本的技能更新。 ## 2 系统概述 ### 2.1 系统架构 如图2 (https://arxiv.org/html/2608.12428#S2.F2)所示,MindMemOS采用分层架构,将智能体集成、记忆算法和记忆结构(建模与存储)解耦。在其基础层,记忆结构层负责组织记忆建模管理、记忆存储和技能。在此表示之上,记忆算法层支持完整的记忆生命周期:MindVanilla策略和MindSchema策略、紧凑的基于图的检索、反馈和梦境驱动的质量优化,以及轨迹驱动的技能进化。智能体与应用层通过统一的服务抽象暴露这些能力,使MindMemOS能够通过基于FastAPI的HTTP API、SDK、CLI命令、OpenClaw插件或技能灵活集成到多种智能体框架中,同时在应用运行时之外持续优化记忆内容。 参考图注 图2:MindMemOS的系统架构。 ### 2.2 场景自适应记忆建模 记忆建模构成记忆系统的基础,定义了用于添加、搜索及相关操作的数据结构和关联算法。如第1节 (https://arxiv.org/html/2608.12428#S1)所述,我们的设计采用场景自适应记忆建模,将开放世界的文本信息组织为针对目标场景定制的结构化表示。我们的记忆模型包含三个建模维度: 参考图注 图3:MindMemOS的3D记忆结构,沿实体、属性和时间维度组织。 #### 三维记忆结构。 我们的记忆系统以实体、属性和时间定义的三维(3D)图来组织记忆,从而构建并维护一个基于信息的真实世界虚拟表示。每条记忆记录都与一个实体、一个描述该实体特定属性或方面的属性,以及一个指示该信息何时有效或被观察到的时间参考相关联。该图还捕获实体之间的语义关系,以及同一实体–属性对关联的连续记录之间的时间关系。这些关系和时间的链接共同支持在相互关联的实体和演化信息之间进行可追踪的导航。 #### 实体维度。 实体维度标识记忆所描述的主体,例如人、组织、地点、事件或工件。实体充当从不同对话、文档和交互中收集信息的锚点。实体之间的关系捕获语义联系,如参与、所有权、位置或社会关系。 #### 属性维度。 属性维度指定记忆所描述的实体的特定属性或方面,例如偏好、活动、经验、关系或行为模式。在场景自适应记忆建模下,属性集合不限于固定的通用模式;相反,属性定义可以根据目标场景的信息需求进行调整。属性既可以表示来自单个观察的显式事实,也可以表示跨多个观察综合得到的高阶模式。 #### 时间维度。 时间维度表示信息有效、被观察或被记录的时间。一条时间记忆记录将实体和属性绑定到特定的内容项及其时间参考。与同一实体–属性对关联的连续记录形成时间线,使系统能够表示更新、变化的偏好以及可能冲突的版本,而不会覆盖其历史上下文。 ## 3 算法 在3D记忆结构的基础上,本节介绍MindMemOS的核心算法,包括两种记忆生成算法、紧凑检索、基于梦境和反馈的记忆精炼、离线记忆自进化,以及轨迹驱动的技能进化。 ### 3.1 记忆添加:MindVanilla #### 轮次感知的输入处理。 MindVanilla生成不依赖预定义实体–属性模式来处理对话和自由文本。它根据对话角色和时间间隔将消息分组为轮次,将完整轮次打包到令牌限制的块中,并在必要时压缩超长轮次。每条可提取的消息都被规范化,并关联到一个保留其角色、时间戳和原始位置的来源引用。 #### 召回感知的记忆提取。 对每个块,系统通过内容哈希匹配、可用时的实体重叠和BM25检索来检索相关的活动记忆,候选结果使用加权倒数排名融合(weighted reciprocal rank fusion)进行组合。提取器接收一个结构化信封,将可提取的证据与上下文信息分开:只有前者的内容可以支持新的记忆内容,而历史和召回的记忆用于消歧、重复检测和冲突评估。生成的记忆表示为扁平记录,并分配粗粒度的语义类型,例如用户画像、事实、情景记忆、工具痕迹、经验或技能候选。 #### 去重与动作规划。 所有块中产生的候选对象按内容哈希和记忆类型进行去重。在解析其来源引用后,一个确定性的安全门验证候选对象,并将其映射为添加(Add)、强化(Reinforce)、更新(Update)、合并(Merge)或跳过(Skip)。接受的操作在需要时进行向量化,并与其来源和记忆关系链接一起存储。 ### 3.2 记忆添加:MindSchema 我们进一步详细阐述基于实体建模的3D记忆结构的动态生成过程。如图4 (https://arxiv.org/html/2608.12428#S3.F4)所示,记忆生成流水线包括以下步骤: 参考图注 图4:MindSchema记忆生成流水线:情节切分、记忆生成、实体融合和图合并,由记忆建模引导。 #### 情节切分。 我们使用基于LLM的记忆切分器将收到的消息列表划分为完整的子主题情节。在同步模式下,当前对话中的整个消息列表
相似文章
MemoryOS —— 具备时序知识图谱的 AI 智能体记忆,实现 9ms 摄取与 78ms 检索
MemoryOS 是一款开源、可自托管的 AI Agent 记忆工具,它利用时序知识图谱技术,在 LongMemEval-s 基准测试中实现了 86.2% 的准确率,并以 78 毫秒的快速检索速度著称。
@omarsar0: // AutoMem // 我非常喜欢这个元记忆的概念。(标记一下) 这项来自斯坦福的新研究将智能体的记忆…
这篇斯坦福研究论文介绍了AutoMem,这是一个将智能体记忆管理视为可训练技能的框架。通过分别优化记忆结构和熟练度,AutoMem在长周期任务上将基础智能体性能提升了2到4倍,使得一个32B开源权重模型能够与Claude Opus 4.5和Gemini 3.1 Pro Thinking等前沿系统竞争。
SelfMem: 面向AI智能体的自优化记忆框架
SelfMem提出了一种面向AI智能体的自优化记忆框架,使其能够通过记忆工具和反馈信号探索、评估和优化自身的记忆策略,在BEAM基准测试上,于大型对话规模下相较于基线方法取得了显著改进。
EverMemOS: 面向结构化长程推理的自组织记忆操作系统
EverMemOS 是一种面向大语言模型的自组织记忆操作系统,通过将对话结构化为记忆单元和场景来增强长程推理能力。
@DanKornas: 一个会忘记之前交互的智能体每次任务都必须重建上下文。MemOS 是一个内存操作系统,用于…
MemOS 是一个为构建 LLM 应用和 AI 智能体的开发者提供的开源内存操作系统,通过统一的 API 提供持久化、可编辑的内存,支持多模态内存和异步摄入等特性。