Fortunate Recall:基于本体的LLM记忆生命周期管理,实现持久一致性

arXiv cs.AI 论文

摘要

本文介绍了Fortunate Recall,一种基于本体的策略层,用于管理LLM中的记忆生命周期。它将个人信息分类为行为类别,并应用差异策略来提高一致性和减少幻觉,在基准测试中优于现有系统。

arXiv:2609.10413v1 Announce Type: new 摘要:当前LLM记忆系统将所有个人信息同等对待,导致存储无限增长而检索精度下降。核心挑战是生命周期管理:哪些记忆应持久,哪些应替换,以及替换速率如何,这取决于每个事实的行为类型。Fortunate Recall (FR) 是一个可组合的策略层,将个人信息分类为10+1行为本体,并应用类别特定的生命周期策略(差异时间衰减、槽键取代、事件时间有效性和类别感知检索路由),作为LLM提取元数据的确定性函数。我们的基础设施无关实现FR-Bank,在新的516题时间消歧基准LifecycleBench上达到76.9%的通过率,领先于Mem0、A-MEM、Memory-R1和MemoryOS(61%至70.5%),并在标准的Wu等人评估协议下,在完整的LongMemEval-S上达到75.2%,表明生命周期策略对标准检索没有可测量的成本。一项预注册的消融研究定位了收益:将类型化层替换为三个通用生命周期原语,正确性在统计上保持不变(-1.7个百分点,95% CI [-6.0, +2.7]),因此通用生命周期元数据带来了正确性优势,而行为本体提供了校准,将下游幻觉减半(12.0% vs 24.2%,p<0.001)。端到端来看,FR-Bank将已回答查询的幻觉从Mem0的45.1%降至22.4%,所有查询的幻觉从32.2%降至13.0%,同时正确回答更多查询(31.2% vs 18.6%);这一排名在开源权重Kimi K2.5上得以重现。该分解可转移到独立构建的基准BEAM:在280个问题中,正确率为46.8% vs Mem0的32.9%,本体的好处集中在矛盾解决上,并在大约七个策略簇时饱和。本体、基准和代码已发布。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:45

# 本体驱动的记忆生命周期管理:确保大语言模型的持久一致性
来源:https://arxiv.org/html/2609.10413

## 幸运召回:基于本体的记忆生命周期管理实现大语言模型的持久一致性
###### 摘要
当前的大语言模型记忆系统将所有个人事实同等对待,以统一的保留策略将其存储在扁平向量存储或知识图谱中,导致存储空间无限增长的同时检索精度下降。核心挑战在于生命周期管理:根据每种事实的行为类型,决定哪些记忆应持久保留、哪些应被替换,以及以何种速率进行。幸运召回是一个可组合的策略层,它将个人事实分类到10+1的行为本体中,并基于大语言模型提取的元数据,应用特定类别的生命周期策略(差异化时间衰减、槽键替代、事件时间有效性、类别感知检索路由)作为确定性函数。生命周期策略层是纯数学的;大语言模型仅在摄入阶段和检索时的一个轻量级候选选择步骤中使用。我们的基础设施无关实现FR-Bank,在包含516个问题的时间消歧基准测试LifecycleBench上达到了76.9%的通过率,超越了Mem0(61%)、A-MEM(65.3%)、Memory-R1(66.9%)和MemoryOS(70.5%),并在Wu等人(ICLR 2025)的规范判断协议下的完整500题LongMemEval-S基准测试中达到75.2%,这表明生命周期策略不会对标准检索任务带来可测量的总成本。一项预注册的消融研究定位了收益的来源。用三种通用的生命周期原语替代类型化层,配合仅语义排序器,在统计学上正确性不变(Δ = -1.7个百分点,95%置信区间[-6.0, +2.7],不显著),因此*通用的生命周期元数据*带来了正确性优势;而行为本体带来的则是校准能力,通过使类别特定参数化可行(在无法找到单一全局权重的情况下),将下游的虚构率减半(所有查询中12.0% vs. 24.2%,p < 0.001)。端到端地,FR-Bank将Mem0的虚构率从回答查询的45.1%降至22.4%,从所有516个查询的32.2%降至13.0%,同时正确回答了更多问题(31.2% vs. 18.6%);该层级结构在开源权重模型Kimi K2.5生成器上得到复现,而将Mem0的提取器升级到gpt-4.1-mini缩小了检索差距,但未触及它在替代和撤回方面的结构性缺陷。该分解可迁移到独立于本工作构建的基准测试BEAM(ICLR 2026):在280个问题上正确率46.8% vs. Mem0的32.9%,其中+23至+26来自通用元数据,+10至+13来自本体,收益集中在矛盾解决上。一个六点粒度扫描显示本体的益处在大约七个有效策略聚类处达到平台期,因此10+1是该平台上的一个可解释点,而非唯一必要的粒度。本体、基准和代码将作为补充材料发布,并在论文发表后公开。

## 1引言
大型语言模型在长期对话中会失去连贯性,因为现有的记忆系统对所有个人事实一视同仁。用户的种族、当前的食物偏好以及六个月前的牙科预约共存于同一个存储中,具有相同的检索优先级,但它们适当的持久性动态却相差几个数量级。核心挑战并非检索,而是*生命周期管理*:根据每种事实的行为类型,确定哪些记忆应持久保留、哪些应被替换以及以何种速率进行。在基于大语言模型智能体记忆的早期工作基础上,近期系统建立了强大的基础设施:时间感知知识图谱(Zep/Graphiti)、卡片盒笔记组织(A-MEM)、受操作系统启发的层级结构(MemoryOS)、通过强化学习学习的操作(Memory-R1)以及自适应结构选择(FluxMem)。这些系统都无法区分当前的偏好与被替代的偏好,无法识别已过期的物流信息,也无法建模即将到来的截止日期;现有的基准测试同样无法衡量系统能否区分当前与过时的状态。

我们提出幸运召回,这是一个可组合的生命周期策略层,它将每个提取的事实分类到10+1的行为类别之一(表1)——不是认知类型(情景/语义/程序性),而是直接决定时间动态的行为领域——并应用特定类别的衰减、替代、事件时间有效性和路由策略作为确定性函数。每个检索决策都是单一闭合形式对数分数中的一个命名项,没有学习的黑箱介导生命周期行为,中位延迟为47微秒,且经验上线性缩放O(k)。

贡献:
1.  一个源于个人事实随时间变化方式的行为本体,具有按类别的确定性生命周期策略(表1)。
2.  一个关于元数据基(c, κ, ξ, h)的生命周期不可识别定理,包含充分性、最小性和个体必要性结果;这些是关于*基*的表示层结果,并未声称10+1的划分、速率或流水线是最优的(§4界定了每项主张的范围)。
3.  LifecycleBench,一个包含516个问题的时间消歧基准测试,覆盖40个人物和9种攻击向量,定位为一个密集的生命周期压力测试,而非第一个涉及时间更新的基准测试。
4.  FR-Bank,基础设施无关的参考实现,在LifecycleBench上达到76.9%,在Wu等人的协议下的完整LongMemEval-S上达到75.2%,通过七种配置和两个生成器家族,在已回答查询和全查询分母下进行了端到端验证。
5.  一项归因与迁移研究,分离了该技术栈的两个层:一项预注册的无类型消融研究、迁移到独立构建的BEAM基准测试、六点粒度扫描、完整的元数据噪声网格以及对我们自身判断器的两次机器审计。本体、基准、代码、预注册文件和原始逐问题判断结果已发布,并将在论文发表后公开。

## 2相关工作与差距分析
现有系统表现出互补性的差距,在表32中逐特性映射(附录E);我们总结其模式而非逐一列举。扁平向量存储(Mem0)和动态组织器(A-MEM)没有提供结构化的生命周期。认知类型分类(MemoryOS, MIRIX)描述的是记忆的*形式*而非*行为*:慢性疾病和午餐订单都是“语义”类型,但需要截然不同的动态。Memory-R1通过在平坦的{添加, 更新, 删除}空间(不包含过期或撤回操作)上进行强化学习来学习操作,因此其差距在于词汇而非优化。MemoryBank应用艾宾浩斯曲线,对所有事实类型使用统一的衰减率。MemGPT和(在查询时)APEX-MEM将生命周期决策委托给大语言模型推理——这在策略是确定性的幸运召回场景下是昂贵且不透明的——且两者都不对事实进行分类、应用差异化衰减或建模事件时间有效性。Zep/Graphiti提供生产级时间知识图谱,但没有遗忘机制且仅有二元替代;FluxMem适应记忆的*结构*而非*策略*。幸运召回的双时态表示与时间数据库中的有效时间/事务时间区分并行扩展,增加了行为条件。

基准测试:LongMemEval和LoCoMo衡量长期检索,但不测试系统是否能区分当前与过时的状态,而BEAM跨越十种记忆能力,上下文高达10M个令牌,其中一些对生命周期敏感。因此,我们将LifecycleBench定位为一个*密集的生命周期压力测试*,而非第一个涉及时间更新或遗忘的基准测试,每个问题的构造都使正确答案依赖于生命周期状态。由于我们同时引入了基准测试和方法,§6.6将相同的比较迁移到我们未构建的BEAM上。

与认知类型学的区分:MemoryOS和MIRIX按认知类型(情景/语义/程序性)分类,这描述的是记忆的*形式*。我们的本体描述的是*行为领域*:父母的慢性疾病在认知类型学中是“语义”,在我们的本体中是“健康与福祉”;会议时间也是“语义”,但属于“物流上下文”。认知类型不决定适当的生命周期动态;行为领域才决定。

## 3幸运召回
(图注:幸运召回架构及大语言模型/生命周期数学边界。*摄入*(顶部,异步):每个轮次进行一次gpt-4.1-mini调用,提取每条边e并为其标记行为类别c、槽键κ、生命周期状态ξ、事件时间锚点h、摄入时间t和置信度v;t和h是两个独立的时钟(双时态)。*检索*(底部,每个查询):混合候选生成通过一次小型模型调用精简到前20个,然后由*确定性生命周期层*根据公式(2)的闭合形式对数分数进行排序。该流水线每个轮次恰好使用两次大语言模型调用,且每个生命周期决策都是ℓ中的一个命名项,可在毫秒延迟内按边和项进行检查。)

架构(图1)包括一个采用既定模式(双时态有效性、混合检索)的基础设施层,以及一个提供行为动态的生命周期策略层。

### 3.1行为本体
每个提取的事实根据其随时间的变化方式(而非认知形式)被分类到10+1的行为类别之一(表1)。类别决定了事实的完整生命周期——衰减率、替代语义、过期逻辑和检索路由——因此,慢性疾病和午餐订单(在认知类型学中都是“语义”)会得到其时间行为所需的策略。

基于经验的设计。我们最初的8+1设计中存在“身份引力阱”(身份类吸收了约38%的所有事实),这促使我们将其三分为身份、爱好和偏好;情绪状态被排除为一个类别,因为情绪会调节其他类别,而非构成一种记忆类型。事实进行软聚类,成员权重之和为1.0,因此有效衰减率是特定类别速率的加权调和平均值(引理1;软成员统计、粒度扫描和类别内方差比较见附录A.5,附录B中的图2说明了端到端的替代和事件时间有效性)。

### 3.2分类事实,而非实体
分类必须针对*事实*(关系边),而非会话话语或实体节点。话语级别分类会混淆对话框架与被记忆的信息(“我在更新保险文件时改了姓氏”是关于身份,而非义务)。实体级别分类会为恰好涉及同一节点的边分配错误的生命周期策略(“Alex钓到了7条鲈鱼”应该归类为爱好,而非仅仅因为Alex是一个人就归类为关系)。事实级别分类确保每条边根据其代表的内容获得相应的类别。一个可重复的三法官分类器一致性审计(κ = +0.67,带完整会话上下文)见附录B.1.1。

### 3.3生命周期机制
**差异化时间衰减。** 每个类别都有一个基础衰减率λc,其激活a(e) = exp(-λc · Δt)。速率跨越5.3倍范围,从身份(最慢)到物流(最快),经过校准以防止类别层级占用(附录I)。
**带置信度权重的槽键替代。** 对于具有*替换*语义的类别,规范化的(主体,属性)槽键会触发替代。高置信度矛盾会将旧边标记为不活跃;低置信度情况会保留两个值(软替代)。“考虑搬到伦敦”会保留“住在伊斯坦布尔”;“搬到伦敦”则替代了它(附录F)。
**事件时间有效性与预期激活。** 对于义务和物流,激活由距离事件的时间决定,而非自创建起的时间。截止日期在接近时会*增加*激活度,然后在过后过期。一个日期感知过滤器,在重排序前会绕过查看已过去的日期事件。
**类别感知检索路由。** (此处内容被截断)

相似文章

面向长期LLM代理的检索驱动记忆再巩固

arXiv cs.CL

本文介绍了REALM,一个用于LLM代理长期记忆的框架,它利用检索驱动的再巩固来自主地将记忆组织成认知图,从而在长期记忆基准测试中取得更好的性能。

MoM: Memory of Memory

arXiv cs.CL

本文介绍了Memory of Memory (MoM),一个用于LLM代理记忆的框架,它在到达时提交当前值,同时保留被置换的值作为出处,从而提高准确性并减少陈旧的答案。

MemoryForge:为类人LLM智能体合成终身记忆

arXiv cs.CL

本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。

智能体LLM系统的共享选择性持久记忆

arXiv cs.AI

本文介绍了面向智能体LLM系统的共享选择性持久记忆,该记忆保留可复用的上下文(如任务规范和数据模式),同时丢弃会话特定的推理痕迹,在企业场景中实现了96%的任务完成率和显著的令牌成本降低。