记忆信任差距:持久记忆代理中的能力相关故障
摘要
本文研究了持久记忆AI代理如何过度信任过时的存储事实,导致模型能力所限制的故障,并评估了不同模型规模下的触发因素和缓解措施。
arXiv:2609.01852v1 公告类型:新
摘要:持久记忆支持个性化代理,但过时的存储事实可能在没有警告的情况下覆盖当前权威证据。我们研究随着模型能力变化,这种危害何时开始。我们评估了一个冻结的、封闭集的、动作评分的基准,包含两个套件,代表“无记忆”的两种不同含义(一个效益套件,没有存储事实无法解决;一个安全套件,其中权威工具始终持有正确值),在同一家族的模型规模系列(Qwen3 0.6/1.7/4/8B)上。记忆信任差距反映的是过度信任而非混淆。在效益套件中,模型在每个规模下以0.92-1.00的概率使用过时值回答。在安全套件中,陷阱条件下低于无记忆基线的危害($\Delta_{\mathrm{mem}}$)受能力限制,当过时笔记被伪装成当前时,大型模型崩溃最为严重。在一个$2\times2\times2\times2$因子设计中,哪个特征触发过度信任取决于特征和模型规模。移除标签在每个规模下都放大了过度信任,而一个最近性特征(过时日期更新)更易欺骗大型模型。来源权威性较弱且规模平坦,并且在Qwen3模型规模系列中,位置从正变为负。我们通过直接跨规模对比测试而非重叠的每模型区间来确认这些规模交互。缓解措施同样依赖能力:暴露元数据提高了能力较强模型的准确性,但只有预先解决冲突才能恢复2个较小检查点的准确性。相同的模式出现在独立的Llama-Instruct模型规模系列的能力较强模型和2个外部数据集(RGB,MisBench)上。一个框架控制发现记忆标签没有一致的优势:在3个较小规模下,模型更信任过时文档而非过时记忆;在8B时,差异不显著。
查看缓存全文
缓存时间: 2026/09/03 05:57
# 记忆信任差距:持久化记忆代理中能力依赖的故障
来源:https://arxiv.org/html/2609.01852
Jundong Hu††感谢:通讯作者 \(jundongh@alumni\.upenn\.edu\)\。Jundong Hu主导并完成了整个研究。Shekar Ramachandran机构:PayPal AI邮箱:[sheramachandran@paypal\.com](mailto:)
###### 摘要
持久化记忆支持个性化代理,但陈旧的存储事实可能在无预警的情况下覆盖当前的权威证据。我们研究随着模型能力变化,这种危害何时开始。我们在同族模型尺寸系列(Qwen3 0.6/1.7/4/8B)上评估了一个冻结的、封闭集、动作评分基准,该基准包含2个套件,代表“无记忆”的2种不同含义(一个收益套件,没有存储事实则无法解决;一个安全套件,其中权威工具始终持有正确值)。记忆信任差距反映的是过度信任而非混淆。在收益套件中,模型在所有尺寸下以0.92–1.00的概率使用陈旧值回答。在安全套件中,陷阱条件下低于无记忆基线的危害(Δmem\\Delta\_{\\mathrm\{mem\}\})是能力依赖的,当陈旧笔记被标记为当前时,较大的模型崩溃最为严重。在一个2×2×2×22\{\\times\}2\{\\times\}2\{\\times\}2因子设计中,哪些特征触发过度信任取决于特征和模型规模。移除标签在所有尺寸下都放大了过度信任,而时效性特征(陈旧但标注为更新)更易欺骗较大的模型。来源权威性较弱且与规模无关,并且在Qwen3模型尺寸系列中位置效应从正向变为负向。我们通过直接的跨尺寸对比测试(而非重叠的模型置信区间)确认了这些规模交互作用。缓解措施同样依赖能力:暴露元数据提高了能力较强模型的准确性,但只有预先解决冲突才能恢复两个较小检查点的准确性。同样的模式出现在能力较强的Llama-Instruct模型尺寸系列和两个外部数据集(RGB,MisBench)上。一个框架控制发现记忆标签没有一致优势:在三个较小规模下,模型更信任陈旧文档而非陈旧记忆;在8B时,差异不显著。
## 1引言
长期记忆是个性化代理的核心:一个记住您“常坐的航空公司”、您的默认会议室,或在您喜爱的餐厅点牛肉百叶或肋眼牛排的代理,可以代表您行动。其失效在于将存储的信息视为可信,而不检查它是否仍然有效。当存储的事实已过时(常坐的航空公司变了,会议室变了,或您出于某些原因不再想要牛肉百叶),一个读取记忆并据此行动的代理将自信地做错事,即使当前的权威上下文已包含正确答案。
先前工作已证实代理通常未能根据更新信息行动,并且提供的上下文可以覆盖参数知识(Chao等人,2026;Xie等人,2024;Longpre等人,2021)。然而,它并未确定随着能力变化这种危害何时开始,或哪些可观测的记忆特征会触发它。我们通过三个问题研究记忆结构和模型能力如何塑造这种失效:危害(§4)、触发因素(§5)和缓解措施(§6)。每个问题都有专门的结果部分。
#### 贡献:
- •一个基准:一个2套件、封闭集、动作评分的设计,分离了“无记忆”的两个不兼容含义,一个收益套件(存储事实必需;无记忆基线降至随机水平)和一个安全套件(权威工具始终持有正确值;无记忆基线封顶),并冻结和SHA-256固定(§3)。
- •危害结果:信任差距是过度信任而非混淆。陈旧值依赖性在整个模型尺寸系列中保持≈1.0≈\\\!1.0,但配对的净危害(Δmem\\Delta\_{\\mathrm\{mem\}\})是能力依赖的,仅当模型足够准确以至于陈旧值会损害其表现时才出现(§4–4.2)。
- •对触发因素的分解,使用因子设计和直接的跨尺寸交互测试,表明哪些记忆特征触发故障会随模型规模变化(§5)。
- •缓解研究,通过表示比较发现修复方法是能力依赖的:元数据提高了能力较强模型的准确性,而只有预先解决冲突才能恢复较小模型的准确性(§6)。
- •验证:外部(RGB,MisBench)和跨族(Llama-Instruct)证据,加上一个控制表明该效应非记忆特异性(§7)。
## 2相关工作
#### 陈旧记忆与下游故障。
最接近的先驱基准STALE(Chao等人,2026)评估代理是否对失效记忆采取行动(400个场景;最佳模型55.2%),并包含同族的Qwen3.5-9B/27B对。STALE已经确立了陈旧记忆的危害;我们增加了其能力解释。最直接相关的记忆研究MemSyco-Bench(Xiang等人,2026)询问代理是否遵循经验证据而非冲突的用户记忆,并且与我们类似,将结果准确性与记忆遵循率分开。我们将检索时覆盖视为既定事实,并研究它如何依赖于模型能力。相邻研究包括内部自我巩固漂移(Zhang等人,2026)(记忆降至无记忆基线以下的唯一先例,但来自大型语言模型重写自身存储而非外部注入的破坏)、无关大量内容的检索过载(Shao等人,2026),以及记忆更新修复和更新间隔缩放(Sun和He,2026;Patel,2026)。这些研究均未在同族0.6B→8B模型尺寸系列上运行受控的陈旧/当前4特征2×2×2×22\{\\times\}2\{\\times\}2\{\\times\}2因子设计并进行直接的特征×规模交互测试;该组合是我们比较的基础,配合收益/安全设计,测量低于无记忆基线的Δmem\\Delta\_{\\mathrm\{mem\}\}。
#### 知识冲突与权威特征。
这是上下文与参数知识的冲突,而非上下文学习(Longpre等人,2021)。Xie等人(2024)展示了每个模型在冲突中的单次“变色龙与顽固”结果,而Jeripity Venkata(2026)发现通用上下文冲突可划分为不同区间,与我们的发现一致:该效应非记忆特异性;我们的不同之处在于使这种让步依赖于规模并可分解为特征。一个特别相关的比较是ConflictBank(Su等人,2024),它跨越4个模型族和同族尺寸系列,包含时间冲突和证据顺序效应,并已报告较大的模型可能对冲突证据更敏感。ConflictBank不包括此处使用的受控因子和跨尺寸交互自举。AuthMem-Bench(Zhan等人,2026)在7个整合器和7个骨干网络中操纵来源权威性,但仅在写入时整合且无模型尺寸系列,仅触及我们的权威性切片。
#### 跨模型规模的位置效应。
作为规模函数的位置敏感性已被研究(Liu等人,2024;Gabín等人,2026;Byerly和Khashabi,2026),其中规模主要减少排序方差而非逆转它。我们的新元素是陈旧记忆设置中依赖规模的符号反转,而非位置×规模本身。最后,De Marez等人(2026)发现较大的指令微调模型对明显的谄媚翻转更稳健,与我们的时效性结果方向相反,这种对比我们在§8中展开。
## 3实验设置
我们在所有实验中使用相同的基准、4种记忆条件和指标,因此结果直接可比。接下来的部分报告危害(§4)、触发因素(§5)和缓解措施(§6)的结果。
### 3.1基准与2个套件
因为“无记忆”在此有两种不兼容的含义,我们将基准分为两个套件。在收益套件(A)中,任务没有存储事实就无法解决(“预订我常坐的航空公司”);没有当前上下文存在,因此无记忆基线降至随机水平,而关注的危害是过度信任陈旧的存储事实。在安全套件(B)中,权威工具在每个条件下都持有正确值,因此无记忆基线封顶;这里我们可以测量净危害,即遵循陈旧记忆而非当前权威值,导致准确性低于没有记忆的情况。
表1用一个安全套件场景具体说明了设计:一个权威日历工具在所有条件下都返回Room B,因此真实动作始终是Room B;只有存储的记忆在接下来的4种定义条件下变化。同一任务的收益套件版本仅省略工具,因此no\_memory无法恢复答案。
*基础场景*是一个具有固定真实动作和槽值的单个模板化情况(表1中的会议室预订就是一例);共享模板但从精选池中抽取不同槽值(其他会议室、用户或工具)的场景构成一个*模板族*。冻结的基准(v1)有300个基础场景(每个套件150个),从56个场景试点扩展而来,通过确定性精选池生成器生成,并通过SHA-256清单固定;每个套件的150个场景跨越33个模板族(§5中集群自举的重采样单位)。冻结前,作者手动审查了所有300个基础场景,逐个阅读以确认单一明确、与工具一致的真实动作、正确的套件和条件分配,以及无有害或敏感内容。
表1:一个安全套件基础场景(会议室预订)在所有4种记忆条件下的情况。一个权威日历工具在所有条件下返回Room B,因此真实动作始终是Room B;只有存储的记忆变化。stale和explicit\_conflict是危害条件,no\_memory是基线。
### 3.2条件与评分
每个项目产生一个受约束的动作。我们使用精确、正则表达式或规范匹配对动作进行评分,与构建时的真实值对比(无LLM评判),并通过人工阅读输出随机样本进行手动验证。基准使用4种条件:no\_memory(基线,在收益套件中封顶,在安全套件中封顶)、clean(记忆与真相一致;上限)、stale(记忆持有过时值;危害条件)和explicit\_conflict(陈旧值和正确值均存储;判定压力测试)。为了消除对答案选项的任何位置先验,我们使用循环选项排列平均法(noptions=3n\_\{\\text\{options\}\}\{=\}3,随机≈0.33≈0.33):每个场景在每个选项的循环轮换下评分,然后在任何比较前取平均。
### 3.3指标
我们报告两个独立的量。reliance是一种行为,即模型使用陈旧值的频率,而Δmem\\Delta\_{\\mathrm\{mem\}\}是相对于基线的度量:
reliance=P\(a^=astale\),Δmem=acc\(cond\)−acc\(no\_memory\),\\text\{reliance\}\\;=\\;P\\\!\\left\(\\hat\{a\}=a\_\{\\text\{stale\}\}\\right\),\\qquad\\Delta\_\{\\mathrm\{mem\}\}\\;=\\;\\mathrm\{acc\}\(\\text\{cond\}\)\-\\mathrm\{acc\}\\bigl\(\\text\{\{no\\\_memory\}\}\\bigr\),其中a^\\hat\{a\}是模型的动作,astalea\_\{\\text\{stale\}\}是陈旧值。循环平均后,reliance与位置无关,Δmem\\Delta\_{\\mathrm\{mem\}\}按场景配对。模型可以有reliance≈1.0\\\,\\approx\\\!1.0而Δmem\\Delta\_{\\mathrm\{mem\}\}危害小(基线弱)或大(基线强):当模型过度信任时,较大的模型有更多准确性可损失。因此,即使净危害量在不同模型大小之间不同,reliance仍可保持高位。对于安全套件,我们还报告能力阈值
ρ∗=min\{l:CI upper bound of staleΔmemat trap levell<0\},\\rho^\{\\ast\}\\;=\\;\\min\\bigl\\\{\\,\\ell\\;:\\;\\text\{CI upper bound of stale \}\\Delta\_\{\\mathrm\{mem\}\}\\text\{ at trap level \}\\ell\\;<\\;0\\,\\bigr\\\},这是遵循陈旧记忆开始产生显著净危害的第一个评估水平。统计单位是基础场景;所有区间是场景ID的95%百分位自举(“∗”表示置信区间不包括0,“ns”表示包括0)。
## 4问题1:危害与净危害的起始
过度信任出现在所有尺寸下,而不仅是能力较强的:在收益套件中,陈旧值依赖性在0.6B到8B之间为0.920.92–1.001.00。相比之下,危害是规模依赖的:较大的模型有更多准确性可损失,因此一旦陈旧笔记被标记为当前,尺寸加深损害而非防止它。
### 4.1过度信任是普遍的
图1和表2给出了主要结果。在收益套件中,陈旧值依赖性在0.6/1.7/4/8B下分别为0.92/0.99/1.00/1.00,配对的危害为Δmem\\Delta\_{\\mathrm\{mem\}\}==−0.33\-0.33/−0.35\-0.35/−0.35\-0.35/−0.37\-0.37(所有置信区间上界<0<0)。基线检查支持这种解释:收益套件的无记忆基线为0.35–0.37,置信区间包含随机水平(0.33),因此套件确实被封顶,stale下的崩溃不是格式化伪影。
explicit\_conflict条件最清楚地显示了差异。即使正确值存储在记忆中紧挨着陈旧值,依赖性交叉点为0.50/0.50/0.01/0.00:小模型即使正确值存在也有一半时间遵循陈旧值,而能力较强的模型则抵抗。这种模式与依赖存储值而非随机选择一致。
收益套件无法对explicit\_conflict给出清晰的净危害读数,因为该项提供了当前值,而no\_memory缺乏,因此Δmem\\Delta\_{\\mathrm\{mem\}\}在那里不是同类的净危害度量;干净的净危害证据存在于安全套件中(§4.2)。
图1:收益套件结果。*左:*按模型尺寸的陈旧值依赖性。*右:*按模型尺寸的配对Δmem\\Delta\_{\\mathrm\{mem\}\}(准确性减去no\_memory准确性)。虚线标记随机水平(0.330.相似文章
误判鸿沟:当记忆投毒在自主AI系统中看似模型故障
本文识别了多智能体AI流水线中的一种结构性缺陷,即记忆层攻击可能被误判为模型失调,形式化定义了语义规范漂移(SND),并提出反事实组合测试(Counterfactual Composition Testing)和持久记忆信息流控制(Memory-Persistent Information-Flow Control)作为防御措施。
长时间运行的AI智能体不会耗尽上下文——它们的记忆变得陈旧且自相矛盾。你们如何处理这个问题?
文章探讨了长时间运行的AI智能体所面临的记忆陈旧问题,即上下文变得过时和矛盾,并寻求随着时间的推移保持记忆可靠性的实际解决方案。
我们是否低估了AI代理记忆可能带来的危险?
讨论了赋予AI代理记忆的风险,包括信任问题、数据投毒和运营风险,并向构建者提出了关键问题。
AI记忆系统使用时间越长,越难信任
AI记忆系统随着时间的推移往往会回忆起过时或错误的信息,凸显了为AI智能体维护长期记忆信任度的挑战。
我们是否都在悄悄重建记忆系统,因为当前AI的长期记忆实际上并不奏效?
文章讨论了当前AI记忆方案在生产中常见的失败情况,如事实陈旧、摘要漂移和供应商锁定,指出真正的瓶颈在于记忆治理而非检索。