受治理的持久记忆:面向长时程智能体的源绑定状态语义与故障封闭释放

arXiv cs.AI 论文

摘要

介绍了受治理的持久记忆(GPM),一种用于可审计长时程智能体记忆的双时态状态转换模型,具有源绑定语义和故障封闭释放,并在基准测试和密封评估上得到验证。

arXiv:2608.12476v1 公告类型:新 摘要:长期智能体记忆通常被视为“选择-存储-检索”,但检索并不决定相互矛盾、已被取代、已撤回、已删除或已过时的记录是否可能支持某条对外声明。我们引入了受治理的持久记忆(GPM),这是一种可审计的双时态状态转换模型,具有源绑定准入、派生生命周期状态、当前公开屏障以及故障封闭的结构化释放。五个可执行条款涵盖账本完整性、源绑定、冲突隔离、撤回或删除后不得复活,以及在已验证头部的新鲜视图上实现精确的声明闭合。 在预指定的哈希冻结的包含3600个案例的GPM-ReleaseBench上,GPM匹配所有完整结果;三个故意简化的完整策略中最强的一个匹配了1800/3600,并在50%的违规案例中产生了不匹配的释放。一项单独的密封端到端服务评估在八个查询族中进行了真实的摄取和释放。在其公开披露的V3分支中,受治理通道在2400/2400个簇上正确,而未受治理的本地Qwen2.5-7B则为600/2400;它修复了全部1800个基线失败,且没有回归(单侧95%置信下限分别为99.875%和99.834%)。随后的V5重新密封覆盖中文和英文指令分支,使用生成日期固定,且冻结后无归约器修订,再次在每个分支上获得2400/2400。一个独立于生产代码的有限模型探索了331,776个语义状态和1,990,656个查询状态,未发现完整契约的反例,并且一个包含100,000条轨迹的三引擎差分产生了零不匹配。 这些是有界的契约和实现结果,不是开放世界的模型准确性,也不是世界真实性的证据。密封服务评估中的受治理答案是确定性的服务输出;7B结果是未受治理的对比,而不是声称语言模型本身变得完全准确。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:25

# 受治理的持久内存:面向长时程智能体的源绑定状态语义与故障关闭发布
Source: https://arxiv.org/html/2608.12476
Guodong XuAffiliation:青岛果冻先生网络科技有限公司\., Ltd\.\(Guǒdòng Xiānsheng\)Email:[kzkz137806@gmail\.com](mailto:)

2026年8月

###### 摘要

长期智能体记忆通常被视为选择—存储—检索,但检索并不能决定矛盾的、被取代的、已撤回的、已删除的或过时的记录是否可能支持一个对外声明。我们引入了*受治理的持久内存*\(GPM\),一个可审计的双时态状态转换模型,具有源绑定准入、派生生命周期状态、当前公共屏障以及故障关闭的结构化发布。五个可执行子句涵盖账本完整性、源绑定、冲突隔离、撤回或删除后的不复活,以及在一个已验证头部上的新鲜视图上的精确声明闭包。

在预设的哈希冻结3,600例GPM-ReleaseBench上,GPM匹配所有完整结果;三个故意简单的完整策略中最强的一个匹配1,800/3,600,并在50%的违规案例上产生了不匹配发布。一个独立的密封端到端服务评估在八个查询族上进行了真实摄取和发布。在其公开披露的V3分支中,受治理通道在2,400/2,400簇上正确,而未经治理的本地Qwen2.5-7B为600/2,400;它修复了所有1,800个基线失败且无回归(单侧95%下界为99.875%和99.834%)。随后的V5重新密封在中文和英文命令分支上,生成日期固定且冻结后无归约器修订,每个分支再次获得2,400/2,400。一个独立于生产代码的有限模型探索了331,776个语义状态和1,990,656个查询状态,没有发现完整契约的反例,并且100,000条轨迹的三引擎差分产生了零不匹配。

这些是有界的契约和实现结果,而非开放世界的模型准确性或世界真理的证据。密封服务评估中的受治理答案是确定性的服务输出;7B结果只是未经治理的对照,而非声称语言模型本身变得完全准确。

## 1 引言

长时程智能体必须在交互中保留事实、偏好、承诺和任务状态。检索增强生成、生成式智能体、外部记忆和记忆操作系统将模型扩展到其即时上下文窗口之外\[13 (https://arxiv.org/html/2608.12476#bib.bib1),22 (https://arxiv.org/html/2608.12476#bib.bib4),20 (https://arxiv.org/html/2608.12476#bib.bib3),27 (https://arxiv.org/html/2608.12476#bib.bib5),5 (https://arxiv.org/html/2608.12476#bib.bib6),14 (https://arxiv.org/html/2608.12476#bib.bib7)\]。然而,检索到相关段落与有权主张一个当前事实是不同的操作。

考虑四种常见变化。用户从一个城市搬到另一个城市。两个来源在单一值属性上不一致。先前断言的事实后来被撤回。用户删除了其历史记录,但过时的快照或派生索引仍可能使其浮现。相关性排名在每种情况下都可能返回高分候选;仅凭相关性并不能建立公开可主张性。持久性还改变了失败的时间尺度:一个提取错误可能被回忆、总结并写回,直到它呈现出稳定历史的外观。HaluMem将这种传播定位于提取、更新和问答阶段\[4 (https://arxiv.org/html/2608.12476#bib.bib8)\]; LongMemEval、LoCoMo和MemoryAgentBench测量了长期交互记忆的互补方面\[17 (https://arxiv.org/html/2608.12476#bib.bib2),29 (https://arxiv.org/html/2608.12476#bib.bib9),9 (https://arxiv.org/html/2608.12476#bib.bib13)\]。

我们提出了一个更窄的系统性问题:*持久内存支持公开声明之前必须具备什么状态语义?*我们的答案GPM将外部源获取、认证的剧情节注册、可选的声明准入、仅追加历史、公共投影、候选排名、不可信的声明提议以及本地的结构化发布决策分离开来。贡献不是一个新的向量索引。而是一组可执行的状态义务和一个发布边界,当记录冲突、延迟到达、被撤回或必须成为公开不可访问时,该边界依然有意义。

2026年的几个系统强化了这一边界。StateFuse在复制操作集之间保留矛盾并在投影时解决它们\[25 (https://arxiv.org/html/2608.12476#bib.bib18)\]; TOKI为矛盾历史定义了一种双时态算子代数\[28 (https://arxiv.org/html/2608.12476#bib.bib20)\]; MemIR分离了证据、断言和决策角色以防止溯源角色坍塌\[10 (https://arxiv.org/html/2608.12476#bib.bib21)\]; MemoRepair在失效后撤回并选择性地重建溯源链接的后继\[31 (https://arxiv.org/html/2608.12476#bib.bib19)\]。GPM解决的是一个更窄的端到端状态契约:将源准入为一个双时态公共状态,在历史读取上实施当前策略的不复活,以及在一个稳定已验证头部下的新鲜视图上对输出结构化声明集进行精确闭包。它不提供副本收敛、语义墓碑、任意后继修复或对自由形式生成的保证。

本文做出了六项贡献:

1. 1\.一个双时态、源绑定的事件模型,具有派生而非调用者指定的生命周期状态;
2. 2\.五个可执行契约子句,连接存储完整性、源绑定、冲突隔离、撤回和删除屏障以及结构化发布;
3. 3\.GPM-ReleaseBench v1,一个内部设计的契约一致性套件,具有冻结的开发集和评估者隐藏的反事实案例,以及匹配的完整策略;
4. 4\.一个通过真实摄取和发布服务的密封端到端评估,包含八个受治理查询族、一个未经治理的本地7B对照以及一个双语命令表面重新密封;
5. 5\.在严格、增量和分段实现上的有界穷举检查和100,000条轨迹差分证据;以及
6. 6\.干净任务效用对照和一个明确的失败语言评判门,防止状态级保证被改写为开放世界的答案正确性。

## 2 从检索到受治理状态

### 2\.1 检索不等于公开资格

设M⁡\(u,t\)M\(u,t\)为用户存储的记忆项在有效时间点tt上可见的未治理集合,设kk为固定的top-kk截断深度。检索器返回排名候选

R⁡\(q,u,t\)=rankk⁡\{s⁡\(q,mj\):mj∈M⁡\(u,t\)\},R\(q,u,t\)=\\operatorname\{rank\}\_\{k\}\\\{s\(q,m\_\{j\}\):m\_\{j\}\\in M\(u,t\)\\\},\(1\)其中qq为查询,uu为用户,tt为有效时间点,ss为任何词法、向量、图或学习得分,rankk\\operatorname\{rank\}\_\{k\}按得分排序并保留最高的kk个。得分估计的是相关性;它不决定mjm\_\{j\}是否具有可接受的溯源、是否已被取代、是否处于未解决的冲突中、是否被撤回或是否被删除屏障隐藏。因此,我们在排名之前定义一个可主张事实投影VpubV\_\{\\mathrm\{pub\}\}和一个仅证词剧情节投影EpubE\_\{\\mathrm\{pub\}\}:

RGPM\(q,u,t,τ,hc\)=rankk⁡\{s⁡\(q,z\):z∈Vpub\(u,t,τ,hc\)∪Epub\(u,t,τ,hc\)\}\.R\_\{GPM\}\(q,u,t,\\tau;h\_\{c\}\)=\\operatorname\{rank\}\_\{k\}\\\{s\(q,z\):z\\in V\_\{\\mathrm\{pub\}\}\(u,t,\\tau;h\_\{c\}\)\\cup E\_\{\\mathrm\{pub\}\}\(u,t,\\tau;h\_\{c\}\)\\\}\.\(2\)这里hch\_\{c\}是引擎当前已验证的账本头部,在下面的形式模型中定义。投影决定候选资格。排名只对投影后的候选进行排序,不提供端到端的正确性保证。特别是,EpubE\_\{\\mathrm\{pub\}\}中的剧情节可以被检索为证词,但不能满足结构化发布契约。

### 2\.2 失败层次

架构分离了四个失败层次。在*存储层*,事件可能被篡改、截断、重复或重排序。在*状态层*,未绑定或调用者推断的声明、无效取代、未解决冲突或删除复活可能进入公共视图。在*检索层*,相关证据可能被遗漏,或返回不相关的证据。在*语言层*,生成器即使在证据存在的情况下也可能否定、合并、过度概括或捏造。前两层允许确定性契约检查;后两层需要经验评估,并且对于自由形式语言,需要比本系统提供的更强的语义检查。

## 3 形式模型

### 3\.1 事件账本与可信承诺

事件为

ei=\(i,τi,ti,typei,payloadi,hi−1,hi\),hi=H⁡\(canon⁡\(ei∖\{hi\}\)\)\.e\_\{i\}=\(i,\\tau\_\{i\},t\_\{i\},\\mathrm\{type\}\_\{i\},\\mathrm\{payload\}\_\{i\},h\_\{i\-1\},h\_\{i\}\),\\qquad h\_\{i\}=H\(\\operatorname\{canon\}\(e\_\{i\}\\setminus\\\{h\_\{i\}\\\}\)\)\.\(3\)这里ii为连续序列号,τi\\tau\_\{i\}为事务时间,tit\_\{i\}为可选的 valid-time 字段,hih\_\{i\}为链接到hi−1h\_\{i\-1\}的规范化哈希。有效账本要求事务时间非递减,即τi≥τi−1\\tau\_\{i\}\\geq\\tau\_\{i\-1\}。事务时间通常由引擎时钟分配;显式受信任的摄取或可复现性接口只有在追加保持此顺序时才可注入历史值。递减的注入值在事件提交之前被拒绝。

单文件引擎将事件数和链头保存在一个单独受保护的边车承诺中。分段引擎提交事件数、链头、段元数据,以及每个用户索引分片的记录数和滚动哈希头。缺失、修改、注入或截断的索引引用会导致受影响的公共读取故障关闭;完整审计验证每个声明或存在的分片。索引源自权威段并且可以重建,但不仅仅因为可派生而被信任。

状态为Σ=\(L,C,P,B,I\)\\Sigma=\(L,C,P,B,I\):权威账本LL、物化声明CC、溯源见证PP、公共屏障BB和可重建索引II。事件通过部分转换δ⁡\(Σ,e\)=Σ′\\delta\(\\Sigma,e\)=\\Sigma^\{\\prime\}应用。如果序列、前驱、哈希、承诺或公开资格前置条件失败,公共读取将停止或受影响的声明仍留在公共投影之外。

### 3\.2 声明、溯源与生命周期

声明为

c=\(u,f,x,a,v,\ts,te\),τ,p,r,σ\),c=\(u,f,x,a,v,\[t\_\{s\},t\_\{e\}\),\\tau,p,r,\\sigma\),\(4\)其中uu为用户,ff为事实标识符,xx为实体,aa为属性,vv为值,\[ts,te\)\[t\_\{s\},t\_\{e\}\)为有效区间,τ\\tau为事务时间,pp为溯源见证,rr为可选的取代事实,σ\\sigma为描述性支持标签。可执行检查通过pp而不是σ\\sigma起作用。直接剧情节见证绑定源事件标识符和哈希,并要求包含在源中的非空引用。摘要账本见证额外绑定声明、账本、源单元、内容、引用、提取方法、提取器版本、提取时间和字节跨度。引用包含性仅建立字符串来源和位置;它不是语义蕴含测试。调用者标记的推理被隔离,无法通过此准入路径成为公共事实,但语义上不支持的提取若其引用字节存在仍可能通过。因此,语义忠实性仍留在I2之外。

生命周期状态由事件派生,而非作为可自由修改的标签存储。实现中所采用的转换词汇在[表1 (https://arxiv.org/html/2608.12476#S3.T1)中总结。

表 1: 已实现的事件转换。“公共效果”在请求的有效和事务快照下评估,并受当前公共屏障的约束。
### 3\.3 冲突与取代

属性基数是部署策略。原型将未指定的键视为单值,并在内置多值注册表中包含常见的复数键,如tag/tags、label/labels和interest/interests;部署添加是扩展而非替换该注册表。规范化NN仅执行Unicode NFKC规范化、修剪和大小写折叠。它不执行单位转换或本体推理。

当两个活动声明具有相同的用户、规范化实体和单值属性;有效区间重叠;规范化值不相等;并且没有撤回或有效取代关系解决它们时,它们冲突,即ci⋈cjc\_\{i\}\\bowtie c\_\{j\}。取代边仅当其目标更早且具有相同的用户、规范化实体和属性时才有效。无效边既不会抑制其目标,也不会通过完整审计。未解决侧被隔离在公共投影之外。

### 3\.4 公共与审计视图

由于事务时间非递减,令L≤τq\(hc\)L\_\{\\leq\\tau\_\{q\}\}\(h\_\{c\}\)为在当前已验证头部hch\_\{c\}认证的账本中,事务时间不晚于τq\\tau\_\{q\}的最长序列前缀,令C≤τq\(hc\)C\_\{\\leq\\tau\_\{q\}\}\(h\_\{c\}\)为从该前缀物化的声明。用户uu在hch\_\{c\}处的当前公共策略为Πpub\(u,hc\)=\(dc,Rc\)\\Pi\_\{\\mathrm\{pub\}\}\(u;h\_\{c\}\)=\(d\_\{c\},R\_\{c\}\),其中dcd\_\{c\}为最新user\.delete事件的序列(或零),RcR\_\{c\}包含在该屏障之后于完整前缀至hch\_\{c\}中撤回的事实标识符。因此,事务时间选择历史证据前缀,而当前头部提供不复活策略。定义

Cq\(u,t;hc\)=\{c∈C≤τq\(hc\):\\displaystyle\\mathcal\{C\}\_\{q\}\(u,t;h\_\{c\}\)=\\\{c\\in C\_\{\\leq\\tau\_\{q\}\}\(h\_\{c\}\):\{\}c\.u=u,seq\(c\)\>dc,t∈\c\.ts,c\.te\),\\displaystyle c\.u=u,\\;\\operatorname\{seq\}\(c\)\>d\_\{c\},\\;t\\in\[c\.t\_\{s\},c\.t\_\{e\}\),c\.f∉Rc,prov≤τq\(c;hc\)\},\\displaystyle c\.f\\notin R\_\{c\},\\;\\operatorname\{prov\}\_\{\\leq\\tau\_\{q\}\}\(c;h\_\{c\}\)\\\},\(5\)Vpub\(u,t,τq;hc\)=\{c∈Cq:\\displaystyle V\_\{\\mathrm\{pub\}\}\(u,t,\\tau\_\{q\};h\_\{c\}\)=\\\{c\\in\\mathcal\{C\}\_\{q\}:\{\}¬supersededCq\(c\)∧¬conflictedCq\(c\)\}\.\\displaystyle\\neg\\operatorname\{superseded\}\_\{\\mathcal\{C\}\_\{q\}\}\(c\)\\land\\neg\\operatorname\{conflicted\}\_\{\\mathcal\{C\}\_\{q\}\}\(c\)\\\}\.\(6\)这里seq⁡\(c\)\\operatorname\{seq\}\(c\)为断言事件的序列。源绑定谓词在当前删除屏障之后针对请求的前缀进行评估;因此,删除后的声明不能复活删除前的源剧情节。取代和冲突随后在剩余请求前缀候选中派生。因此,在τq\\tau\_\{q\}之后写入的撤回或删除可以抑制公共历史读取,但在τq\\tau\_\{q\}之后写入的断言不能进入其中。默认公共模式设置transactionAt=null并读取当前前缀。非空τq\\tau\_\{q\}显式请求策略过滤的历史前缀;它不是当前状态回答模式,因为在τq\\tau\_\{q\}之后写入的矛盾或取代断言不在该前缀中。

授权的审计视图则从L≤τqL\_\{\\leq\\tau\_\{q\}\}本身派生其删除和撤回策略,并可以重建普通的as-of状态。在实现中,auditView和auditSearch是独立方法,而public view/search和公共适配器拒绝审计标志。这种API分离防止意外路由,但本身不是认证或授权。

实现还从在当前删除、隔离和事实撤回屏障下存活的剧情节事件派生Epub\(u,t,τq,hc\)E\_\{\\mathrm\{pub\}\}\(u,t,\\tau\_\{q\};h\_\{c\}\)。

相似文章

GateMem:多主体共享记忆代理中的记忆治理基准评测

Hugging Face Daily Papers

GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。

多智能体LLM系统的受控共享内存

arXiv cs.AI

本文介绍了MemClaw,一种用于多智能体LLM系统的受控共享内存架构,形式化了诸如未授权泄漏和过时传播等故障模式,并通过ArgusFleet测试框架评估了该系统。

在关键时刻记住:面向长周期代理的前瞻性记忆代理

Hugging Face Daily Papers

本文介绍了一种前瞻性记忆代理,它与动作代理并行运行,以防止长周期任务中的行为状态衰减,在Terminal-Bench2.0和τ^2-Bench上取得了显著提升。作者还使用SFT和GRPO训练了Qwen3.5-27B,作为迈向开放权重记忆策略的初步步骤。