迈向可逆遗忘:在持续企业AI智能体中管理过时知识
摘要
本文提出一种针对企业AI智能体的可逆遗忘方法来管理过时知识,引入一个框架,该框架包含记忆状态和控制器,根据相关性抑制和重新激活知识。
arXiv:2608.18177v1 公告类型:新
摘要:持续学习传统上将遗忘视为失败,强调在环境演变过程中保持先前获得的知识。我们认为,对于在非平稳环境中运行的企业AI智能体,这一目标是不完整的,因为客户、政策、工具、工作流程、法规和市场条件会随时间变化。不加区分的保留可能导致过时知识影响决策,产生负面迁移和运营风险。因此,我们提出可逆遗忘:一个包含三种操作记忆状态的概念框架:活跃、休眠和退役,以及一个可以在相关性恢复时重新激活休眠知识的重新激活转换。我们将该框架实例化为一个滞后可逆记忆控制器,它积累相关性证据,使用非对称阈值防止状态振荡,在影子模式下测试重新激活,并通过策略控制退役。该框架减少了过时信息的影响,而不会将临时抑制与永久擦除混淆。金融领域说明了这个想法:在一种市场体制下有用的知识在另一种体制下可能变得有害,但当类似条件重现时会重新获得相关性。
查看缓存全文
缓存时间: 2026/08/20 10:21
# 持续企业AI智能体中的过时知识管理
来源:https://arxiv.org/html/2608.18177
## 走向可逆遗忘:持续企业AI智能体中的过时知识管理
###### 摘要
传统持续学习将遗忘视为一种失败,强调在环境演变过程中保留先前获得的知识。我们认为,对于在非平稳环境中运行的企业AI智能体(其客户、策略、工具、工作流、法规和市场条件随时间变化)而言,这一目标是不完整的。不加区分的知识保留可能让过时知识影响决策,产生负迁移和操作风险。因此,我们提出了可逆遗忘:一个包含三种操作记忆状态——活跃、休眠和退役——的概念框架,以及当知识相关性恢复时可以将其重新激活的转换机制。我们将该框架实例化为一个滞回可逆记忆控制器,该控制器积累相关性证据,使用非对称阈值防止状态振荡,在影子模式下测试重新激活,并通过策略门控退役流程。该框架减少了过时信息的影响,同时避免了将临时抑制与永久擦除混为一谈。金融领域阐释了这一概念:在某一种市场机制下有用的知识,在另一种机制下可能变得有害,但在类似条件重现时又可重新获得相关性。
关键词:持续学习;企业AI智能体;可逆遗忘;智能体记忆;知识生命周期;分布偏移;AI治理。
概要:企业智能体应可逆地抑制过时知识,而非不加区分地保留或擦除;HRMC通过可审计的记忆状态、滞回机制、影子测试的重新激活以及策略门控的退役来实现这一立场。
## 1引言
持续学习研究系统如何在不丢失有用先验能力的情况下获取知识。然而,对于企业智能体而言,旧知识不应始终处于活跃状态:客户、策略、工具、工作流、法规和市场都在变化。
这创造了超越灾难性遗忘的第二种失效模式:过时的工作流、策略、经验或经历,如果在检索时持续暴露,可能导致负迁移。终身智能体研究将记忆演进视为一个开放问题,洞察治理工作表明,过时的言语经验可能损害后续决策。
#### 立场.
持续企业智能体应支持可逆遗忘:过时或与上下文无关的知识应能从正常使用中被抑制,而不必被擦除,同时保留其来源信息和后续重新激活的可能性。
这将持续学习重新定义为知识生命周期管理,而非最大化保留。我们的论点有四个贡献:(1) 我们区分了灾难性遗忘与有意的、有益的抑制;(2) 我们引入了活跃、休眠和退役三种记忆状态,并通过可审计的抑制和重新激活转换进行连接;(3) 我们提出了一个具体的控制器,它包含时间证据积累、滞回机制、影子重新激活和策略门控退役;(4) 我们概述了一个研究和基准测试议程,涉及检测、粒度、保留、重新激活、评估、安全和治理。
## 2从灾难性遗忘到有益遗忘
持续学习研究在保持早期有用能力的同时进行顺序适应。其核心失败是灾难性遗忘:新学习损害了仍有价值的知识。企业智能体面临相反的风险。重新设计的系统、弃用的工具、被取代的规则或改变的运行机制,可能使保留的知识产生误导。因此,有用知识的意外丢失是灾难性的,但对过时知识的可控抑制则可能是适应性的。问题变成:什么知识应该在现在影响智能体,什么应保持休眠,什么应被退役。
### 2.1与先前及相邻工作的关系
灾难性遗忘方法保留有用的能力,而后向迁移利用新知识改进旧任务;我们关心的是旧知识是否应该影响当前任务。机器遗忘移除指定的训练影响;可逆遗忘保持可恢复性,无法满足强制擦除的要求。概念漂移方法检测分布变化,而智能体记忆和经验系统则管理存储、检索和迁移。
最接近的先例是某项工作的策展循环,该工作验证并管理言语洞察,并在金融领域突出过时的经验。知识激活将机构知识打包为可重用的单元,而组织评审则强调治理。HRMC则提出了一个具体的、可证伪的方案:活跃-休眠-退役状态、非对称阈值、持久性计数器、影子测试的重新激活、策略门控退役以及转换账本。我们声称这些是设计假设,而非已证实的优势。
## 3为什么企业智能体需要可逆遗忘
企业智能体积累事实、交互、工具、工作流和策略。常规的更新 $M_{t+1}=M_t\cup\Delta M_t$ 混合了在不兼容假设下获得的记忆。这具有重大影响,因为组织知识具有权威性、版本化、访问控制,并与所有者相关联。然而,审计、事件重现和重复出现的状况需要历史版本。可逆遗忘正是针对这种抑制、可恢复性、来源追踪和治理的组合需求。
## 4可逆遗忘框架
我们将企业记忆视为一个生命周期,而非保留/删除的二元选择。偏移检测器产生上下文 $R_t$;然后控制器评估哪些记忆应保持活跃、变为休眠或走向退役。抑制并非删除。
图 1:可逆遗忘生命周期:变化触发相关性评估;休眠知识可以恢复为活跃使用,而退役则需要策略门控。#### 记忆状态.
活跃知识支持正常检索;休眠知识被抑制但可恢复;重新激活使其恢复活跃使用;而退役知识不能自动恢复。来源存根可能根据策略保留。退役不是擦除:法律要求的删除需要单独的遗忘或记录管理过程。目标是确保在正确的时间有正确的知识影响智能体。
#### 形式化相关性.
对于在时间 $t$ 的记忆 $m_i$,考虑概念评分:
$R_t(m_i) = \alpha S_t(m_i) + \beta U_t(m_i) + \gamma C(m_i) - \delta A_t(m_i) - \lambda H_t(m_i)$ (1)
其中 $S, U, C, A, H$ 分别表示上下文相似性、效用、可靠性、陈旧性和危害性。实现时可能从嵌入、反事实表现、来源历史、取代事件和策略违规中估计它们。该评分说明了候选信号,而非一个经过验证的估计器;代理指标和阈值必须根据记忆层和策略领域进行校准。
### 4.1滞回可逆记忆控制器
直接的阈值规则可能导致记忆在状态间反复移动。滞回可逆记忆控制器代之以维护:
$\bar{R}_t(m_i) = \rho \bar{R}_{t-1}(m_i) + (1 - \rho) R_t(m_i)$, (2) 其中 $\tau_\downarrow < \tau_\uparrow$。休眠需要 $L_\downarrow$ 个连续低分;重新激活需要 $L_\uparrow$ 个高分且影子增益高于 $\epsilon$。滞回机制和持久性限制了状态“抖动”。
在 $T_{\mathrm{retire}}$ 之后,退役仍需策略或所有者批准。每次转换及其证据都记入账本。算法 1 留下了特定于领域的估计器和策略。
算法 1 滞回可逆记忆控制器 (HRMC)
1: 记忆 $m_i$,上下文 $R_t$,状态 $z_i$,评分 $\bar{R}_{t-1}$,计数器 $c_i^-, c_i^+$
2: $r_i \leftarrow \textsc{Relevance}(m_i, R_t)$
3: $\bar{R}_t \leftarrow \rho \bar{R}_{t-1} + (1 - \rho) r_i$
4: if $z_i = \textsc{Active}$ then
5: $c_i^- \leftarrow \textsc{UpdateLowCount}(\bar{R}_t < \tau_\downarrow)$
6: if $c_i^- \geq L_\downarrow$ or $\textsc{PolicyBlock}(m_i, R_t)$ then
7: $\textsc{Transition}(m_i, \textsc{Dormant}, \text{evidence})$
8: end if
9: else if $z_i = \textsc{Dormant}$ then
10: $c_i^+ \leftarrow \textsc{UpdateHighCount}(\bar{R}_t > \tau_\uparrow)$
11: if $c_i^+ \geq L_\uparrow$ and $\textsc{ShadowGain}(m_i, R_t) > \epsilon$ then
12: $\textsc{Transition}(m_i, \textsc{Active}, \text{evidence})$
13: else if $\textsc{DormantAge}(m_i) > T_{\mathrm{retire}}$ and $\textsc{ApproveRetirement}(m_i)$ then
14: $\textsc{Transition}(m_i, \textsc{Retired}, \text{evidence})$
15: end if
16: end if
17: $\textsc{AppendLedger}(m_i, z_i, \bar{R}_t, \text{evidence})$
HRMC旨在保留当前上下文的效用,同时减少有害检索、转换和存储,并受治理约束。相似性可能提名记忆以供返回,但反事实效用必须证明重新激活的合理性。
#### 粒度.
抑制必须与记忆层相匹配:对情节进行检索过滤,对事实和策略进行版本控制,对工具进行偏好衰减,对工作流进行退役,对模型行为进行参数适应。系统必须决定知识是否相关以及如何减少其影响。
## 5金融作为说明性企业领域
金融领域使这一概念具体化;在此领域,过时的言语洞察已显示出成本。一个风险智能体可能在低波动性机制 $R_1$ 中学习阈值和工作流 $M_1$。在危机机制 $R_2$ 下,这些关系可能产生过多警报。控制器不是保留或删除 $M_1$,而是在 $M_2$ 活跃服务 $R_2$ 时,使其变为休眠;如果 $R_3 \approx R_1$,它则重新激活 $M_1$。
图 2:重复出现的金融机制:$M_1$ 在 $R_1$ 中活跃,在 $M_2$ 服务 $R_2$ 时变为休眠,并在 $R_3$ 与 $R_1$ 相似时重新激活。
## 6治理与失败模式
企业系统必须解释为什么知识停止影响行为。遗忘账本记录:
$(m_i, state_{\mathrm{old}}, state_{\mathrm{new}}, reason, time, evidence)$。
这支持重建、影响分析和恢复。风险包括过早抑制、错误的偏移检测、无限的休眠存储、重新激活失败、对抗性反馈以及合规冲突。休眠无法满足擦除要求,因为内容仍然可恢复。访问控制、保留计划、法律保留、删除职责和人工干预必须约束转换,使控制器与生命周期风险治理保持一致。
## 7研究与基准测试议程
一个实用的理论提出六个问题:过时的检测;在示例、事实、工具、工作流、策略和参数之间的粒度;休眠知识的保留限制;重新激活证据;区分有益抑制与灾难性遗忘的评估;以及对转换权限的治理。
基准测试需要重复出现的环境。保留和迁移在顺序具身任务中各不相同;序列 $E_1 \rightarrow E_2 \rightarrow E_3 \rightarrow E_1$ 额外测试了抑制在变化期间是否有帮助,以及先前的效用在重现时是否恢复。
一个基准测试应报告当前上下文效用、相对于策略的有害保留成本、重新激活恢复率和转换成本。治理措施应涵盖无支持的抑制、策略违规、审计完整性和实际删除。
HRMC 可以进行关于滞回、证据持久性、影子评估和策略门控的消融实验。保留所有、固定窗口、最近最少使用、永久删除和策略上下文基线使该立场可证伪:受治理的可逆控制是否改善了效用-干扰权衡?相似文章
可复用知识与操作记忆:构建真正能跟进到底的AI智能体时缺失的区分
本文区分了可复用知识(持久上下文)与操作记忆(任务状态),这两者都是构建能够跟进复杂任务的主动型AI智能体的关键组成部分。
有没有其他人的智能代理会自信地“记住”已经变化的内容?
用户描述了一个问题:AI智能代理会自信地从记忆层中检索过时的事实,而不标记变化,并询问社区如何使旧的记忆失效或跟踪事实时效性。
@MSFTResearch: AI 智能体无法记住过去的对话。它们必须不断重新加载或检索上下文,随着任务变长和复杂,效率变得越来越低…
Memora 是一种为 AI 智能体设计的可扩展记忆系统,它将存储与检索分离,能够支持长周期任务,同时将上下文令牌减少多达 98%,并在基准测试上取得了新的最佳性能。该论文发表于 ICML 2026。
我们是否都在悄悄重建记忆系统,因为当前AI的长期记忆实际上并不奏效?
文章讨论了当前AI记忆方案在生产中常见的失败情况,如事实陈旧、摘要漂移和供应商锁定,指出真正的瓶颈在于记忆治理而非检索。
厌倦了每次会话都要重新配置你的智能体?正在构建记忆系统来解决这个问题?这里有一份指南,告诉你设计系统时需要考虑的一些要点。
探讨了AI智能体记忆系统如何常常忽略工作记忆等关键认知过程,将其与顺行性遗忘症进行类比,并为更有效的解决方案提供设计指导。