通用型智能体必须记住什么?
摘要
本文对通用型智能体为了在多种环境和目标下接近最优地行动而必须在记忆中存储什么提供了一个形式化描述,并提出了一个分离定理:记忆对于领域区分和转移模型重建是必要的。
arXiv:2606.18746v1 Announce Type: new
摘要:本文对通用型智能体为了在多种环境和目标下接近最优地行动而必须在记忆中存储什么提供了一个形式化描述。文章表明,当两个领域共享一个观测瓶颈但需要不相容的最优行动时,任何统一接近最优的策略必然在该瓶颈处引发不同的记忆分布。这一结果引出了一个分离定理:足够成功的智能体不能仅仅依赖当前状态观测,而必须在记忆中保留与领域相关的信息。文章进一步证明,如果智能体的记忆包含足够的信息来估计相关目标的价值,那么该记忆可以用于近似重建智能体的局部转移动态。这些结果共同将记忆刻画为支持通用型智能体进行领域区分、转移模型重建和规划的基础。
查看缓存全文
缓存时间: 2026/06/18 05:40
# 通用智能体必须记住什么?
来源:https://arxiv.org/html/2606.18746
Khurram Yamin
卡内基梅隆大学
kyamin@andrew\.cmu\.edu
&Namrata Deka¹¹footnotemark:1
卡内基梅隆大学
ndeka@andrew\.cmu\.edu
&Maitreyi Swaroop¹¹footnotemark:1
卡内基梅隆大学
mswaroop@andrew\.cmu\.edu
Albert Ting
佐治亚理工学院
ating7@gatech\.edu
&Jeff Schneider
卡内基梅隆大学
jeff4@andrew\.cmu\.edu
&Bryan Wilder
卡内基梅隆大学
bwilder@andrew\.cmu\.edu
###### 摘要
本文对通用智能体为了在多个环境和目标下近乎最优地行动而必须在记忆中存储什么信息进行了形式化分析。研究表明,当两个领域共享一个观测瓶颈,但需要不相容的最优行动时,任何均匀近乎最优的策略都会在该瓶颈处诱导出不同的记忆分布。该结果得出一个分离定理:足够成功的智能体不能仅依赖当前状态观测,而必须在记忆中保留与领域相关的信息。论文进一步表明,如果智能体的记忆包含足够的信息以估计相关目标的价值,那么该记忆可用于近似重建智能体的局部转移动力学。这些结果共同将记忆刻画为支持领域区分、转移模型重建和通用智能体规划的底层基质。
## 1 引言
强化学习本质上是因果性的:智能体的行动是对状态轨迹的干预,而它收集的奖励是该干预的下游效应。当我们朝着通用强化学习智能体努力时,我们不仅要应对智能体自身的干预,还要应对其环境的干预:智能体必须在单一领域内追求多样化的目标,并且当外生变化改变领域动力学时,它必须保持胜任能力。这两个维度——目标的通用性和领域的鲁棒性——共同定义了本文研究的情境。在奖励产生机制跨领域共享的假设下,我们提出疑问:*这样一个智能体的内部状态必须编码关于世界的哪些信息?*
因果强化学习领域的最新研究探讨了智能体的**策略**需要识别什么才能在一系列任务或环境中表现良好。Richens 等人 (2025 (https://arxiv.org/html/2606.18746#bib.bib2)) 表明,在固定环境中,任何在一族足够丰富的多步目标上满足遗憾上界的智能体必须已经学习到该环境转移的近似模型。Richens 和 Everitt (2024 (https://arxiv.org/html/2606.18746#bib.bib1)) 表明,任何在一族足够丰富的数据生成过程干预上满足遗憾上界的智能体必须已经学习到一个近似的因果模型,而 Ceriscioli 和 Mohan (2025 (https://arxiv.org/html/2606.18746#bib.bib3)) 将其扩展到序贯决策问题中的中介设置。在每种情况下,智能体都被形式化为一个从已知任务或领域索引到策略的映射,并且结果表明该映射必须编码一个可以通过在不同输入下查询智能体来读取的世界模型。
我们研究了一个不同的设置,其中智能体没有接收到领域索引:它只看到自己的轨迹,并且必须从在线经验中推断出它需要的关于领域的任何信息。这种结构并未被明确提供,而是必须隐含地承载在智能体的记忆中。这引发了与上述工作不同的问题,也是我们在本文中回答的问题:*智能体的记忆必须携带什么信息,才能使其跨目标和领域胜任地行动?* 进一步地,*这些信息何时足以恢复领域的干预动力学?*
我们在一个序贯的、中介的设置中解决这个问题。我们的第一个结果(定理 1 (https://arxiv.org/html/2606.18746#Thmtheorem1))是一个记忆层面的必要条件:每当两个领域在相同状态下需要不同的行动时,一个均匀近乎最优的智能体的记忆必须在该状态下区分它们。这告诉我们记忆**必须**分离这样的领域,但并未说明**如何**分离。我们的第二个结果(定理 2 (https://arxiv.org/html/2606.18746#Thmtheorem2))提供了缺失的结构:如果目标族足够丰富,使得记忆能够预测一类单步探测探针的近乎最优行动价值,那么该记忆可以解码每个领域局部干预核的近似信息。这两个结果在同一多领域设置中约束了相同的记忆抽象。
本文组织如下:第 2 节 (https://arxiv.org/html/2606.18746#S2) 讨论了因果强化学习和世界模型必要性方面的相关工作。第 3 节 (https://arxiv.org/html/2606.18746#S3) 介绍了形式化设置、假设和符号,以及我们在表示分离(定理 1 (https://arxiv.org/html/2606.18746#Thmtheorem1))和解码器存在性(定理 2 (https://arxiv.org/html/2606.18746#Thmtheorem2))方面的主要结果。第 4 节 (https://arxiv.org/html/2606.18746#S4) 在一个网格世界中演示了这些定理的预测。第 5 节 (https://arxiv.org/html/2606.18746#S5) 总结我们的结果并讨论未来工作的重要问题。
## 2 相关工作
#### 世界模型的必要性。
最密切相关的工作探讨了一个足够胜任的智能体必须已经了解其环境的哪些方面。经典表述是良好调节器定理 (Conant and Ross Ashby, 1970 (https://arxiv.org/html/2606.18746#bib.bib6)):每个系统的最佳调节器都必须是该系统的模型。最近的研究将其扩展到决策智能体。Richens 和 Everitt (2024 (https://arxiv.org/html/2606.18746#bib.bib1)) 表明,任何在一族数据生成过程干预上实现低遗憾的智能体必须已经学到了该过程的近似因果模型,Ceriscioli 和 Mohan (2025 (https://arxiv.org/html/2606.18746#bib.bib3)) 将其扩展到中介下的序贯决策问题。在并行工作中,Richens 等人 (2025 (https://arxiv.org/html/2606.18746#bib.bib2)) 表明,在固定环境中,任何在一族足够丰富的多步目标上满足遗憾上界的智能体必须已经学到了该环境的近似转移模型。在每种情况下,智能体都被形式化为一个从已知任务或领域索引到策略的映射,并且通过在不同输入下查询该映射来读取世界模型。我们的设置移除了这个显式索引:智能体只观察自己的轨迹,因此任何世界模型信息都必须隐含地包含在记忆中,而不是智能体的输入中。这将分析对象从任务到策略的映射转向了历史/轨迹到记忆的映射,并且要求一个记忆层面的必要性陈述。
#### 强化学习中的记忆和潜在上下文。
我们的设置——一系列共享结构但通过一个未观测因子而具有不同动力学的 MDP,该因子必须由智能体从经验中推断——与强化学习中的已有形式化框架密切相关。它可以被视为部分可观测 MDP (POMDP) 的一个实例 (Kaelbling 等人, 1998 (https://arxiv.org/html/2606.18746#bib.bib7)),并且与隐藏上下文推断的形式化框架(如贝叶斯自适应 MDP (Duff, 2002 (https://arxiv.org/html/2606.18746#bib.bib8)) 和隐藏参数 MDP (Doshi-Velez 和 Konidaris, 2016 (https://arxiv.org/html/2606.18746#bib.bib9)))相关,当领域具有参数化描述时尤为如此。大量经验性文献提出了从轨迹推断潜在上下文的方法。基于循环的方法 (Hausknecht 和 Stone, 2015 (https://arxiv.org/html/2606.18746#bib.bib5); Duan 等人, 2016 (https://arxiv.org/html/2606.18746#bib.bib10))(我们将其用作基线)隐含地将上下文承载在 RNN 的隐藏状态中。基于上下文的方法 (Rakelly 等人, 2019 (https://arxiv.org/html/2606.18746#bib.bib11); Zintgraf 等人, 2021 (https://arxiv.org/html/2606.18746#bib.bib12)) 则学习一个显式的潜在任务变量,并附带一个专门的推断目标。这些文献提出了架构和训练目标,以获得在相关上下文隐藏时能够成功的智能体。我们的贡献是互补的——我们不提出算法;相反,我们提出疑问:任何**在这个族中**均匀成功的智能体必须编码什么,以及在什么样的附加条件下,这种编码允许解码局部干预动力学。
#### 因果强化学习与分布偏移。
更广泛地,我们的工作与分布偏移下基于因果方法的强化学习相关。块 MDP (Du 等人, 2019 (https://arxiv.org/html/2606.18746#bib.bib13)) 和块 MDP 中的不变预测 (Zhang 等人, 2020 (https://arxiv.org/html/2606.18746#bib.bib14)) 利用因果结构来识别能跨环境泛化的状态表示;因果表示学习 (Schölkopf 等人, 2021 (https://arxiv.org/html/2606.18746#bib.bib15)) 研究从观测中恢复潜在因果变量;而可迁移性文献则刻画了在何种条件下,在一个领域中识别的因果效应可以迁移到另一个领域。这些工作主要关注在给定结构假设下的识别;而我们的工作关心的是,当这种结构未被给定而必须由智能体推断时,为了胜任地行动,智能体的记忆必须编码什么。
## 3 方法
我们研究一个目标条件型智能体,它必须在目标和领域上都近乎最优地行动。一个领域,由索引 \(\sigma \in \Sigma\) 标记,指定了可能改变转移动力学的环境条件。智能体不直接观测 \(\sigma\),因此任何行动选择所需的领域信息必须从其历史中推断。等价地,该设置是一个潜在领域部分可观测马尔可夫决策过程(POMDP)。
在一个回合开始时,选择一个领域 \(\sigma\) 但不向智能体透露。在该领域条件下,观测状态上的过程是一个马尔可夫决策过程(MDP),具有状态 \(S_t\)。因此,唯一的隐藏变量是固定的领域索引。如果原始观测在固定领域内不是马尔可夫的,那么 \(S_t\) 表示增广的观测状态,使得固定领域的 MDP 描述成立。主要问题是智能体必须将什么信息存储在记忆中才能跨领域和目标任务良好地行动。
我们首先证明一个控制论层面的分离结果:如果两个领域在相同状态下,对于相同目标需要不同的价值最优行动,那么任何均匀近乎最优的目标条件策略必须编码能够区分这些领域的信息。这个分离结果并未识别出转移核。然后我们添加辅助探测目标和一个价值充分性条件,在此条件下,相同的记忆表示支持局部干预动力学的近似解码。
### 3.1 设置
我们在离散时间中建模交互,状态空间为 \(\mathcal{S}\),动作空间为 \(\mathcal{A}\),折扣因子为 \(\gamma \in [0,1)\)。令 \(\mathcal{P}(\mathcal{S})\) 表示 \(\mathcal{S}\) 上的概率测度集。在时刻 \(t\),智能体观测到 \(S_t \in \mathcal{S}\) 并选择 \(A_t \in \mathcal{A}\)。对于每个领域 \(\sigma \in \Sigma\),初始状态从 \(\mu_\sigma\) 中抽取,转移由一个干预核 \(P^\sigma\) 控制。我们记 \(\operatorname{do}(A_t = a)\) 为在时刻 \(t\) 外部设定动作 \(a\)。对于任意状态 \(s \in \mathcal{S}\),动作 \(a \in \mathcal{A}\) 以及可测集 \(B \subseteq \mathcal{S}\),定义
\[
P^\sigma(B \mid s, a) := \Pr_\sigma(S_{t+1} \in B \mid S_t = s, \operatorname{do}(A_t = a)).
\]
因此,\(P^\sigma(\cdot \mid s, a) \in \mathcal{P}(\mathcal{S})\) 是在领域 \(\sigma\) 中状态 \(s\) 执行动作 \(a\) 后的下一状态分布。该核不是动作上的观测分布;它描述了动作固定后的下一状态规律。
令 \(\Psi\) 为在分离结果中使用的目标族。每个目标 \(\psi \in \Psi\) 直接由一个有限的分步效用函数 \(u_\psi: \mathcal{S} \times \mathcal{S} \to \mathbb{R}\) 指定。我们假设存在 \(U_{\max} < \infty\),使得对于所有 \(\psi \in \Psi\) 和所有 \((s, s') \in \mathcal{S} \times \mathcal{S}\),有 \(|u_\psi(s, s')| \leq U_{\max}\)。这些效用是目标规范的一部分,不由领域索引;领域依赖性通过 \(\mu_\sigma\) 和 \(P^\sigma\) 进入。
在选择 \(A_t\) 之前,智能体观测到历史 \(h_t = (S_0, A_0, S_1, A_1, \ldots, A_{t-1}, S_t)\)。给定目标 \(\psi\),其策略为 \(\pi(\cdot \mid h_t; \psi)\)。因此,在领域 \(\sigma\) 中,轨迹演化如下:\(S_0 \sim \mu_\sigma\),\(A_t \sim \pi(\cdot \mid h_t; \psi)\),以及 \(S_{t+1} \sim P^\sigma(\cdot \mid S_t, A_t)\)。
对于策略 \(\pi\)、领域 \(\sigma\)、目标 \(\psi\) 和初始状态 \(s_0\),定义
\[
V^{\pi, \psi}_\sigma(s_0) := \mathbb{E}_{\pi, \sigma}\!\left[ \sum_{t=0}^{\infty} \gamma^t u_\psi(S_t, S_{t+1}) \mid S_0 = s_0 \right],
\]
以及
\[
V^{\star, \psi}_\sigma(s_0) := \sup_{\pi} V^{\pi, \psi}_\sigma(s_0).
\]
对于状态-动作价值,定义
\[
Q^{\star}_{\sigma, \psi}(s, a) := \sup_{\pi} \mathbb{E}_{\pi, \sigma}\!\left[ \sum_{k=0}^{\infty} \gamma^k u_\psi(S_k, S_{k+1}) \mid S_0 = s, \operatorname{do}(A_0 = a) \right].
\]
干预 \(\operatorname{do}(A_0 = a)\) 只固定第一个动作;后续动作由 \(\pi\) 选择。当概率或期望以 \(s_0\) 为条件时,过程从 \(S_0 = s_0\) 开始。
智能体将历史存储在记忆 \(M_t = f(h_t) \in \mathcal{M}\) 中。策略通过一个共享的策略头 \(\pi_M\) 行动,因此 \(\pi(a_t \mid h_t; \psi) = \pi_M(a_t \mid M_t, \psi)\)。因此,具有相同记忆状态和目标的两个历史会诱导相同的动作分布。
### 3.2 控制论意义上的相关性
我们只关心对动作选择有影响的领域差异。两个领域可能具有不同的转移核,但如果它们对于每个相关目标诱导相同的近乎最优动作集,那么它们可以被视为可互换的。
固定 \(\varepsilon_{\mathrm{ctrl}} \geq 0\)。对于每个领域 \(\sigma\)、目标 \(\psi\) 和状态 \(s\),定义近乎最优动作集:
\[
\mathcal{A}^{\varepsilon_{\mathrm{ctrl}}}_{\sigma, \psi}(s) := \left\{ a \in \mathcal{A} : Q^{\star}_{\sigma, \psi}(s, a) \geq \sup_{a' \in \mathcal{A}} Q^{\star}_{\sigma, \psi}(s, a') - \varepsilon_{\mathrm{ctrl}} \right\}.
\]
###### 定义 1(控制等价性)
两个领域 \(\sigma, \tilde{\sigma} \in \Sigma\) 相对于 \(\Psi\) 是**控制等价**的,如果对于每个目标 \(\psi \in \Psi\) 和每个状态 \(s \in \mathcal{S}\),有
\[
\mathcal{A}^{\varepsilon_{\mathrm{ctrl}}}_{\sigma, \psi}(s) = \mathcal{A}^{\varepsilon_{\mathrm{ctrl}}}_{\tilde{\sigma}, \psi}(s).
\]
非等价性本身并不总是强制记忆分离:如果近乎最优动作集在某个状态下相等...相似文章
智能体是否需要与知识库分离的“大脑”?
作者提出一个思维模型:AI智能体应维护一个独立的记忆层(大脑),用于存储可复用的理解,与知识库(图书馆)区分开来,以避免反复重新发现相同的信息。
探索智能体记忆系统的跨场景通用性:诊断与强基线
本文评估了面向LLM智能体的八种记忆系统在五种不同场景下的表现,发现给予智能体对存储和检索的主动控制(而非被动管道)能够获得最佳的跨场景泛化能力,并由此提出了AutoMEM框架。
智能体记忆不仅仅是基于用户事实的RAG
文章认为,简单的基于RAG的智能体记忆系统在生产中会失败,原因包括过时的偏好、遗漏的关键词和提示注入等问题,并主张采用分层记忆架构,具备主动选择、确定性回退、治理和测试等功能。
尝试让智能体记忆跨会话持久化所学的经验
本文反思了AI智能体记忆的复杂性,远超简单的存储问题,强调了诸如判断真实性、优先级变化、区分决策与噪音以及何时恰当地呈现上下文等挑战。
大家都说自己的智能体“有记忆”——那你到底是什么意思?
这篇文章讨论了AI智能体中“记忆”的模糊含义,强调了不同的解释,如上下文填充、向量数据库、用户画像和暂存区,并呼吁更清晰的定义。