记忆即通信:记忆与信号传递之间的前沿

arXiv cs.AI 论文

摘要

本文探讨有限智能体中记忆与同伴通信之间的权衡,提出“记忆–信号传递前沿”以在资源限制下优化信息分配,提升任务性能。

arXiv:2608.17053v1 发布类型:新 摘要:有限智能体可以通过自身的过去、同伴或两者兼有来获取决策信息。保留任务相关历史可以减少后续通信,而同伴信息可以补充记忆的不足。在资源都有限的情况下,智能体应如何分配其信息预算?给定固定任务和决策规则,达到性能阈值的记忆和消息速率对在指定使用历史和同伴观察的规则下形成可实现区域。我们称其高效边界为记忆–信号传递前沿。在历史允许相同最大任务损失减少的条件下,我们假设有限智能体从历史中获得更大的损失减少时,需要更少的同伴通信。在初步的指代游戏中,目标重复与更短的成功消息相符,而来自隐藏循环规则的可预测性并未缩短消息。通过变化记忆和消息速率的实验,可以估计前沿并在合作任务中测试此预测。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:50

# 记忆即通信:记忆与信号之间的边界
来源:https://arxiv.org/html/2608.17053
Yashar Talebirad, Eden Redman  
所属机构:Applied Technology Network,加拿大埃德蒙顿  
邮箱:[email protected], [email protected]  
Ali Parsaee  
所属机构:Alberta Machine Intelligence Institute,University of Alberta,加拿大埃德蒙顿  
Osmar R. Zaïane  
所属机构:Alberta Machine Intelligence Institute,University of Alberta,加拿大埃德蒙顿

###### 摘要

一个有界智能体可以从自身过去、同伴或两者兼有的来源获取决策信息。保留与任务相关的历史记录可以减少后续通信,而同伴消息则可以提供记忆缺失的信息。在资源同时受限的情况下,智能体应如何分配其信息预算?给定一个固定的任务和决策规则,在指定的历史记录和同伴观测使用规则下,达到性能阈值的记忆与消息速率对构成了一个可达区域。我们称其有效边界为“记忆-信号前沿”。在历史记录允许同等程度降低任务损失的不同条件下,我们假设:当有界智能体从历史记录中获得的损失减少越大,其所需的同伴通信就越少。在初步的指代博弈实验中,目标的重复出现与更短的成功消息相对应,而基于隐藏循环规则的可预测性并未缩短消息长度。通过变化记忆和消息速率的实验,可以估计该前沿并在协作任务中检验这一预测。

## 引言

协作智能体通常在记忆和通信带宽受限的条件下,基于不完全观测进行行动。现有协议优化了哪些智能体进行通信、发送什么内容以及发送对象[9],而本地历史记录可能包含同伴原本需要传输的信息。记忆被描述为时间分离的自我之间的通信[2],我们使用“记忆即通信”来指代在固定任务性能下,保留的历史记录可以替代同伴输入的情况。当累积的历史记录超过智能体单次决策所能处理的范围时,层次记忆会将过去信息分组和压缩,以便在有限的输入预算下检索[7]。持续学习面临的是在新数据到来时保留可用经验的相关问题[4]。率失真理论将存储或传输的比特与允许的误差联系起来[6],而 Wyner–Ziv 编码展示了接收器已有的信息如何减少达到误差目标所需的比特数[10]。我们针对固定的任务和决策规则,明确哪些历史记录和同伴观测可以使用,从而制定了这种分配方案。

## 框架与假设

固定一个任务 \( T \),包括其实例分布和损失函数,并令解码器 \( A \) 为将决策者的当前观测和提供的表示映射到任务输出的决策规则。源规则 \( \mathsf{src} \) 确定了决策者及其同伴,并指明了决策者过去哪些记录以及同伴的哪些观测可以被编码。它们还指明了这些源何时可用,并排除了未来记录或决策者无法获取的其他信息。在评估之前,先指定一个允许的编码方案族 \( \Pi_A(\mathsf{src}) \)。每个 \( \pi \in \Pi_A(\mathsf{src}) \) 描述了允许的历史记录如何被保留并编码为 \( M_\pi \),以及允许的同伴观测如何被编码为消息 \( C_\pi \)。将 \( M_\pi \) 远程存储仍然计入记忆速率,而早期传输缓存的 \( C_\pi \) 仍然计入通信量。任一编码输出均可以为空,从而允许方案使用单一来源、两者都用或都不使用。令 \( D_A(\pi; T) \) 为 \( A \) 在接收到决策者的当前观测、\( M_\pi \) 和 \( C_\pi \) 时的期望任务损失。令 \( R_m(\pi) \) 和 \( R_c(\pi) \) 分别为 \( M_\pi \) 和 \( C_\pi \) 的期望编码长度,以每次决策的比特数度量。可达的记忆-通信速率区域为:

\[
\mathcal{R}_A^{\mathrm{MC},\varepsilon} = \left\{ (b_m, b_c) \in \mathbb{R}_+^2 : \exists \pi \in \Pi_A(\mathsf{src}), \quad D_A(\pi; T) \leq \varepsilon, \quad R_m(\pi) \leq b_m, \quad R_c(\pi) \leq b_c \right\}.
\]

该区域取决于解码器、任务、源规则和方案族,包含了在允许的方案下期望损失不超过 \( \varepsilon \) 的每个预算对。帕累托有效下边界包含了这样的分配:降低任一速率都将需要提高另一速率或超过损失阈值。我们称此边界为“记忆-信号前沿”。令 \( c_m, c_c > 0 \) 分别为记忆和通信的每比特成本。任何最小化 \( c_m b_m + c_c b_c \) 的区域点都位于该前沿上。

我们的计算方法计入了历史表示所用的比特和同伴消息所用的比特,并探究有界解码器从历史记录中获得的损失减少是否能预测在相同任务损失下消息速率的降低。在留出的任务实例上,解码器在三种预先固定速率的输入条件下进行评估。第一种仅包含决策者的当前观测,第二种增加了历史表示,第三种增加了同伴消息。增加历史记录后的损失减少称为“可用历史增益”,增加同伴输入后的额外减少称为“可用同伴增益”。增加顺序会影响这两种增益,因此我们在比较中保持源顺序、速率和损失度量固定。贝叶斯最优解码器在任务分布下,从提供的输入中获得的期望损失是最低的。在从历史记录中获益相同的条件下,我们假设学习到的解码器在其可用历史增益更大时,将需要更少的消息比特来达到目标损失。

第二个假设探讨:当记忆速率和消息速率同时变化时,通过每次变化一个速率进行的测量是否能够预测最低成本分配。在绘制完整区域之前,先在不发送同伴消息的情况下,测量随着记忆速率增加时的损失;然后,在记忆速率固定的情况下,测量随着消息速率增加时的损失。我们预测,当两个速率同时变化时,这两条曲线能够确定最小化 \( c_m b_m + c_c b_c \) 的记忆-消息分配。当目标重复出现更频繁或状态保持不变的时间更长时,最低成本分配可能会从使用更多消息比特转向使用更多记忆比特。我们称这种转变发生的点为“交叉点”,并根据这两条曲线在同时变化两个速率之前预测该点。

## 初步结果

为了探究目标可预测性与消息长度之间的关系,我们在一个源自[8]并改编的 Lewis 信号博弈[3]中改变了目标过程,使用由 instruction-tuned Gemma 4 31B 驱动的发送者-接收者对。每一轮,发送者从八个颜色-形状-尺寸组合中渲染出的四个形状中看到指定的目标,并通过符号集 \( \{A, B, C\} \) 向接收者发送 \( L \in \{1, 2, 3\} \) 个符号,允许发送 \( 3^L \) 条消息,相当于每轮 \( L \log_2 3 \) 比特。接收者看到相同的形状并猜测目标。符号没有预设含义,反馈在每次猜测后揭示目标和结果。每个智能体保留一个私人笔记本和前二十次交互记录。对于每个条件和种子,不同的对在 \( L=1, 2, 3 \) 时分别进行四十轮游戏。我们记录了其对在最后十轮中准确度 \( \geq 0.85 \) 时的最小 \( L \) 值,记为 \( L_{\min} \)(机会水平为 0.25)。

在重复条件下,下一个目标以概率 \( p \) 复制前一个目标,否则从均匀分布中随机抽取。在两个批次共六个种子的实验中,平均 \( L_{\min} \) 从 \( p=0 \) 时的 2.67 单调下降到 \( p=0.95 \) 时的 1.00。由于剧集历史从未被移除,同时学习到的符号映射得以保留,这些运行无法单独分离历史记录的贡献。

表 1:三个种子的平均 \( L_{\min} \)。重复条件使用 \( p=(0, 0.5, 0.8, 0.95) \),轮换条件使用 \( p=(0, 0.5, 0.85, 1) \)。
在打乱轮换条件下,八个目标形成一个固定的、随机排列的、对智能体隐藏的循环。每一轮,序列以概率 \( p \) 前进一步,否则跳转到随机目标。当 \( p=1 \) 时,序列在四十轮中完成了五个循环,然而平均 \( L_{\min} \) 从 \( p=0 \) 时的 2.33 增加到 \( p=1 \) 时的 3.00。

## 讨论

对比的趋势激发了我们的假设,该假设仍需通过预先记录的可用历史测量和消息速率预测来验证。进一步的解释受限,因为目标过程在规则复杂性和遇到的不同目标数量上存在差异,而证据仅来自一个模型族、每批次三个种子和四十轮交互。这些局限性推动了三个逐步更具一般性的测试。

第一个测试使用一个小规模状态估计任务,其中隐藏状态以固定概率在一轮到下一轮之间保持不变,否则发生变化。智能体根据自身带噪声观测的压缩记录和关于同伴带噪声观测的速率受限消息来估计其值。由于状态和编码是有限的,可以精确计算允许方案的贝叶斯最优前沿,并与学习到的解码器前沿进行比较。

第二个测试通过在指代博弈中改变记忆速率、消息速率和目标可预测性,绘制了已测试区域的部分。在每个条件下,所有速率设置使用相同的目标流,跨过程的比较则匹配目标频率和从历史记录中获得的贝叶斯最优增益。记忆消融移除剧集历史但保留学习到的符号映射。更长的运行和另一个模型族可以区分学习时间不足与无法可靠使用轮换规则的情况。

第三个测试在具有局部视图的分布式任务上重复这些速率实验。AgentsNet 提供着色、最大匹配、顶点覆盖、领导者选举和共识任务[1]。LoopBench 提供重复的图着色任务,其中可观察的动作可能传递信息[5]。我们预先注册一个包含局部和全局协调任务的子集,然后改变私人输入或局部状态保持不变的时间长度,同时保持通信图和任务目标固定。为了比较任务,我们将记忆、显式消息以及可观察动作传递的信息计入相同的比特预算。对于每个任务和模型族,我们使用每次变化一个速率的测量来预测在同时变化两个速率之前的交叉点。

## 致谢

本研究得到了 Alberta Machine Intelligence Institute (Amii) 和 Canada CIFAR AI Chairs 项目的支持。我们还感谢 Applied Technology Network (NAT) 的支持。作者使用了 Claude (Anthropic) 和 Codex (OpenAI) 来协助代码开发和文稿编辑。所有 AI 辅助的输出都经过作者的审查和验证,作者对作品承担全部责任。

## 参考文献

- Grötschla 等 (2025) F. Grötschla, L. Müller, J. Tönshoff, M. Galkin, and B. Perozzi. AgentsNet: coordination and collaborative reasoning in multi-agent LLMs. arXiv preprint arXiv:2507.08616. 外部链接: Link (https://arxiv.org/abs/2507.08616) 引用于: 讨论 (https://arxiv.org/html/2608.17053#Sx4.p4.1)。
- Levin (2024) M. Levin. Self-improvising memory: a perspective on memories as agential, dynamically reinterpreting cognitive glue. Entropy 26(6), pp. 481. 外部链接: Document (https://dx.doi.org/10.3390/e26060481) 引用于: 引言 (https://arxiv.org/html/2608.17053#Sx1.p1.1)。
- Lewis (1969) D. Lewis. Convention: a philosophical study. Harvard University Press. 引用于: 初步结果 (https://arxiv.org/html/2608.17053#Sx3.p1.1)。
- Parisi 等 (2019) G. I. Parisi, R. Kemker, J. L. Part, C. Kanan, and S. Wermter. Continual lifelong learning with neural networks: a review. Neural Networks 113, pp. 54–71. 外部链接: Document (https://dx.doi.org/10.1016/j.neunet.2019.01.012), Link (https://doi.org/10.1016/j.neunet.2019.01.012) 引用于: 引言 (https://arxiv.org/html/2608.17053#Sx1.p1.1)。
- Parsaee 等 (2025) A. Parsaee, Y. Talebirad, C. Szepesvári, V. Ohal, and E. Redman. LoopBench: discovering emergent symmetry breaking strategies with LLM swarms. arXiv preprint arXiv:2512.13713. 外部链接: Link (https://arxiv.org/abs/2512.13713) 引用于: 讨论 (https://arxiv.org/html/2608.17053#Sx4.p4.1)。
- Shannon (1959) C. E. Shannon. Coding theorems for a discrete source with a fidelity criterion. In IRE National Convention Record, Vol. 4, pp. 142–163. 引用于: 引言 (https://arxiv.org/html/2608.17053#Sx1.p1.1)。
- Talebirad 等 (2026a) Y. Talebirad, A. Parsaee, C. Y. Szepesvári, A. Nadiri, and O. R. Zaïane. Toward a theory of hierarchical memory for language agents. 注: ICLR 2026 Workshop on Memory for LLM-Based Agentic Systems. 外部链接: Link (https://arxiv.org/abs/2603.21564) 引用于: 引言 (https://arxiv.org/html/2608.17053#Sx1.p1.1)。
- Talebirad 等 (2026b) Y. Talebirad, E. Redman, A. Parsaee, and O. R. Zaïane. From signals to structure: how memory architecture drives language emergence in LLM agents. arXiv preprint arXiv:2607.00233. 注: Accepted at the 2026 Conference on Artificial Life. 外部链接: Document (https://dx.doi.org/10.48550/arXiv.2607.00233) 引用于: 初步结果 (https://arxiv.org/html/2608.17053#Sx3.p1.1)。
- Wang 等 (2020) R. Wang, X. He, R. Yu, W. Qiu, B. An, and Z. Rabinovich. Learning efficient multi-agent communication: an information bottleneck approach. In Proceedings of the 37th International Conference on Machine Learning, Proceedings of Machine Learning Research, Vol. 119, pp. 9908–9918. 外部链接: Link (https://proceedings.mlr.press/v119/wang20i.html) 引用于: 引言 (https://arxiv.org/html/2608.17053#Sx1.p1.1)。
- Wyner and Ziv (1976) A. Wyner and J. Ziv. The rate-distortion function for source coding with side information at the decoder. IEEE Transactions on Information Theory 22(1), pp. 1–10. 外部链接: Document (https://dx.doi.org/10.1109/TIT.1976.1055508) 引用于: 引言 (https://arxiv.org/html/2608.17053#Sx1.p1.1)。

相似文章

GateMem:多主体共享记忆代理中的记忆治理基准评测

Hugging Face Daily Papers

GateMem是一个用于评估多主体共享记忆代理中记忆治理的基准,涵盖医疗、办公、教育和家庭领域的效用、访问控制和遗忘。当前方法无法同时平衡这三者,表明可靠的共享机构部署仍然难以实现。

Memora: 平衡抽象与具体性的和谐记忆表示

Hacker News Top

Memora 是一个可扩展的 AI 智能体记忆系统,它将存储与检索解耦,在长周期任务上实现了最先进的性能,同时使用的 token 数量减少了高达 98%。该研究发表于 ICML 2026。