全系统个性化的内核管理共享内存
摘要
本文介绍了用于人工智能系统的内核管理共享内存,通过集中化内存管理来提高多智能体环境中的个性化与效率,评估显示其相比其他方法有显著提升。
arXiv:2609.10144v1 公告类型:新
摘要:人工智能系统在能够适应用户时变得更加有用,但在多智能体系统中,一个智能体学到的有用上下文往往对其他智能体不可用。我们提出内核管理共享内存,这是一种系统级抽象,其中专门的智能体编写结构化、带标签的记忆,而由智能体系统内核(而非单个智能体)管理检索、隐私执行和提示注入。我们在AIOS上实现并评估了这一设计,并将其与三种替代方案在三种助手模型(GPT-4o、Llama-3.1:8B、Qwen-2.5:7B)和总共1,800次试验中进行比较。与使用相同底层存储的非管理外部内存后端(Mem0)相比,内核管理的检索和注入在5分制上将个性化得分提高了2.4-4.0分(例如,在GPT-4o上从1.05提高到4.69的档案使用率),所有比较在p < 10^-18时显著。与标准检索增强注入相比,收益同样大且在所有三个模型中一致。与完整的、未过滤的上下文拼接(一种对可用上下文的软上限而非对响应质量的限制)相比,内核管理注入在三个模型中的两个上性能统计匹配,在第三个上显示出小的、特定于模型的缺陷,同时使用显著更短的提示:在所有三个模型上端到端延迟降低15-61%,相应的每次调用令牌使用量和推理成本也减少。这些结果表明,将内存管理集中在智能体系统内核中,而不是将检索和隐私执行留给单个智能体,能够以远低于其成本的方式提供无约束上下文的大部分个性化好处。
查看缓存全文
缓存时间: 2026/09/11 08:43
# 内核管理的系统级个性化共享内存
来源:https://arxiv.org/html/2609.10144
\\workshoptitle
Ryan Lum
所属机构:计算机科学系
所属机构:罗格斯大学
所属机构:新泽西州皮斯卡塔韦 08854
电子邮箱:[rkl49@scarletmail\.rutgers\.edu](mailto:)
Yongfeng Zhang
所属机构:计算机科学系
所属机构:罗格斯大学
所属机构:新泽西州皮斯卡塔韦 08854
电子邮箱:[yongfeng\.zhang@rutgers\.edu](mailto:)
###### 摘要
当人工智能系统能适应其使用者时,它们会变得更有用。但在多智能体系统中,一个智能体学到的有用上下文往往对其他智能体不可用。我们提出内核管理的共享内存,这是一种系统级抽象:专用智能体写入结构化、带标签的记忆,而由智能体系统内核——而非各个智能体——来管理检索、隐私执行和提示注入。我们在 AIOS 上实现并评估了这一设计,将其与三种替代方案在三个助手模型(GPT-4o、Llama-3.1:8B、Qwen-2.5:7B)和共 1,800 次试验中进行比较。与使用相同底层存储的、无管理的外部内存后端(Mem0)相比,内核管理的检索和注入在 5 分制上将个性化分数提高了 2.4–4.0 分(例如,在 GPT-4o 上,个人资料使用的得分从 1.05 提高到 4.69),所有比较的显著性均达到 p<10^{-18}。与标准检索增强注入相比,在所有三个模型上,增益同样大且一致。与完整、未过滤的上下文拼接(它是可用上下文的软上限,而非响应质量的上限)相比,内核管理的注入在统计上与其中两个模型的性能相当,并在第三个模型上显示出小幅、特定于模型的差距,同时使用了显著更短的提示词:端到端延迟在所有三个模型上降低了 15%–61%,相应的每次调用令牌使用量和推理成本也有所降低。这些结果表明,将内存管理集中在智能体系统内核,而非将检索和隐私执行交给各个智能体,能以极低的成本获得无约束上下文带来的大部分个性化收益。
参考标题图 1:内核管理的共享内存在智能体系统内核中集中处理检索、隐私执行和提示注入,而非将它们留给各个智能体(左图对比右图),以极低的延迟和令牌成本实现了与完整上下文相当的个性化质量(第 4.4 节 (https://arxiv.org/html/2609.10144#S4.SS4))。
## 1 引言
个性化是使人工智能系统变得有用的关键要素:一个记住用户偏好、当前工作和过去交互的系统,会随着时间的推移产生更相关的响应。这在多智能体系统中尤其重要,因为不同的智能体学习用户上下文的不同部分——一个智能体可能学习稳定的偏好,另一个学习当前的任务上下文,第三个可能直接响应用户——如果这些信息保持隔离,系统就无法作为一个整体连贯地运作。
图 1 (https://arxiv.org/html/2609.10144#S0.F1) 对比了两种组织方式。在*智能体管理的记忆*(图 1a)下,每个智能体独立检索、过滤和注入自己的记忆,在智能体间重复逻辑,并将隐私执行留给每个智能体的惯例——这种设计很容易以我们在第 3.3 节 (https://arxiv.org/html/2609.10144#S3.SS3) 中描述的方式出错。我们提出*内核管理的共享内存*(图 1b):智能体写入结构化的、带标签的记忆,而一个区别于任何单个智能体的运行时层——智能体系统内核——集中管理写入顺序、隐私执行、检索、排序和注入。这使得个性化成为一种系统能力,而非重复的应用层逻辑。我们在 AIOS(一个现有的、面向大型语言模型智能体的操作系统风格框架)上实例化并评估了这一设计,尽管底层的抽象并非特定于 AIOS。
我们将这种方法与三种替代方案——无管理的外部内存后端、标准检索增强注入和完整的未过滤上下文拼接——在三个助手模型和共 1,800 次试验中进行了评估。内核管理的共享内存在每个测试模型上都显著且显著地优于无管理内存后端和标准检索增强注入。与完整的未过滤上下文(它是可用上下文的软上限,而非响应质量的上限)相比,内核管理的注入在统计上与其中两个模型的性能相当,并在第三个模型上显示出小幅、特定于模型的差距,同时使用了显著更短的提示词,从而降低了延迟和令牌成本。这些结果支持了本文的主要主张:将内存检索、隐私执行和注入集中在智能体系统内核,能以极低的成本获得无约束上下文带来的大部分个性化收益,而且比无管理的内存后端或标准检索增强更可靠。
## 2 相关工作
#### 面向大型语言模型智能体的记忆系统。
先前的工作主要集中在扩展记忆持久性以超越上下文窗口:MemoryBank (Zhong et al., 2024)、MemGPT (Packer et al., 2023)、LongMem (Wang et al., 2023) 和 ReadAgent (Lee et al., 2024) 都将记忆控制置于单个智能体或模型包装器内部。更新的系统改进了记忆的结构和适应性——Mem0 (Chhikara et al., 2025)、Zep (Rasmussen et al., 2025)、LangMem (LangChain Team, 2025) 和 A-MEM (Xu et al., 2025)——但在所有这些系统中,记忆仍然是应用层组件;我们则将访问、过滤、格式化和注入视为跨智能体共享的内核管理操作。
#### 多智能体框架与共享状态。
诸如 AutoGen (Wu et al., 2023)、CAMEL (Li et al., 2023)、MetaGPT (Hong et al., 2024) 和 AgentVerse (Chen et al., 2023) 之类的框架侧重于协调和角色专业化,通过消息传递或特定工作流的上下文来表示共享状态,个性化通常为每个智能体重新构建。我们引入了一种共享内存抽象,让多个智能体在系统级策略控制下,为和消费一个统一的用户上下文。最近的工作将跨智能体的记忆共享本身视为一个治理问题:Collaborative Memory (Rezazadeh et al., 2025) 通过带有来源标签的二分图形式化了访问控制,SSGM (Lam et al., 2026) 提出了针对漂移的写入验证和读取过滤门,Yang et al. (2026) 则表明仅良性交互就可能导致跨用户泄漏。我们的可见性规则和写入排序屏障(第 3.3 和 3.4 节)通过更简单的机制——静态的每项元数据和单个带序列号的屏障,而非二分权限图或漂移建模门——来针对同一类故障。
#### 个性化与用户建模。
大型语言模型中的个性化通常被构建为检索、提示、微调或用户建模,假设为单个应用或推理路径;没有一项工作解决多智能体系统如何决定哪些事实对哪个智能体可见、何时检索它们或如何注入它们的问题——我们将这些问题视为内核级基础设施。
#### 操作系统启发的智能体基础设施。
AIOS (Mei et al., 2024) 将智能体应用与内核管理的服务(如调度和内存管理)分离;OS-Copilot (Wu et al., 2024)、SWE-agent (Yang et al., 2024) 和 OpenHands (Wang et al., 2024) 同样强调运行时基础设施而非仅靠提示工程,MemOS (Li et al., 2025) 则主张记忆应可调度。我们基于这一视角,但关注一个更狭窄的空白:现有基础设施未将共享的个性化记忆作为智能体获取用户特定状态的核心内核服务。
## 3 方法与架构
### 3.1 概述与系统模型
我们提出内核管理的共享内存,作为多智能体大型语言模型系统中个性化的系统级抽象。核心设计选择是将个性化逻辑从各个智能体移入智能体系统内核:智能体写入带有标准化元数据的结构化记忆,而内核管理身份解析、写入排序、检索、隐私过滤、排序、格式化、令牌预算控制和提示注入。尽管我们的实现基于 AIOS,但该抽象并非特定于 AIOS:任何具有共享内存后端和受控提示构造路径的多智能体运行时都可以实现相同的设计。我们将系统层统称为*智能体系统内核*,AIOS 是我们的具体实例化。
我们考虑一个多智能体系统,其中智能体集 𝒜 = {a₁, a₂, ..., aₙ} 和记忆存储 ℳ。每个智能体接收一个查询 q = (aᵢ, u, x),其中 aᵢ 是请求智能体,u 是用户标识符,x 是输入提示。一个记忆项 m = (u, o, t, s, c),其中 o 是所有者智能体,t 是记忆类型,s 是共享策略,c 是内容。记忆类型包括 profile(个人资料)、task_context(任务上下文)和 conversation(对话);共享策略为 private(私有)或 shared(共享)。
#### 解析用户身份。
智能体无法独立于内核就共享一致的用户身份概念,天真地使用请求智能体自身的标识符作为代理会在并发试验下导致跨用户污染。我们转而通过一个显式的优先级顺序来解析 u——附加到请求上的标识符、最近注册的会话标识符、先前观察到的标识符的后备注册表,以及作为最后手段的请求智能体自身的标识符——该顺序在内核边界统一执行,而非留给每个智能体的惯例,从而关闭了开发过程中遇到的一类身份解析错误(第 4 节)。
内核将原始提示转换为增强后的提示 x' = K(aᵢ, u, x),其中 K 表示内核管理的个性化函数。
### 3.2 内核管理的共享内存
参考标题图 2:内核管理的共享内存:ProfileAgent 和 TaskAgent 写入结构化记忆,AssistantAgent 保持无检索状态,内核在它们之间执行写入排序、隐私、检索、格式化和注入。
图 2 展示了所提出的架构。ProfileAgent 和 TaskAgent 充当记忆生产智能体,分别提取稳定的用户信息和当前的任务上下文。AssistantAgent 充当无检索消费者:它不直接查询内存后端,也不构造自己的个性化提示;所有个性化上下文都通过内核管理的提示路径到达它。
内核通过五个操作实现个性化:(1) 为目标用户强制执行先写后读的顺序(第 3.4 节);(2) 检索候选记忆,R = search(ℳ, u, x);(3) 根据系统可见性规则过滤检索到的记忆(第 3.3 节);(4) 根据语义相关性和令牌预算对过滤后的记忆进行排序和截断;(5) 注入选中的记忆,x' = inject(x, R_k)——这属于系统调用路径的一部分,而非特定于应用的提示构造,有别于智能体级别的记忆系统。
### 3.3 记忆元数据与可见性
每个记忆项携带标准化元数据:owner_agent(所有者智能体)、user_id(用户ID)、memory_type(记忆类型)和 sharing_policy(共享策略)。重要的设计选择是 owner_agent 和 user_id 是独立的:多个智能体可能写入关于同一用户的记忆,但所有权和可见性保持明确。内核通过以下规则强制执行记忆可见性:
visible(m, aᵢ) =
{ True, 如果 o = aᵢ,
{ True, 如果 s = “shared”,
{ False, 其他情况。
如果共享策略缺失、格式错误或明确设为私有,则该记忆被视为私有,这使得隐私成为内核不变式,而非 SDK 惯例或提示级指令。
#### 隐私不变式。
不同于第 3.4 节的写入顺序保证(它约束了一个*时序*属性),可见性规则是记忆元数据本身的*静态*属性。形式上,对于所有记忆 m 和智能体 aᵢ ≠ aⱼ,若 o(m) = aⱼ 且 s(m) = private,则对于任何执行历史,visible(m, aᵢ) = False。
这是一个安全属性,无条件成立,不同于方程 (3)(它是一个活性/一致性属性,仅在有界超时内成立)。
#### 威胁模型与实证验证。
在内核处一次执行可见性,意味着智能体无法仅通过省略自身的过滤逻辑来窃取记忆,尽管此保证涵盖的是可见性(而非完整性),并且依赖于正确的身份解析(完整威胁模型见附录 A.2)。我们在两个配置端点对方程 (2) 进行了经验验证:完全私有 (n=450) 显示 0/450 暴露,完全共享 (n=450) 则在 1,798 个检索项中没有默认私有的 conversation 类型泄漏。
### 3.4 跨智能体检索管道与写入顺序保证
给定一个用户查询,内核解析目标 user_id(第 3.1 节),等待该用户的任何待处理写入被持久确认(如下),检索候选记忆,根据所有权和共享策略过滤它们,合并并去重结果,进行排序相似文章
先个性化再存储:面向长周期智能体的个性化记忆基准测试与学习
本文介绍了PerMemBench,这是首个用于评估基于LLM的智能体中个性化记忆系统的基准测试,并提出了一个会话级存储门控框架,该框架根据个体用户上下文调整记忆策略。
我通过MCP给我的AI代理带来了共享内存——方法如下
Nexus Memory 是一个原生 MCP 的内存服务器,允许 AI 代理通过统一协议共享上下文,实现跨不同代理的持久化、协调一致的内存,无需自定义集成。
MemPrivacy:面向边缘-云智能体的隐私保护个性化记忆管理
MemPrivacy 是一项研究,介绍了一种用于边缘-云 AI 智能体的隐私保护个性化记忆管理框架,该框架利用类型感知占位符在保护敏感数据的同时维持语义效用。本文包含一个新的基准数据集,并展示了其性能优于 GPT-5.2 和 Gemini-3.1-Pro 等通用模型。
我为AI代理构建了共享记忆——让它们不再遗忘,能彼此接力,你还能真正*看到*它们知道什么
一名开发者构建了kaeru,这是一个开源的AI代理共享记忆系统,能让代理跨会话持久化上下文、在不同代理和人类之间共享知识,并以3D星系形式可视化记忆。该工具支持多种代理框架,具备时间回溯、重要性级别和推理轨迹等功能。
MindMemOS:面向AI智能体的可移植、自进化记忆操作系统层
本文介绍了MindMemOS,一个面向AI智能体的可移植、自进化记忆操作系统层,采用统一的实体-属性-时间结构,并具备记忆精炼和技能进化算法。它在LOCOMO和PersonaMem基准上取得了显著准确率,并将SpreadsheetBench性能提升了9.2个百分点。