CoMIC:云边系统中面向长时任务的大语言模型代理的协作记忆与洞察循环

arXiv cs.AI 论文

摘要

CoMIC 是一种面向大语言模型代理的云边框架,通过协作记忆和洞察循环提升长时任务性能,无需参数更新,在多个任务中实现进度率和动作依据的提升。

arXiv:2606.00756v1 公告类型:新 摘要:在边缘服务器上部署轻量级大语言模型(LLM)代理可以降低延迟,使代理服务更接近用户,但资源受限的边缘模型往往难以处理需要持久记忆、子目标跟踪和反思的长时任务。部署后微调边缘模型成本高昂且难以跨异构节点扩展,而纯本地记忆使代理拥有孤立经验并导致提示上下文不断增长。我们提出 \textsc{CoMIC},一种无需参数更新的云边框架,用于协作记忆与洞察循环。\textsc{CoMIC} 采用“集中反思,分散执行”的设计理念:边缘代理使用面向子目标的层次化记忆和选择性重扩展相关历史记录在本地执行,而云端大语言模型评估器异步评估已完成轨迹、过滤可复用经验,并聚合以语义子目标标识符为索引的跨代理指导。在涵盖符号规划与文本交互的五项长时代理任务中,\textsc{CoMIC} 提升了弱边缘代理的进度率和动作依据,并在不更新模型参数的情况下获得了依赖于任务的成功率提升。
查看原文
查看缓存全文

缓存时间: 2026/06/02 15:48

# CoMIC:云端-边缘系统中面向长周期LLM代理的协作记忆与洞察循环
来源:https://arxiv.org/html/2606.00756
王燕楠,北京交通大学 yannanwang@bjtu\.edu\.cn &杨龙丽¹ 北京交通大学 longli\_yang@163\.com &刘臻 北京交通大学 zhliu@bjtu\.edu\.cn Abhishek Kumar 艾伦·图灵研究所 akumar@turing\.ac\.uk &Carsten Maple 华威大学 CM@warwick\.ac\.uk
¹同等贡献。*华威大学WMG访问博士生。†通讯作者。‡亦任职于英国伦敦艾伦·图灵研究所。

###### 摘要

在边缘服务器上部署轻量级大语言模型(LLM)代理可以降低延迟,并将代理服务更贴近用户,但资源受限的边缘模型在需要持久记忆、子目标跟踪和反思的长周期任务中常常表现不佳。在部署后微调边缘模型成本高昂且难以跨异构节点扩展,而纯本地记忆则导致代理经验孤立且提示上下文不断膨胀。我们提出**CoMIC**,一种无需参数更新的云端-边缘框架,用于协作记忆与洞察循环。CoMIC遵循**集中式反思、分散式执行**的设计:边缘代理使用面向子目标的分层记忆和选择性重新展开相关历史记录来本地执行,而云端LLM评论者异步评估已完成轨迹,过滤可重用经验,并通过语义子目标标识符聚合跨代理指导。在五个涵盖符号规划和文本交互的长周期代理任务中,CoMIC提升了弱边缘代理的进度率和动作基础性,并在不更新模型参数的情况下,实现了依赖任务的成功率提升。

## 1 引言

尽管基于大语言模型(LLM)的代理在自主决策方面展现出巨大潜力[2 (https://arxiv.org/html/2606.00756#bib.bib3),24 (https://arxiv.org/html/2606.00756#bib.bib33)],但它们对经典记忆范式的依赖——即将整个交互历史串联到提示中——由于上下文爆炸和高令牌消耗,在长周期任务中变得非常低效[19 (https://arxiv.org/html/2606.00756#bib.bib31),6 (https://arxiv.org/html/2606.00756#bib.bib9)]。最近的研究通过将记忆分解为跨试验记忆和试验内(工作)记忆来缓解这一问题,以提高利用效率[17 (https://arxiv.org/html/2606.00756#bib.bib27),23 (https://arxiv.org/html/2606.00756#bib.bib36),7 (https://arxiv.org/html/2606.00756#bib.bib11)]。然而,维护和检索这些分层记忆引入了大量的计算和存储开销。因此,此类架构主要设计用于资源丰富的环境,且通常不适合部署在资源受限的平台上。

在边缘服务器上部署轻量级LLM代理已成为一种将自主能力更贴近用户的实用解决方案[11 (https://arxiv.org/html/2606.00756#bib.bib20)]。然而,如附录B (https://arxiv.org/html/2606.00756#A2)(图4 (https://arxiv.org/html/2606.00756#A2.F4))所示,受限于有限的计算和上下文容量,边缘部署常常在复杂的、长周期任务中损害推理能力[20 (https://arxiv.org/html/2606.00756#bib.bib30)]。虽然基于任务经验持续微调模型是一种常规方法,但在高度多样化的任务和异构边缘节点上频繁进行参数更新会带来巨大的计算开销,使得在实践中难以扩展[21 (https://arxiv.org/html/2606.00756#bib.bib37)]。因此,在不进行参数更新的情况下优化基于文本的记忆交互机制是一种更具可扩展性的替代方案[22 (https://arxiv.org/html/2606.00756#bib.bib32)]。尽管如此,纯本地执行限制了资源受限的边缘代理只能拥有孤立经验,缺乏有效支持复杂任务所需的跨代理共享和统一建模。

边缘部署代理所面临的限制与人类认知中的基本策略高度相似[15 (https://arxiv.org/html/2606.00756#bib.bib25)]:在注意力和时间有限的情况下,个体通常依赖轻量级启发式方法进行即时行动,而将更深入的思考保留给离线回顾。受此观察启发,并遵循不更新模型参数的范式,我们提出了一种面向记忆增强型边缘LLM代理的云端-边缘协作框架——**协作记忆与洞察循环**(CoMIC)。该框架在“集中式反思、分散式执行”范式下运行,将计算密集型的跨试验长期记忆维护和复杂逻辑反思任务卸载到云端。同时,边缘节点仅维护轻量级、可选择扩展的记忆用于即时决策,从而在资源受限环境中实现复杂长周期任务的突破。总之,我们的贡献如下。

- •据我们所知,CoMIC是首个旨在增强轻量级边缘LLM代理长周期决策能力的协作框架。边缘代理在子目标驱动下自主执行决策。它们采用异步轨迹上传机制以确保独立的无阻塞执行,并动态组合本地分层记忆与云端全局指导。
- •云端LLM作为全局评论者实现跨边缘经验总结。它独立评估边缘代理异步上传的单个轨迹,通过反思提炼高质量经验。随后,利用子任务的语义标识符进行跨边缘索引,它批评来自不同边缘代理的兼容子目标的已评估经验,从而获得适用于匹配边缘上下文的精选全局指导。
- •在多个长周期决策基准上的广泛实验表明,CoMIC优于最先进的记忆增强基线。它在有效约束上下文令牌消耗的同时,显著提高了任务成功率和执行能力,且无需任何参数更新。

## 2 预备知识

### 2.1 任务设置

我们考虑一组部署在资源受限环境中的边缘代理 E={e1,⋯,eN}。对于给定的全局任务 g,每个边缘代理通过一系列决策步骤与环境交互。由于长周期任务通常需要多个相互依赖的决策,执行过程被组织为一系列子目标情节,而不是平坦的历史记录。

在步骤 t,边缘代理 e^i 维护当前子目标 g_t^i,接收观察 o_t^i,执行动作 a_t^i,并获取相应的结果 r_t^i。该子目标情节 t 的交互轨迹定义为

τ̂_t^i = (g, g_t^i, o_t^i, a_t^i, r_t^i),   (1)

其中 t ∈ {1, ..., T_g},T_g 表示全局任务 g 可以被划分为的子目标情节总数。这种公式将长周期任务的执行建模为子目标的结构化进展,为后续的记忆组织和云端协调提供了基本单元。

### 2.2 以记忆为中心的云端-边缘范式

在此设置中,边缘层负责在线执行。每个边缘代理维护一个工作记忆,其中包含即时决策所需的本地上下文。该上下文包括当前活跃的子目标以及最相关于当前步骤的近期交互历史。云端层在此执行循环之外运行,通过从过去经验中推导出的可重用记忆来增强未来决策。

##### 轨迹评估

第一种机制评估一个已完成的轨迹或子目标情节。通过此机制,云端分析本地执行记录并产生与相应上下文相关的、基于轨迹的反思。该路径支持云端证据接纳和后续重用,而不会中断边缘的在线执行。

##### 全局指导

第二种反馈机制在全局层面运行。它不仅仅关注单一轨迹,而是从跨兼容代理和任务积累的经验中提炼可重用的指导,生成超越单一情节的、更高级别的知识。因此,边缘专注于及时行动,而云端则暴露精选的**全局指导**,作为未来决策的唯一建议渠道。下一节将在CoMIC中实例化这种以记忆为中心的云端-边缘范式。

## 3 方法论

在本节中,我们正式介绍CoMIC,一个以记忆为中心的云端-边缘协作框架。该框架通过在云端总结跨代理经验,并将精选指导返回给边缘代理,从而提升轻量级边缘LLM代理的长周期决策能力。

### 3.1 系统设计概览

图1 (https://arxiv.org/html/2606.00756#S3.F1) 展示了CoMIC的工作流程。边缘节点处理本地决策和环境交互,而云端执行经验反思和跨边缘知识聚合。这种设计使得边缘能够进行异步执行,并辅以云端辅助的全局反思。

参见图注图1:CoMIC的系统架构和工作流程。边缘将长周期任务组织成子目标情节,与环境交互,并维护分层本地记忆。已完成的轨迹异步上传到云端进行评估和聚合。云端使用轨迹级反思进行证据接纳,并返回精选的**全局指导**作为后续情节的唯一建议渠道,而不会中断正在进行的执行。工作流程从终端层开始,由用户发出任务请求。在边缘,本地代理将该请求组织为一系列子目标情节,与环境交互,并将产生的踪迹记录到结构化的轨迹中。为确保实时响应,轨迹被异步上传而不阻塞本地执行。

收到上传的轨迹后,云端使用作为全局评论者的LLM进行处理。该评论者评估轨迹级证据,并将被接纳的经验聚合为可重用的全局指导。

最后,精选的**全局指导**被返回给边缘,并异步组装到后续决策提示中,以改进后续决策。边缘记忆框架、云端评论者和动态协作机制的详细设计分别在§3.2 (https://arxiv.org/html/2606.00756#S3.SS2)、§3.3 (https://arxiv.org/html/2606.00756#S3.SS3) 和§3.4 (https://arxiv.org/html/2606.00756#S3.SS4) 中介绍。

### 3.2 边缘框架

CoMIC的边缘代理基于面向子目标的工作记忆,为本地任务建立了一种规划-执行处理模式。该框架将即时交互的关键步骤完全保留在边缘,同时将全局信息处理卸载到云端。

#### 3.2.1 子目标驱动的执行与轨迹

对于全局任务 g,边缘代理 e^i 将其分解为子目标驱动的子目标情节。通过严格地将每个本地决策与当前活跃的子目标对齐,代理在结构上减轻了边缘的推理负担。形式上,CoMIC将全局轨迹 τ_g^i 表示为所有子目标情节的有序集合:

τ_g^i = {τ̂_1^i, τ̂_2^i, ..., τ̂_{T_g}^i},   (2)

其中每个 τ̂_t^i 记录与特定子目标相关的交互经验。

#### 3.2.2 分层记忆与摘要器

边缘代理的本地记忆采用分层结构。对于当前活跃的情节,它维护详细的行动-观察对,以指导精确的本地决策。相反,对于已完成的前期情节,轨迹段在适当时被压缩为抽象摘要;在紧凑的符号PDDL领域(如Blocksworld和Gripper)中,则保留简洁的谓词级状态以避免丢失对象基础。为了在不溢出上下文限制的情况下选择性检索详细的轨迹,系统通过选择性重新展开动态重建历史上下文。形式上,给定一个与当前决策相关的、先前已总结的子目标索引集 I,代理重建历史上下文 H_t^i:

H_t^i(I) = {Summary(τ̂_t^i) | t ∉ I} ∪ {τ̂_t^i | t ∈ I}   (3)

完成的子目标被压缩为摘要,而可重用的云端指导则作为单独的提示级建议信号被保留。

### 3.3 基于LLM的云端评论者框架

云端评论者异步地在当前边缘情节的即时执行循环之外运行,直接将上传的交互轨迹处理为结构化的反思和可重用的知识,以指导边缘的未来决策。

#### 3.3.1 单轨迹规范化与评估

云端评估独立地对单个子目标轨迹进行。上传的轨迹被缓冲在短期记忆中,不会阻塞边缘执行。因此,云端的即时输入是一个单一的轨迹 τ̂_t^i,连同其上下文特征(例如,任务和子目标标识符),这些特征为云端识别轨迹对应的子目标情节提供了必要的解释。

在评估之前,每个轨迹的上下文特征被规范化为统一的语义标识符,以对齐异构的边缘输入。

规范化后,云端通过将情节轨迹与其规范化特征结合,构建轨迹级文本记录:

x_t^i = Serialize(τ̂_t^i, m̃_t^i),   (4)

其中 m̃_t^i 表示规范化的特征集,x_t^i 是序列化的评估记录。此序列化将完成的情节格式化为云端评估的标准表示。

云端评论者执行对 x_t^i 的轨迹级评估。为避免冗余的LLM调用,先前已处理的轨迹通过缓存标识被识别。当找不到精确匹配时,相关的先前经验和合成的全局见解会丰富评估上下文,使评论者能够参考积累的知识来评估轨迹。云端评论者的提示显示在图2(a) (https://arxiv.org/html/2606.00756#S3.F2.sf1) 中。

#### 3.3.2 评论者引导的经验蒸馏

基于对轨迹的评估,云端评论者进一步充当门控反思模块。评估输出 C_t^i 形成一个反思记录,包括摘要、见解、建议以及来自LLM的自我报告置信度分数 s_self。为了评估该反思的实际可靠性,我们为每个评估定义一个接纳分数。(继续翻译剩余部分)

但是用户提供的原文在“3.3.2 Critic-Guided Experience Distillation”之后被截断了,所以我需要根据已有的内容继续翻译。由于原文在此处被截断,我只能翻译到现有文本的末尾。

注意:原文在“we define an admission score for each evalua”处中断,没有完整句子。我会保持原样翻译为中文,但需要指出原文不完整。不过作为翻译,我应该只处理提供的文本。所以翻译到“接纳分数”为止,但句子不完整,可能需要保留原文的截断状态。为了忠实,我翻译到“我们为每个评估定义一个接纳分数”并保留不完整的结束。但为了通顺,我将“evalua”理解为“evaluation”的一部分,翻译为“评估”,但原文没有完整。实际上原文是“we define an admission score for each evalua”,所以应该翻译为“我们为每个评估定义一个接纳分数”。这样句子不完整,但只能如此。

考虑到用户提供的完整文章直到3.3.2节开头,后面没有更多内容。所以我将翻译到此处为止。注意保持markdown格式,包括数学公式等。数学公式如 \mathcal{E} 应保持原样或适当处理,但在markdown中应保持原样。此外,原文中的引用如[2 (https://...)]在翻译时应该保留链接形式。

我将严格按照提供的文本逐段翻译,直到最后一句。(续上)

#### 3.3.2 评论者引导的经验蒸馏

基于对轨迹的评估,云端评论者进一步充当门控反思模块。评估输出 C_t^i 形成一个反思记录,包括摘要、见解、建议以及来自LLM的自我报告置信度分数 s_self。为了评估该反思的实际可靠性,我们为每个评估定义一个接纳分数。

(原文在此处截断,翻译保持原样)

相似文章

面向长周期任务的智能体兼容上下文管理

arXiv cs.AI

介绍AdaCoM,一种基于外部LLM的上下文管理器,适用于冻结的智能体。通过保留任务约束和修剪过时内容,利用强化学习提升长周期任务性能,并在网络搜索和深度研究基准上进行了实验。

基于文件系统的LLM Agent记忆:组织、演化与可持续性

arXiv cs.CL

本文首次系统性地探索了基于文件系统的LLM Agent记忆,将管理、搜索和执行Agent的角色规范化,使其围绕一个共享的记忆存储。研究发现,组织主要降低了检索成本,但尚未提升答案质量,并且工具选择对存储形态的影响与模型选择一样大。