移动边缘计算中基于LLM辅助合同网协商的多代理流处理调度

arXiv cs.AI 论文

摘要

本文提出了MAS-DecStream,一种用于移动边缘-云基础设施中流处理的去中心化调度框架,通过LLM辅助协商扩展了合同网协议。实验表明,与基于规则的基线相比,延迟违规减少且效用提高。

arXiv:2608.12371v1 公告类型:新 摘要:流处理系统日益在异构的移动边缘-云基础设施上运行,其中工作负载波动、资源争用和严格的服务质量(QoS)要求使得去中心化调度变得复杂。本文提出了\emph{MAS-DecStream},其主要贡献为\emph{LLM-MR-CNP}:经典合同网协议的一种扩展,包含语义CFP表述、渐进式上下文披露、多轮提议修订、协商记忆和确定性验证。边缘集群代理根据局部观察、预测资源状态和定性运行时上下文优化自然语言卸载提议,而硬性资源和QoS约束保持确定性。基于阿里巴巴ASI Trace的实验从三个层面评估该扩展:单轮与多轮CNP对比、基于规则与LLM辅助优化对比、固定模型单轮与多轮协商对比。在评估配置下,MAS-DecStream将延迟违规降至3\%,消除了资源过度承诺,在20个代理下达到0.91的冲突解决率,并且相对于多轮基于规则的基线将效用提升高达22\%。一项单独的25案例评估显示了模型和提示相关的准确率-成本权衡。结果提供了初步证据,表明多轮CNP优化是协议层面的主要增益,而LLM辅助为定性和不确定的运行时上下文增加了价值。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:24

# 面向移动边缘计算中流处理的多智能体调度与LLM辅助合同网协商

Source: https://arxiv.org/html/2608.12371
###### 摘要

流处理系统日益运行在异构的移动边缘-云基础设施上,其中工作负载波动、资源竞争以及严格的服务质量(QoS)要求使去中心化调度变得复杂。本文提出*MAS-DecStream*,其主要贡献是*LLM-MR-CNP*:一种对经典合同网协议(Contract Net Protocol)的扩展,包含语义化CFP生成、渐进式上下文披露、多轮提案修订、协商记忆和确定性校验。边缘集群智能体基于局部观测、预测资源状态和定性运行时上下文来细化自然语言卸载提案,而硬性资源和QoS约束仍保持确定性。基于阿里云ASI Trace的实验从三个层面评估了该扩展:单轮与多轮CNP、基于规则与LLM辅助细化、以及固定模型的单轮与多轮协商。在评估配置下,MAS-DecStream将延迟违规率降低至3%,消除了资源过度承诺,在20个智能体下冲突解决率达到0.91,并且相比多轮基于规则的基线,效用提升最高达22%。一项单独的25案例评估显示了依赖模型和提示词的准确率-成本权衡。结果表明,多轮CNP细化是协议层面的主要收益来源,而LLM辅助在定性和不确定的运行时上下文方面增加了价值。

## I 引言

流处理系统支持对延迟敏感的应用(如智慧城市、智能交通和工业物联网)进行持续分析。在异构边缘-云基础设施上调度这些应用仍然困难,因为工作负载快速演变、资源地理分布广泛,且每个边缘集群只能观察到全局状态的一部分[7](https://arxiv.org/html/2608.12371#bib.bib143), [24](https://arxiv.org/html/2608.12371#bib.bib130)。因此,独立的局部决策可能选择同一目标,导致稀缺资源过载、高优先级流被延迟,并违反QoS约束。

为应对这些挑战,近期研究利用联邦学习(FL)[7](https://arxiv.org/html/2608.12371#bib.bib143), [32](https://arxiv.org/html/2608.12371#bib.bib198)、强化学习(RL)和深度学习(DL)[2](https://arxiv.org/html/2608.12371#bib.bib123), [6](https://arxiv.org/html/2608.12371#bib.bib127), [24](https://arxiv.org/html/2608.12371#bib.bib130)将调度决策推向网络边缘,以预测工作负载变化并优化分布式任务放置。虽然这些方法提升了在线适应性,但许多方法仍依赖集中式聚合,带来了通信瓶颈、单点故障和安全风险[7](https://arxiv.org/html/2608.12371#bib.bib143)。尽管FL缓解了这种依赖,但通常会产生显著的通信和学习开销,同时仅提供全局系统状态的部分可见性[21](https://arxiv.org/html/2608.12371#bib.bib144)。因此,边缘集群可能做出局部最优但全局冲突的调度决策,导致资源竞争、任务放置效率低下、高优先级任务执行延迟,以及在延迟敏感的流应用中产生QoS违反[7](https://arxiv.org/html/2608.12371#bib.bib143)。

经典多智能体机制,包括拍卖和CNP,提供了显式的去中心化交互[4](https://arxiv.org/html/2608.12371#bib.bib204), [31](https://arxiv.org/html/2608.12371#bib.bib192), [22](https://arxiv.org/html/2608.12371#bib.bib168),然而其固定的消息和投标规则在需求包含异构定量约束和定性警告时可能难以适应。基于LLM的智能体提供了一种互补能力:它们可以解释语义丰富的上下文、生成解释,并在多轮交互中修订提案[17](https://arxiv.org/html/2608.12371#bib.bib200), [20](https://arxiv.org/html/2608.12371#bib.bib201)。

参见图1:部分系统可见性下经典单阶段任务卸载决策的局限性。如图1所示,独立行动的集群可能选择同一个表面上可行的目的地,从而产生无法仅通过局部观测预见的资源竞争和QoS违反。这促使在经典的单次公告-中标CNP循环中,在最终分配之前引入显式的集群间提案细化。

本文通过*MAS-DecStream*研究这一集成。每个代表性边缘集群智能体观察其本地集群,使用监控和校验工具,并与相邻智能体就任务迁移进行协商。所提出的*LLM辅助多轮CNP*(LLM-MR-CNP)仅在第一轮提案未能产生明确目的地时,才逐步披露额外的工作负载和QoS上下文。最终分配仍受确定性可行性和效用检查的约束。

本文的贡献有三个:(1)LLM-MR-CNP,这是对经典CNP的显式扩展,引入了语义化CFP生成、渐进式披露、迭代提案修订、任务作用域协商记忆和有界终止;(2)混合智能体架构,其中LLM解释上下文信息并生成协商消息,而确定性工具强制执行资源、截止时间和效用约束;(3)全面评估,区分了多轮CNP细化的效果与LLM辅助上下文推理的增量贡献,同时联合报告调度质量和协商开销。

在本文中,我们研究以下研究问题:

- • RQ1:在负载漂移下,将单轮CNP扩展为多轮提案细化如何影响延迟违规、效用和协调成本?*多轮细化将延迟违规率从0.53降至0.37,而LLM辅助细化进一步将其降至0.03,并将效用从1.03提高到1.61,代价是额外的协商消息。*
- • RQ2:在并发请求下,LLM辅助上下文细化相比基于规则的多轮CNP能带来多少增量收益?*两种多轮方法都消除了资源过度承诺,而LLM辅助将冲突解决率从0.86提高到0.91(20个智能体),并将效用提升最高达22%。*
- • RQ3:协商深度、LLM选择和提示策略如何影响CFP质量、卸载准确率、延迟和令牌消耗?*对于固定的较大LLM,多轮协商将卸载准确率从0.71提高到0.88,而最佳模型-提示配置达到1.00准确率,尽管延迟和令牌消耗更高。*

本文其余部分组织如下。第II节回顾了去中心化调度、LLM辅助优化和多智能体协商的相关工作。第III节介绍系统模型和调度目标。第IV节介绍MAS-DecStream架构和所提出的LLM-MR-CNP协议。第V节描述实验方法,报告三个研究问题的结果,并讨论主要发现和有效性威胁。最后,第VI节总结全文并展望未来研究方向。

## II 相关工作

### II-A 去中心化调度与任务卸载

边缘-云调度已通过启发式、优化、强化学习和联邦学习等方法进行研究。近期的DRL调度器在异构资源条件下优化延迟、系统负载、能耗或执行成本[24](https://arxiv.org/html/2608.12371#bib.bib130), [2](https://arxiv.org/html/2608.12371#bib.bib123), [6](https://arxiv.org/html/2608.12371#bib.bib127),而联邦方法则分布化模型训练并减少操作数据的直接共享[7](https://arxiv.org/html/2608.12371#bib.bib143), [32](https://arxiv.org/html/2608.12371#bib.bib198)。这些方法提升了适应性,但协调通常通过学到的策略、共享优化器或固定数值交换来体现。因此,调度逻辑可能无法显式展现独立行动的集群如何协调并发请求、在新信息出现后修订报价,或解释为什么先前可行的目的地变得不安全。

经典多智能体协调提供了显式的替代方案。拍卖通过竞争投标支持去中心化资源分配[4](https://arxiv.org/html/2608.12371#bib.bib204),而CNP将任务分配分解为公告、提案、中标和拒绝阶段[22](https://arxiv.org/html/2608.12371#bib.bib168), [31](https://arxiv.org/html/2608.12371#bib.bib192)。它们的消息语义和评估策略是透明的,但通常是预定义的。当调度请求将数值约束与定性上下文(如可靠性警告、隐私条件或不确定的工作负载预测)结合在一起时,这种固定性就变得受限。因此,MAS-DecStream保留CNP作为交互骨干,同时将提案解释和细化扩展到固定数值投标之外。

### II-B 基于LLM和智能体AI的调度

LLM最近被集成到规划、优化和资源分配工作流中。Mongaillard等人[15](https://arxiv.org/html/2608.12371#bib.bib164)使用LLM辅助智能体将用户需求转化为电动汽车充电决策,Zhang等人[30](https://arxiv.org/html/2608.12371#bib.bib166)引入了面向无人机辅助物流调度的智能体框架。在MEC中,COMLLM将卸载形式化为语言条件下的序列决策[27](https://arxiv.org/html/2608.12371#bib.bib165);Ma等人[14](https://arxiv.org/html/2608.12371#bib.bib163)研究了LLM推理在异构边缘-云资源上的多层部署;AWTO在延迟约束下优化LLM驱动的智能体工作流放置[29](https://arxiv.org/html/2608.12371#bib.bib176)。Wang等人[23](https://arxiv.org/html/2608.12371#bib.bib175)进一步表明,多个LLM智能体可以协作生成、评估和细化候选调度方案。

这些研究证实LLM能够解释高层需求并支持优化,但它们的重点通常是用户请求转换、工作流放置、推理部署或集中式调度搜索。它们并未直接研究一种显式的去中心化合同协议,在该协议中,自治的边缘集群代表交换报价、根据新披露的上下文进行修订,并通过确定性校验保持硬性资源和QoS保证。

### II-C 基于LLM的多智能体协作与协商

智能体AI研究已从提示驱动的推理发展到有状态、基于角色的编排。ReAct将推理与行动相结合[28](https://arxiv.org/html/2608.12371#bib.bib152);Generative Agents和CAMEL展示了记忆支持和角色扮演交互[16](https://arxiv.org/html/2608.12371#bib.bib155), [9](https://arxiv.org/html/2608.12371#bib.bib154);AutoGen和MetaGPT通过结构化对话和工作流协调专门智能体[26](https://arxiv.org/html/2608.12371#bib.bib156), [5](https://arxiv.org/html/2608.12371#bib.bib159)。更近期的系统采用深思或协商来达成共识和解决冲突。Multi-Agent Debate通过迭代批判改进推理[3](https://arxiv.org/html/2608.12371#bib.bib193),CoLMDriver将LLM协商应用于协同驾驶[12](https://arxiv.org/html/2608.12371#bib.bib167),TeamFusion支持异构智能体之间的开放式团队协作[13](https://arxiv.org/html/2608.12371#bib.bib162)。规模研究还表明,通信结构和角色分配对集体性能有显著影响[17](https://arxiv.org/html/2608.12371#bib.bib200)。

表I总结了最接近的研究方向。MAS-DecStream位于它们的交汇点。它面向资源受限的流迁移,使用显式的去中心化协商协议,支持多轮上下文细化,并将LLM生成的语义决策与确定性可行性和效用检查分离。因此,其新颖性在于集成,而非单独发明CNP或LLM智能体。

表I:与代表性研究方向的位置对比。

## III 系统模型与目标

边缘-云环境建模为通信图G=\(A,E\)\mathcal\{G\}=\( \mathcal\{A\}, \mathcal\{E\}\),其中A=\{A1,...,AN\}\mathcal\{A\}=\{A_\{1\},\ldots,A_\{N\}\}是代表边缘集群智能体的集合,E\mathcal\{E\}包含它们之间的通信链路。智能体AiA_\{i\}只能观察到其所代表的集群,包括当前和预测的CPU、内存、带宽、延迟、工作负载和能耗状况。流任务Tk∈TT_\{k\}\in\mathcal\{T\}指定资源需求、延迟截止时间、重要性以及可选的兼容性或隐私要求。

令Dk=AjD_\{k\}=A_\{j\}表示将TkT_\{k\}分配给AjA_\{j\}所代表的集群,令MrM^\{r\}表示通过rr轮协商交换的消息。调度目标为 (eq.1)

\(D∗,r∗\)=arg⁡minD,r⁡OF\(D,Mr\),\(D^\{\ast\},r^\{\ast\}\)=\arg\min_\{D,r\}OF\(D,M^\{r\}\), (1)

其中

OF\(D,Mr\)=\displaystyle OF\(D,M^\{r\}\)=α1Latency~\(D\)+α2Energy~\(D\)\displaystyle\;\alpha_\{1\}\widetilde\{Latency\}\(D\)+\alpha_\{2\}\widetilde\{Energy\}\(D\)+α3\(1−LBDtotal\(D\)\)+α4CO~\(Mr\)\displaystyle+\alpha_\{3\}\bigl(1-LBD_\{\mathrm\{total\}\}(D)\bigr)+\alpha_\{4\}\widetilde\{CO\}(M^\{r\})

权重满足αm≥0\alpha_\{m\}\geq 0且∑mαm=1\sum_\{m\}\alpha_\{m\}=1。LBDtotal\(D\)∈\[0,1\]LBD_\{\mathrm\{total\}\}(D)\in[0,1]表示分配DD所导致的整体负载均衡度,值越接近1表示工作负载分布越均衡;因此,1−LBDtotal\(D\)1-LBD_\{\mathrm\{total\}\}(D)表示负载不均衡惩罚。项CO\(Mr\)\mathrm\{CO\}(M^\{r\})表示协商的协调开销,包括交换消息的数量和大小,以及适用时的协商轮次延迟。仅当分配后的CPU、内存和带宽保持在容量范围内,并且任务的截止时间、兼容性、隐私和执行需求得到满足时,目的地才是可行的。

目标函数由智能体的确定性推理工具评估,以对投标进行排序。此外,它使用LLM来解释上下文信息,并生成或细化用于获取所需输入的CNP消息。因此,该目标刻画了放置质量、负载均衡与提案细化轮次所带来的通信开销之间的权衡。

## IV MAS-DecStream

### IV-A 混合智能体架构

参见图2:MAS-DecStream将本地监控和执行与

相似文章

多智能体推理中的流式通信

Hugging Face Daily Papers

StreamMA 提出了一种用于多智能体推理的流式通信范式,通过管道化中间结果来降低延迟,并利用更可靠的早期步骤提升效果,在多个基准测试中优于基线方法,同时揭示了步骤级别的缩放定律。