低空无线网络中异构无人机系统的智能体AI网络

arXiv cs.AI 论文

摘要

本文提出了一种分层混合LLM-MARL架构,用于低空无线网络中的智能体AI网络,通过适应不断变化的服务需求,无需重新训练即可实现异构无人机系统的协调共存。

arXiv:2609.19538v1 公告类型:新 摘要:低空无线网络(LAWNs)正成为支持异构无人机系统在共享三维空域内提供并发服务的关键基础设施。它们的共存导致了移动性、连接性和共享网络资源之间的强耦合,而异构服务施加了不同且随时间变化的需求。这些交互自然形成了一个动态非合作博弈,其中操作条件和协调目标随时间演变。传统的基于优化和学习的控制器通常依赖于预定义的目标,限制了它们自主适应不断变化的服务需求和资源优先级的能力。为了解决这一挑战,我们提出了一种分层混合大型语言模型(LLM)-多智能体强化学习(MARL)架构,组织为双环结构。具体而言,外环适应循环使用LLM辅助博弈编排来解释服务需求和操作员意图,并重新配置目标和资源优先级,而内环在配置的博弈下执行去中心化、参数条件化的MARL策略。一个物流监控案例研究说明了该框架如何促进异构服务之间的协调共存,在不重新训练底层MARL策略的情况下适应不断演变的操作条件。最后,我们讨论了迈向可扩展、可信赖和自适应智能体LAWN的关键挑战和研究方向。
查看原文
查看缓存全文

缓存时间: 2026/09/18 09:20

# 面向低空无线网络中异构无人系统的智能体AI组网
来源: https://arxiv.org/html/2609.19538

## 面向低空无线网络中异构无人系统的智能体AI组网
致谢:N. D. M. Quang和C. Liu来自澳大利亚墨尔本拉筹伯大学计算、工程与数学科学学院(邮箱:[email protected]; [email protected])。致谢:S. Li来自德国柏林柏林工业大学通信与信息理论讲席教授(邮箱:[email protected])。致谢:D. W. K. Ng来自澳大利亚悉尼新南威尔士大学电气工程与电信学院(邮箱:[email protected])。

###### 摘要

低空无线网络(LAWNs)正成为支撑异构无人系统在共享三维空域内提供并发服务的关键基础设施。这些系统的共存导致了移动性、连接性与共享网络资源间的强耦合,同时异构服务提出了独特且时变的需求。这些交互自然形成了一个动态非合作博弈,其中运行条件和协调目标均随时间演变。传统的优化与基于学习的控制器通常依赖预定义目标,限制了其在应对服务需求与资源优先级变化时的自主适应能力。为应对这一挑战,我们提出了一种分层混合大语言模型(LLM)-多智能体强化学习(MARL)架构,采用双环结构。具体而言,外层适应环利用LLM辅助博弈编排来解读服务需求和操作员意图,并重新配置目标与资源优先级;内层则在配置的博弈下执行去中心化的、参数条件化的MARL策略。一个物流-监控案例研究展示了该框架如何促进异构服务间的协调共存,在无需重训练底层MARL策略的情况下适应不断变化的运行条件。最后,我们讨论了迈向可扩展、可信且自适应的智能体低空无线网络的关键挑战和研究方向。

###### 索引术语:

智能体AI、群体、低空无线网络、多智能体强化学习、大语言模型、信道知识图、博弈论。

## I 引言

低空经济活动的快速扩张——从城市快递配送到持续的环境监测——正推动着低空无线网络(LAWNs)的部署。这些网络必须为在低于一公里空域运行的密集、高移动性空中系统提供可靠的连接性[1 (https://arxiv.org/html/2609.19538#bib.bib1), 2 (https://arxiv.org/html/2609.19538#bib.bib15)]。实际上,低空空中平台是网络拓扑不可或缺的一部分,其移动性动态影响着与地面基站(GBSs)的链路可用性和关联性,这激发了基于学习的设计以预测此类变化从而维持可靠链路[3 (https://arxiv.org/html/2609.19538#bib.bib18)]。至关重要的是,异构机队(例如,配送、监控、中继)必须共享空域以及其服务GBS的有限通信资源,即每个GBS分配给其服务的各类服务的带宽或发射功率资源,如图1所示[1 (https://arxiv.org/html/2609.19538#S1.F1)]。

参考图注 图1:低空经济中的异构服务争夺共享频谱、地面站容量和空域。每个GBS下方的条形图显示了其分配给当前所服务的各类服务的资源。
在实践中,每种服务通常被设计为一个独立的系统,拥有自己的控制器、协调方案和通信栈[4 (https://arxiv.org/html/2609.19538#bib.bib11)]。这种隔离导致跨服务冲突无法解决,因为每个系统都在优化自身目标而不考虑对其他系统的影响,可能引发拥塞和相互干扰。由于独立运行的系统通过共享资源相互耦合,它们的交互自然地被建模为一个博弈,目标是实现稳定高效的共存。重要的是,博弈的期望运行点是动态的,需要随着服务需求和优先级的变化重新配置运行时目标。同时,快速变化的拓扑结构要求低延迟、去中心化的控制,以避免过高的协调开销。满足这两个需求促使我们构建一个自主适应框架,将实时分布式执行与高层编排相结合。

基于学习的无线系统已经发展出了感知[5 (https://arxiv.org/html/2609.19538#bib.bib21)]、预测[6 (https://arxiv.org/html/2609.19538#bib.bib17)]和适应[7 (https://arxiv.org/html/2609.19538#bib.bib22)]作为特定任务的能力,但每个都只是构建模块,而非自主闭环决策。智能体AI是满足上述需求的天然候选者,因为智能体系统由一个自主闭环定义,该闭环能根据观察到的结果调整自身行为。具体而言,两类主要智能体天然满足这些需求:基于大语言模型(LLM)的智能体解释语言目标和上下文变化,而多智能体强化学习(MARL)执行去中心化的网络和移动动作。这种互补性激发了混合LLM-MARL框架的动机,该框架将高层推理与分布式策略执行相结合。然而,现有的智能体网络框架通常关注单服务场景或固定协调目标[8 (https://arxiv.org/html/2609.19538#bib.bib14), 9 (https://arxiv.org/html/2609.19538#bib.bib12)]。因此,如何整合这些互补的智能体能力,使异构服务能在优先级和网络条件演变时自主调整其协调策略,仍存在一个关键差距。

为填补这一差距,我们提出了一种分层混合LLM-MARL框架,用于实现异构LAWN中的自适应协调。本工作的主要贡献总结如下:

- • 与孤立的逐服务优化不同,我们将异构LAWN中的执行级共存制定为一个动态非合作博弈,并识别了编排级需求,为在共享资源上的协调共存提供了原则性基础。
- • 为解决传统固定目标控制的局限性,我们提出了一种分层混合LLM-MARL架构,该架构将LLM辅助的博弈编排与参数条件化的MARL执行相耦合,支持无需重训练底层去中心化策略的协调目标运行时重配置,并得到共享信道知识图的支持。
- • 我们展示了一个物流-监控共存案例研究,以演示该框架如何缓解自私的资源竞争,并将运行点适应于变化的服务优先级和网络条件,同时讨论了迈向可扩展智能体LAWN的开放挑战。

## II 异构服务LAWN

### II-A 两级网络任务

LAWN中的服务由具有不同目标的群体支持。如图1[1 (https://arxiv.org/html/2609.19538#S1.F1)]所示,这些群体通过共享频谱、地面站容量和空域进行交互。因此,每个空中平台面临的环境不仅由随机动态(例如天气、信道变化)塑造,还受其他有目的的实体决策影响[4 (https://arxiv.org/html/2609.19538#bib.bib11)]。我们将由此产生的网络任务组织为两个耦合的操作层级:支持服务范围网络的*执行级*,以及协调跨服务目标的*编排级*。这两个层级在其输出性质、所需信息和决策延迟要求上有所不同。

在*执行级*,空中平台在当前配置的目标下自主选择和执行网络动作以支持其服务。这些动作涵盖三个子任务[10 (https://arxiv.org/html/2609.19538#bib.bib10)]:
- • *频谱与干扰管理*包括动态频谱接入、发射功率控制和干扰协调。
- • *拓扑与连接管理*包括路由、中继选择、拓扑控制以及跨多个GBS和非地面平台的切换。
- • *通信感知移动性*包括考虑通信需求的轨迹规划。

尽管围绕单个服务组织,但这些动作仍通过共享资源在群体间耦合。飞机可以在动态城市环境中以每秒数十米的速度巡航,导致链路质量和邻居集快速变化。这些条件施加了严格的决策延迟要求,包括对时间关键网络动作的毫秒级响应。执行主要依赖于机载观测,包括信道状态、接收功率和邻居报告,并产生用于通信和移动性的数值控制变量。

在*编排级*,全网协调涉及在服务间分配任务和优先级、重配置协议以及与空中交通管理和人类操作员协调。其输入包括服务需求、合同、法规和操作员意图(通常以自然语言表达),以及关于网络条件和服务性能的反馈。编排以较慢的时间尺度运行,通常是秒到分钟级,随着需求和运行条件的变化修订服务目标、优先级和协议设置。至关重要的是,它不规定具体的网络动作;相反,它配置空中平台选择这些动作的目标和运行设置。

因此,这种区别既是功能性的也是时间性的:执行在当前目标下确定网络动作,而编排则配置和修订跨服务的这些目标。两个层级通过向下指导执行和向上反馈产生的网络条件及服务性能相互耦合。

### II-B 博弈制定

策略博弈为执行级空中平台间的交互提供了自然的模型[11 (https://arxiv.org/html/2609.19538#bib.bib8)]。与具有单一全网目标的集中式制定不同,它代表了不同服务的独特目标和决策自主权。群体竞争有限的共享资源,因此它们的性能结果取决于彼此的行动。这种博弈论制定捕捉了策略依赖性,支持网络稳定性分析,并为配置跨服务的协调目标提供了结构化基础。我们通过四个组成部分来描述博弈[12 (https://arxiv.org/html/2609.19538#bib.bib7)]:
- • *参与者:* 单个飞机作为自主参与者。支持相同服务的飞机共享服务特定的效用权重,并被建模为朝着共同服务目标合作,而跨服务的交互是非合作的。
- • *动作空间:* 飞机从共同类型的网络动作中进行选择,包括发射功率控制、中继选择和通信感知轨迹规划。这些动作通过共享资源在服务间产生频谱和空间耦合。
- • *支付:* 每个参与者的效用奖励服务特定性能,如配送速度或感知数据新鲜度,同时惩罚过度消耗共享网络资源。由此产生的支付取决于参与者自身的动作和其他飞机的动作。
- • *信息结构:* 每个参与者使用局部观测选择其动作,并可与邻近飞机交换信息。参与者缺乏对全网资源状态以及其他群体飞机策略和支付函数的完整知识。

编排器不是这个执行级博弈中的参与者:它既不选择上述定义的飞机级动作,也不在博弈中拥有参与者支付。相反,它在编排级运行,根据第II-A节[2 (https://arxiv.org/html/2609.19538#S2.SS1)]配置支付参数,例如服务特定的效用权重。信息结构可以通过聚合多个飞机的观测并与相关参与者共享由此产生的信息来丰富。

### II-C 传统方法的局限性

虽然博弈制定捕捉了服务间的策略交互,但其实现既需要及时的动作选择,也需要自适应的目标重配置。传统解决方案方法在执行级和编排级面临不同的局限性。
- • *执行级:* 基于模型的博弈求解和优化在未建模环境和紧张的延迟预算下举步维艰。虽然基于学习的方法能处理环境随机性和对手动态,但集中式执行在机队规模和联合决策空间增长时会产生高昂的计算和信令开销[13 (https://arxiv.org/html/2609.19538#bib.bib20)]。因此,挑战在于在部分可观察性下实现可扩展的、去中心化的动作选择,同时考虑跨服务交互。
- • *编排级:* 挑战在于修订指导执行的目标,而不仅仅是在固定目标下优化动作。操作员意图、网络条件和服务性能通常以自然语言表达,必须被解读以配置服务目标和支付参数。由于固定规则和特定任务模型扩展性和泛化性差,自适应编排需要超越静态映射的上下文感知解读。

这些互补需求促使我们采用一种智能体方法来闭合两个耦合的环:一个在当前目标下适应网络动作,另一个则适应目标本身。

### II-D 智能体AI:两种决策机制

表1:LLM智能体与MARL智能体在智能体网络中的对比。
为实现上述闭环适应,智能体系统可以结合具有互补能力的专用智能体[14 (https://arxiv.org/html/2609.19538#bib.bib16)]。它们对不同任务的适用性取决于主要生成其决策的计算模型。借鉴语言模型驱动和基于强化学习的智能体[15 (https://arxiv.org/html/2609.19538#bib.bib13)],我们聚焦于两种面向异构服务LAWN的互补决策机制:
- • *基于LLM的智能体*使用预训练的语言模型来解读目标和上下文信息、推理可能的响应,并生成结构化的决策或工具调用。自然语言指令可以辅以观测和检索的知识,而上下文窗口和检索增强的记忆支持跨交互推理[16 (https://arxiv.org/html/2609.19538#bib.bib2)]。其预训练知识和上下文推理可以支持对不熟悉指令的响应,尽管不能保证可靠的泛化。决策生成、检索和

相似文章

网络化低空无人机的神经符号智能体AI

arXiv cs.AI

本文针对网络化低空无人机提出了一种神经符号智能体AI(NSAAI)框架,旨在支持不确定条件下的可靠自适应自主决策,并包含参考架构及城市消防巡检案例研究。

Agentic AI 网络中涌现通信的泛化界限

arXiv cs.AI

本文提出了一个用于 Agentic AI 网络(AgentNet)中涌现通信的信息论框架,解决了物理约束问题并提供了泛化界限。在硬件原型上的实验验证表明,与现有最先进的解决方案相比,该框架显著提升了泛化性能。