DRG-MAPPO:用于协同空战的分层动态角色图多智能体强化学习

Hugging Face Daily Papers 论文

摘要

一种结合图注意力机制和动态角色分配的分层多智能体强化学习框架,提高了空战中的战术协调和胜率。

多智能体强化学习(MARL)已成为自主系统和空战中复杂决策的关键范式。虽然MARL在空战中展现了巨大潜力,但实现复杂的战术协调仍是一个非平凡的挑战。这一困难主要归因于两个主要限制:(1)缺乏结构化的关系建模,阻碍了智能体捕获战场实体之间复杂、时变的交互;(2)传统的扁平架构往往缺乏显式建模战术角色的能力,导致在高度动态的环境中任务分配模糊。为解决这些挑战,我们提出了分层动态角色图多智能体近端策略优化(DRG-MAPPO),一种新颖的MARL框架,将基于图的关系建模与动态角色分配相结合。具体而言,DRG-MAPPO构建战场交互的基于图的表示,并利用图注意力机制提取盟友、敌人和威胁之间的关键关系特征。随后,高层策略采用动态角色分配机制来确定战术责任(例如,“领导者”和“支持者”)。基于这些角色和编码的图关系特征,底层策略执行离散机动动作,促进战术策略和协作执行的联合优化。此外,设计了一个目标优先级辅助任务,以促进如集中火力等行为的涌现。实验结果表明,DRG-MAPPO达到了87%的先进胜率,表明我们的框架有效平衡了关系建模、可解释性和优化稳定性,适用于协同空战。
查看原文
查看缓存全文

缓存时间: 2026/09/11 10:16

论文页面 - DRG-MAPPO:面向协同空战的层次化动态角色图多智能体强化学习

来源:https://huggingface.co/papers/2609.11155

摘要

一种结合图注意力与动态角色分配的层次化多智能体强化学习框架,可提升空战中的战术协同与胜率。

多智能体强化学习 (https://huggingface.co/papers?q=Multi-Agent%20Reinforcement%20Learning) 已成为自主系统和空战复杂决策的关键范式。尽管该方法在空战中展现了巨大潜力,但实现精细的战术协同仍是重大挑战。这主要归因于两个限制:(1) 缺乏结构化的关系建模 (https://huggingface.co/papers?q=relational%20modeling) 阻碍了智能体捕捉战场实体间复杂、时变的交互关系;(2) 传统扁平架构通常无法显式建模战术角色,导致高度动态环境中的任务分配模糊。为解决这些挑战,我们提出了层次化动态角色图多智能体近端策略优化 (https://huggingface.co/papers?q=Proximal%20Policy%20Optimization) (DRG-MAPPO (https://huggingface.co/papers?q=DRG-MAPPO))——一种集成基于图的关系建模 (https://huggingface.co/papers?q=relational%20modeling) 与动态角色分配 (https://huggingface.co/papers?q=dynamic%20role%20assignment) 的新型多智能体强化学习框架。具体而言,DRG-MAPPO 构建了战场交互的图表示,并利用图注意力机制 (https://huggingface.co/papers?q=graph%20attention%20mechanisms) 提取友军、敌军和威胁之间的关键关系特征。随后,高层策略采用动态角色分配机制来确定战术职责(例如“领导者”与“支援者”)。基于这些角色和编码后的图关系特征,低层策略执行离散机动动作,从而实现战术策略与协同执行的联合优化。此外,我们设计了目标优先级辅助任务 (https://huggingface.co/papers?q=auxiliary%20task),以促进集火等行为的涌现。实验结果表明,DRG-MAPPO 取得了87%的最优胜率,表明我们的框架能有效平衡协同空战中的关系建模 (https://huggingface.co/papers?q=relational%20modeling)、可解释性与优化稳定性。

查看 arXiv 页面 (https://arxiv.org/abs/2609.11155) 查看 PDF (https://arxiv.org/pdf/2609.11155) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.11155)

在您的代理中获取此论文:

hf papers read 2609.11155

尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.11155 以将其关联到本页面。

引用此论文的数据集0

无数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.11155 以将其关联到本页面。

引用此论文的 Space 0

无 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.11155 以将其关联到本页面。

包含此论文的收藏夹0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其关联到本页面。

相似文章

学习合作、竞争和沟通

OpenAI Blog

OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。

可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学

arXiv cs.LG

本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。