DRG-MAPPO:用于协同空战的分层动态角色图多智能体强化学习
摘要
一种结合图注意力机制和动态角色分配的分层多智能体强化学习框架,提高了空战中的战术协调和胜率。
查看缓存全文
缓存时间: 2026/09/11 10:16
论文页面 - DRG-MAPPO:面向协同空战的层次化动态角色图多智能体强化学习
来源:https://huggingface.co/papers/2609.11155
摘要
一种结合图注意力与动态角色分配的层次化多智能体强化学习框架,可提升空战中的战术协同与胜率。
多智能体强化学习 (https://huggingface.co/papers?q=Multi-Agent%20Reinforcement%20Learning) 已成为自主系统和空战复杂决策的关键范式。尽管该方法在空战中展现了巨大潜力,但实现精细的战术协同仍是重大挑战。这主要归因于两个限制:(1) 缺乏结构化的关系建模 (https://huggingface.co/papers?q=relational%20modeling) 阻碍了智能体捕捉战场实体间复杂、时变的交互关系;(2) 传统扁平架构通常无法显式建模战术角色,导致高度动态环境中的任务分配模糊。为解决这些挑战,我们提出了层次化动态角色图多智能体近端策略优化 (https://huggingface.co/papers?q=Proximal%20Policy%20Optimization) (DRG-MAPPO (https://huggingface.co/papers?q=DRG-MAPPO))——一种集成基于图的关系建模 (https://huggingface.co/papers?q=relational%20modeling) 与动态角色分配 (https://huggingface.co/papers?q=dynamic%20role%20assignment) 的新型多智能体强化学习框架。具体而言,DRG-MAPPO 构建了战场交互的图表示,并利用图注意力机制 (https://huggingface.co/papers?q=graph%20attention%20mechanisms) 提取友军、敌军和威胁之间的关键关系特征。随后,高层策略采用动态角色分配机制来确定战术职责(例如“领导者”与“支援者”)。基于这些角色和编码后的图关系特征,低层策略执行离散机动动作,从而实现战术策略与协同执行的联合优化。此外,我们设计了目标优先级辅助任务 (https://huggingface.co/papers?q=auxiliary%20task),以促进集火等行为的涌现。实验结果表明,DRG-MAPPO 取得了87%的最优胜率,表明我们的框架能有效平衡协同空战中的关系建模 (https://huggingface.co/papers?q=relational%20modeling)、可解释性与优化稳定性。
查看 arXiv 页面 (https://arxiv.org/abs/2609.11155) 查看 PDF (https://arxiv.org/pdf/2609.11155) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.11155)
在您的代理中获取此论文:
hf papers read 2609.11155
尚未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.11155 以将其关联到本页面。
引用此论文的数据集0
无数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.11155 以将其关联到本页面。
引用此论文的 Space 0
无 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.11155 以将其关联到本页面。
包含此论文的收藏夹0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其关联到本页面。
相似文章
学习合作、竞争和沟通
OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。
GraMRAG: 利用图记忆与强化学习协调多智能体多步推理
GraMRAG是一个新的多智能体RAG框架,它使用图记忆和强化学习来提升复杂多模态任务中的推理深度和记忆结构,实现了最先进的性能。
基于多智能体强化学习的空中走廊降级监视下的冲突解决
本文提出了一种基于深度Q网络的多智能体强化学习框架,用于在降级监视条件下运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决,并在90种交通密度和间隔阈值组合中评估策略。
基于约束流形控制的安全且可泛化的分层多智能体强化学习
本文提出了一种分层多智能体强化学习框架,该框架通过低层的约束流形强制执行硬安全约束,同时通过高层策略学习实现有效协调,提供了理论上的安全保障,并实现了近乎完美的安全率和良好的泛化能力。
可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。