解耦通信与策略:带宽约束下的鲁棒多智能体强化学习

Hugging Face Daily Papers 论文

摘要

本文介绍了SLIM,一种极简架构,在多智能体强化学习中解耦通信与策略表示,在带宽约束下以最小性能下降实现最先进性能。

通信使得多智能体强化学习(MARL)中的协调成为可能,但许多实际应用,例如使用无人机群进行搜索救援,在严重的带宽约束下运行。许多通信架构仍然存在一个耦合瓶颈,即共享的潜在表示同时用于策略执行和智能体间通信。因此,减少消息大小直接限制了策略的潜在空间,往往导致显著的性能下降。我们通过两项贡献来解决这一问题。首先,我们引入β,一个归一化的每智能体带宽预算,将稀疏性、轮次和消息维度统一为单一可比较的约束。其次,我们提供SLIM,一种极简架构,将通信路径与策略的潜在表示解耦,从而在受益于同步通信的同时,隔离带宽对策略容量的影响。我们在几个部分可观测的MARL基准上评估了我们的方法,这些基准中通信至关重要。我们的方法实现了最先进的性能,并在有限通信下展现出可扩展性和鲁棒性,随着带宽减少性能仅略有下降。
查看原文
查看缓存全文

缓存时间: 2026/05/26 14:44

论文页面 - 将通信与策略解耦:带宽约束下的鲁棒多智能体强化学习

来源: https://huggingface.co/papers/2605.21085

摘要

通信能够促进多智能体强化学习(MARL (https://huggingface.co/papers?q=MARL))中的协作,但许多实际应用,例如使用无人机群进行搜索与救援,往往在严格的带宽限制 (https://huggingface.co/papers?q=bandwidth%20constraints) 下运行。许多通信架构 (https://huggingface.co/papers?q=communication%20architectures) 仍然暴露出一个耦合瓶颈,即共享的潜在表示 (https://huggingface.co/papers?q=latent%20representation) 同时用于策略执行 (https://huggingface.co/papers?q=policy%20execution) 和智能体间通信 (https://huggingface.co/papers?q=inter-agent%20communication)。因此,减小消息大小会直接限制策略的潜在空间,常常导致性能显著下降。我们通过两个贡献来解决这一问题。首先,我们引入了β,一种归一化的每个智能体带宽预算,它将稀疏性 (https://huggingface.co/papers?q=sparsity)、轮次 (https://huggingface.co/papers?q=rounds) 和消息维度 (https://huggingface.co/papers?q=message%20dimension) 统一为一个可比较的约束条件。其次,我们提供了SLIM (https://huggingface.co/papers?q=SLIM),一种最小化架构,将通信路径与策略的潜在表示 (https://huggingface.co/papers?q=latent%20representation) 解耦,使我们能够在享受同步通信优势的同时,分离带宽效果与策略能力效果。我们在多个部分可观察的MARL (https://huggingface.co/papers?q=partially-observable%20MARL) 基准测试中评估了我们的方法,这些测试中通信至关重要。我们的方法实现了最先进的性能,并在有限通信下表现出可扩展性和鲁棒性,随着带宽降低,性能仅有轻微下降。

查看arXiv页面 (https://arxiv.org/abs/2605.21085)查看PDF (https://arxiv.org/pdf/2605.21085)GitHub1 (https://github.com/alexicanesse/Decoupling-Communication-from-Policy-Robust-MARL-under-Bandwidth-Constraints)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.21085)

引用该论文的模型0

暂无模型链接此论文

在模型 README.md 文件中引用 arxiv.org/abs/2605.21085 以从此页面链接。

引用该论文的数据集0

暂无数据集链接此论文

在数据集 README.md 文件中引用 arxiv.org/abs/2605.21085 以从此页面链接。

引用该论文的Space0

暂无Space链接此论文

在Space README.md 文件中引用 arxiv.org/abs/2605.21085 以从此页面链接。

包含该论文的收藏0

暂无收藏包含此论文

将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学

arXiv cs.LG

本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。