解耦通信与策略:带宽约束下的鲁棒多智能体强化学习
摘要
本文介绍了SLIM,一种极简架构,在多智能体强化学习中解耦通信与策略表示,在带宽约束下以最小性能下降实现最先进性能。
查看缓存全文
缓存时间: 2026/05/26 14:44
论文页面 - 将通信与策略解耦:带宽约束下的鲁棒多智能体强化学习
来源: https://huggingface.co/papers/2605.21085
摘要
通信能够促进多智能体强化学习(MARL (https://huggingface.co/papers?q=MARL))中的协作,但许多实际应用,例如使用无人机群进行搜索与救援,往往在严格的带宽限制 (https://huggingface.co/papers?q=bandwidth%20constraints) 下运行。许多通信架构 (https://huggingface.co/papers?q=communication%20architectures) 仍然暴露出一个耦合瓶颈,即共享的潜在表示 (https://huggingface.co/papers?q=latent%20representation) 同时用于策略执行 (https://huggingface.co/papers?q=policy%20execution) 和智能体间通信 (https://huggingface.co/papers?q=inter-agent%20communication)。因此,减小消息大小会直接限制策略的潜在空间,常常导致性能显著下降。我们通过两个贡献来解决这一问题。首先,我们引入了β,一种归一化的每个智能体带宽预算,它将稀疏性 (https://huggingface.co/papers?q=sparsity)、轮次 (https://huggingface.co/papers?q=rounds) 和消息维度 (https://huggingface.co/papers?q=message%20dimension) 统一为一个可比较的约束条件。其次,我们提供了SLIM (https://huggingface.co/papers?q=SLIM),一种最小化架构,将通信路径与策略的潜在表示 (https://huggingface.co/papers?q=latent%20representation) 解耦,使我们能够在享受同步通信优势的同时,分离带宽效果与策略能力效果。我们在多个部分可观察的MARL (https://huggingface.co/papers?q=partially-observable%20MARL) 基准测试中评估了我们的方法,这些测试中通信至关重要。我们的方法实现了最先进的性能,并在有限通信下表现出可扩展性和鲁棒性,随着带宽降低,性能仅有轻微下降。
查看arXiv页面 (https://arxiv.org/abs/2605.21085)查看PDF (https://arxiv.org/pdf/2605.21085)GitHub1 (https://github.com/alexicanesse/Decoupling-Communication-from-Policy-Robust-MARL-under-Bandwidth-Constraints)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.21085)
引用该论文的模型0
暂无模型链接此论文
在模型 README.md 文件中引用 arxiv.org/abs/2605.21085 以从此页面链接。
引用该论文的数据集0
暂无数据集链接此论文
在数据集 README.md 文件中引用 arxiv.org/abs/2605.21085 以从此页面链接。
引用该论文的Space0
暂无Space链接此论文
在Space README.md 文件中引用 arxiv.org/abs/2605.21085 以从此页面链接。
包含该论文的收藏0
暂无收藏包含此论文
将此论文添加到一个收藏 (https://huggingface.co/new-collection) 中以从此页面链接。
相似文章
多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡
本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。
可扩展的约束多智能体强化学习:通过状态增强与一致性实现可分离动力学
本文提出了一种分布式方法,用于约束多智能体强化学习,该方法采用状态增强策略学习和对偶变量上的邻居间一致性,以在满足全局资源约束的同时实现智能体数量线性扩展。在智能电网需求响应上的实验表明,一致性协调对可行性至关重要:与集中式训练方法不同,它能够扩展到数千个智能体。
SLIM-RL: 基于风险预算的随机掩码强化学习用于扩散语言模型,无需轨迹切分
SLIM-RL 提出了一种基于风险预算的随机掩码强化学习方法,用于扩散语言模型,避免了轨迹切分,在数学和代码基准测试中以显著更少的训练样本取得了最先进的结果。
当大型语言模型发展语言:用于高效多智能体推理的符号通信
本文提出通信语言符号路由(CLSR),多个LLM智能体自主发明并演化紧凑的符号语言进行推理,相比思维链(CoT)实现3-6倍的令牌减少,同时保持准确性。
基于合约的组合式防护用于安全多智能体强化学习
一种基于合约的组合式防护方法,无需集中式运行时控制即可确保多智能体强化学习中的全局安全性,利用局部LTL义务和多臂老虎机优化团队奖励。