标签
本文探讨为什么多智能体系统中的演化稳定合作结果可能无法通过去中心化强化学习算法达到,展示了稳定性和学习可达性之间的不同特性。
本文提出了一种去中心化的 actor-critic 多智能体强化学习方法 FRAC-MARL。该方法通过利用通信中的冗余性实现了完全拜占庭容错,即使在对抗性攻击下也能保证参数收敛至最优。
DualSQL 提出了一种用于文本到SQL的多智能体强化学习框架,利用单一共享模型联合优化模式链接和SQL生成,以更小的模型大小实现了最先进的准确性。
本文提出了一种LLM增强的多智能体强化学习框架,用于同时优化电动汽车充电调度、站点盈利性和电网稳定性,使用LLM进行特征选择和自适应加权,在减少训练时间的同时超越了最先进的方法。
JaxAHT是一个开源的基于JAX的库,旨在加速并标准化临时团队协作研究,提供一个统一的框架用于队友生成、训练和评估,具有显著的性能提升和一套评估队友。
一种结合图注意力机制和动态角色分配的分层多智能体强化学习框架,提高了空战中的战术协调和胜率。
本文探讨了网络拓扑和对手信息对多智能体强化学习系统中合作涌现的影响,特别是在重复囚徒困境(IPD)中,发现图结构和信息可用性对合作策略有显著影响。
本文提出SIGMA,一个用于协作多智能体强化学习的层次化协作框架,通过基于密度的分组和聚合方法,利用协作结构在噪声观测下学习鲁棒表示。
This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.
本文提出了VGG-MADiffRL——一种价值梯度引导的多智能体扩散强化学习算法,以及MDCA——一种分层控制架构,用于在受限声学通信和动态水下扰动下多AUV自组网中的协同目标跟踪。
提出了OGR-MARL,一种用于受限港口水道异构USV协同追击的选项引导残差多智能体强化学习框架。MASAC实例实现了75%的捕获率,并展现出向真实地图场景零样本迁移的良好前景。
本文介绍了PLATO,一种基于指针网络的智能体与基于图神经网络的评论家相结合的多智能体强化学习方法,能在无需重新训练的情况下处理智能体和任务的开放性,并在野火扑灭领域进行了评估。
本文提出了一种基于深度Q网络的多智能体强化学习框架,用于在降级监视条件下运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决,并在90种交通密度和间隔阈值组合中评估策略。
本文提出 EffRank/n 和 D_act 作为低开销诊断指标,用于衡量协同多智能体强化学习中奖励归因的效果,并在 SMACv2 上进行测试,发现观测解释了几何结构,而奖励归因主要影响行为。
本文比较了上下文组合赌博机和策略梯度算法在大型电动汽车车队分散式智能充电中的应用,使用了包含动态定价和可再生能源数据的真实模拟环境。
HyPOLE提出了一种在部分可观测性下进行多智能体强化学习的框架,它通过HyperLTL时序逻辑进行超属性引导学习,并与集中训练分散执行(CTDE)集成,在SMAC、MessySMAC和WildFire基准测试上展示了优于基线的结果。
介绍R2D-RL,一个强化学习环境,通过共享内存通信将RoboCup 2D足球模拟服务器与基于Python的多智能体强化学习工作流连接起来,支持全场和基于场景的训练,可配置对手和奖励塑造。
TRIDENT是一种新颖的多智能体强化学习框架,打破了混合离散-连续动作、硬安全约束和物理支配动力学之间的耦合,实现了可证明安全的协调,保证了收敛到约束纳什均衡,并显著减少了训练期间的违规行为。
一种基于合约的组合式防护方法,无需集中式运行时控制即可确保多智能体强化学习中的全局安全性,利用局部LTL义务和多臂老虎机优化团队奖励。
本文介绍了一个具有时间扩展反馈的双边匹配框架,将其建模为部分可观测的马尔可夫博弈,包含昂贵筛选、噪声观测和动态变化的潜在特征。作者提出了多智能体强化学习基准Learn2Match,并展示了独立PPO在社会福利方面优于bandit基线,但信息摩擦损失更高。