学习局部通信以解决大规模多智能体路径规划
摘要
本文介绍了LC-MAPF,一种带有可学习通信模块的预训练模型,用于多智能体路径规划,它改善了协调性,并在保持可扩展性的同时优于现有基于学习的求解器。
查看缓存全文
缓存时间: 2026/05/15 12:25
论文页面 - 面向大规模多智能体路径规划的局部通信学习
来源:https://huggingface.co/papers/2605.07637
摘要
通过可学习的通信模块增强的多智能体路径规划求解器,可在保持可扩展性的同时提升协调性与性能。
多智能体路径规划(Multi-agent pathfinding,简称MAPF)是一种广泛用于多机器人轨迹规划问题的抽象模型,其中多个同质智能体在共享环境中同时移动。尽管最优MAPF求解是NP难的,但可扩展且高效的求解器对于物流、搜索救援等实际应用至关重要。为此,研究社区提出了多种利用机器学习的分散式次优MAPF求解器。此类方法将MAPF(从单一智能体视角)建模为一个Dec-POMDP问题,其中每个时间步,智能体需基于局部观测选择动作,并通常通过强化学习或模仿学习来求解。我们采用相同思路,但额外引入了一个可学习的通信模块,该模块通过高效的特征共享来增强智能体间的协作。我们提出了局部通信多智能体路径规划(Local Communication for Multi-agent Pathfinding,简称LC-MAPF),这是一个可泛化的预训练模型,通过相邻智能体间的多轮通信来交换信息并提升协调性。实验表明,所提方法在多种(未见过的)测试场景中,于不同指标上均优于现有基于学习的MAPF求解器(包括IL和RL方法)。值得注意的是,所引入的通信机制并未牺牲LC-MAPF的可扩展性——这是基于通信的MAPF求解器常见的瓶颈。
查看arXiv页面(https://arxiv.org/abs/2605.07637)
查看PDF(https://arxiv.org/pdf/2605.07637)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.07637)
在您的Agent中获取本篇论文:
hf papers read 2605.07637
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.07637 以从此页链接该模型。
引用此论文的数据集0
无数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.07637 以从此页链接该数据集。
引用此论文的Space0
无 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.07637 以从此页链接该 Space。
收录此论文的收藏集0
无收藏集收录此论文
将本篇论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页链接它。
相似文章
SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
多智能体LLMs未能相互探索
本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。
COAgents:用于学习和导航路径规划问题搜索空间的多智能体框架
COAgents是一个合作式多智能体框架,用于解决车辆路径问题,它将搜索过程建模为图,使用专门智能体进行节点选择、移动选择和跳跃以逃离局部最优。在CVRP和VRPTW基准测试上取得了最先进的结果,相比先前的基于学习的方法,将最佳已知解差距最多缩小了44%。
学习保留内容:面向多智能体LLM系统高效协作的Gated-Memory Routing
本文提出了Gated-Memory Routing,一个用于多智能体LLM系统的框架,该框架使用学习到的门控机制来管理记忆,提高了在推理和代码生成基准测试中的准确性并降低了推理成本。
学习合作、竞争和沟通
OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。