学习局部通信以解决大规模多智能体路径规划

Hugging Face Daily Papers 论文

摘要

本文介绍了LC-MAPF,一种带有可学习通信模块的预训练模型,用于多智能体路径规划,它改善了协调性,并在保持可扩展性的同时优于现有基于学习的求解器。

多智能体路径规划(MAPF)是多机器人轨迹规划问题中广泛使用的抽象,其中多个同质智能体在共享环境中同时移动。尽管最优求解MAPF是NP难的,但可扩展且高效的求解器对于物流和搜救等实际应用至关重要。为此,研究界提出了各种利用机器学习的分散式次优MAPF求解器。这类方法将MAPF(从单个智能体的视角)建模为Dec-POMDP,其中每个时间步智能体需要根据局部观测决定行动,并通常通过强化学习或模仿学习来求解。我们采用相同的方法,但额外引入了一个可学习的通信模块,通过高效的特征共享来增强智能体之间的合作。我们提出了局部通信多智能体路径规划(LC-MAPF),这是一种可泛化的预训练模型,通过在相邻智能体之间进行多轮通信来交换信息并改善协调。我们的实验表明,所引入的方法在多种(未见过的)测试场景中的各项指标上均优于现有的基于学习的MAPF求解器,包括基于IL和RL的方法。值得注意的是,所引入的通信机制并未影响LC-MAPF的可扩展性,而这是基于通信的MAPF求解器的常见瓶颈。
查看原文
查看缓存全文

缓存时间: 2026/05/15 12:25

论文页面 - 面向大规模多智能体路径规划的局部通信学习

来源:https://huggingface.co/papers/2605.07637

摘要

通过可学习的通信模块增强的多智能体路径规划求解器,可在保持可扩展性的同时提升协调性与性能。

多智能体路径规划(Multi-agent pathfinding,简称MAPF)是一种广泛用于多机器人轨迹规划问题的抽象模型,其中多个同质智能体在共享环境中同时移动。尽管最优MAPF求解是NP难的,但可扩展且高效的求解器对于物流、搜索救援等实际应用至关重要。为此,研究社区提出了多种利用机器学习的分散式次优MAPF求解器。此类方法将MAPF(从单一智能体视角)建模为一个Dec-POMDP问题,其中每个时间步,智能体需基于局部观测选择动作,并通常通过强化学习或模仿学习来求解。我们采用相同思路,但额外引入了一个可学习的通信模块,该模块通过高效的特征共享来增强智能体间的协作。我们提出了局部通信多智能体路径规划(Local Communication for Multi-agent Pathfinding,简称LC-MAPF),这是一个可泛化的预训练模型,通过相邻智能体间的多轮通信来交换信息并提升协调性。实验表明,所提方法在多种(未见过的)测试场景中,于不同指标上均优于现有基于学习的MAPF求解器(包括IL和RL方法)。值得注意的是,所引入的通信机制并未牺牲LC-MAPF的可扩展性——这是基于通信的MAPF求解器常见的瓶颈。

查看arXiv页面(https://arxiv.org/abs/2605.07637)
查看PDF(https://arxiv.org/pdf/2605.07637)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.07637)

在您的Agent中获取本篇论文:

hf papers read 2605.07637

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.07637 以从此页链接该模型。

引用此论文的数据集0

无数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.07637 以从此页链接该数据集。

引用此论文的Space0

无 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.07637 以从此页链接该 Space。

收录此论文的收藏集0

无收藏集收录此论文

将本篇论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页链接它。

相似文章

多智能体LLMs未能相互探索

Hugging Face Daily Papers

本文指出当前LLM智能体未能系统地探索同伴,导致协调不佳,并引入MACE,一个轻量级框架,使用上下文赌博机进行有效的同伴选择。

COAgents:用于学习和导航路径规划问题搜索空间的多智能体框架

arXiv cs.AI

COAgents是一个合作式多智能体框架,用于解决车辆路径问题,它将搜索过程建模为图,使用专门智能体进行节点选择、移动选择和跳跃以逃离局部最优。在CVRP和VRPTW基准测试上取得了最先进的结果,相比先前的基于学习的方法,将最佳已知解差距最多缩小了44%。

学习合作、竞争和沟通

OpenAI Blog

OpenAI 展示了多智能体强化学习环境的研究,其中智能体学习合作、竞争和沟通。该论文介绍了 MADDPG(Multi-Agent DDPG),这是一种集中式评论家方法,能够让智能体比传统的分散式方法更有效地学习协作策略和沟通协议。