PLATO:面向智能体和任务开放性的指针学习器
摘要
本文介绍了PLATO,一种基于指针网络的智能体与基于图神经网络的评论家相结合的多智能体强化学习方法,能在无需重新训练的情况下处理智能体和任务的开放性,并在野火扑灭领域进行了评估。
arXiv:2607.25082v1 公告类型:新
摘要:开放智能体系统(OASYS)在现实领域中越来越普遍,其中智能体和任务的集合随时间不可预测地变化。这种开放性,包括智能体开放性(AO)和任务开放性(TO),对通常假设固定状态和动作空间的多智能体强化学习(MARL)提出了根本性挑战。现有方法仅部分解决开放性问题:填充和掩码方法引入人为界限,而最近的基于图或超图的方法处理单一维度的开放性,但仍然依赖于限制性假设。在本文中,我们介绍了面向智能体和任务开放性的指针学习器(PLATO),这是一种结合了集中式图神经网络(GNN)评论家的基于指针网络的智能体,采用集中训练与分散执行的范式,通过多智能体近端策略优化进行训练。我们的基于指针的智能体直接在当前任务集上输出分布,从而支持无需掩码或重新训练的动作空间变化。我们的GNN评论家将智能体-任务交互编码为一个随任务和智能体组成而改变形状的图。这些组件共同考虑了AO和TO,避免了现有方法的有界性问题。我们在任务与智能体开放马尔可夫博弈(TaAgO-MG)中形式化PLATO,扩展了先前的任务开放公式,并证明它在由此产生的无界状态和动作空间上是良定义的。我们使用开放智能体系统评估方法倡议(MOASEI)的野火扑灭领域(一个专为开放多智能体系统评估而设计的环境)评估PLATO,并展示了相比OASYS中的最先进基线,更强的性能以及更一致的零样本泛化能力。
查看缓存全文
缓存时间: 2026/07/29 09:53
# PLATO:面向智能体与任务开放性的指针学习器 来源:https://arxiv.org/html/2607.25082 Alireza Saleh Abadi 计算学院 内布拉斯加大学林肯分校 [email protected] &Leen-Kiat Soh 计算学院 内布拉斯加大学林肯分校 [email protected] &Daniel Alan Redder 计算学院 佐治亚大学 [email protected] Adam Eck 欧柏林学院 [email protected] &Prashant Doshi 计算学院 佐治亚大学 [email protected] ###### 摘要 开放智能体系统(OASYS)在现实领域日益普遍,其中智能体和任务的集合会随时间不可预测地变化。这种开放性,包括智能体开放性(AO)和任务开放性(TO),对通常假设固定状态和动作空间的多智能体强化学习(MARL)构成了根本性挑战。现有方法仅能部分处理开放性:填充和掩码方法引入了人为边界,而最近的图方法或超图方法处理了开放性的一个维度,但仍依赖限制性假设。在本文中,我们提出了面向智能体与任务开放性的指针学习器(PLATO),这是一种基于指针网络的演员网络,结合了集中式图神经网络(GNN)评论家网络,采用集中式训练与分散式执行范式,并通过多智能体近端策略优化进行训练。我们的基于指针的演员网络直接在当前任务集上输出分布。这直接支持变化的动作空间,无需掩码或重新训练。我们的GNN评论家网络将智能体-任务交互编码为一个图,该图的形状随任务和智能体组成而变化。这些组件共同考虑了AO和TO,而无需现有方法的有界性。我们在任务与智能体开放马尔可夫博弈(TaAgO-MG)中形式化PLATO,扩展了先前的任务开放形式,并证明其在由此产生的无界状态和动作空间上定义良好。我们使用开放智能体系统评估方法倡议(MOASEI)的野火扑灭领域(一个专为开放多智能体系统评估设计的环境)评估PLATO,并展示了其在OASYS中相比最先进基线的强大性能和更一致的零样本泛化能力。 ## 1 引言 在许多现实世界的多智能体系统(MAS)中,世界在智能体运行期间并非固定不变。新任务不可预测地出现,智能体可能在运行中途离开或加入,甚至它们的目标和能力也可能发生变化。考虑一个野火响应场景:火灾可能被点燃、扑灭或自行熄灭,不可预测地在景观中蔓延,而消防员可能因为灭火剂耗尽而加入或离开。这种动态性质,广义上称为开放性 (Eck et al., 2023),违背了多智能体强化学习(MARL)的常见假设,即智能体和任务的集合在训练和执行期间固定不变。具有这些特征的系统被称为*开放*智能体系统(OASYS)。两种常见的开放性形式 (Eck et al., 2023) 是智能体开放性(AO)(智能体进入或离开)和任务开放性(TO)(任务出现或消失)。我们的工作同时处理AO和TO。处理开放性对于MARL在实际环境中的鲁棒、可扩展部署至关重要,因为系统在其组成发生变化时必须继续执行任务。挑战在于开放性会导致执行期间的底层决策问题发生变化:智能体或任务可能出现或消失,而片刻前最优的策略可能不再适用。因此,环境在智能体和任务的数量及组成上是*无界*的,这些是智能体必须协调的要素。实用的MARL方法必须适应这些无界变化而无需重新训练。 少数值得注意的MARL方法试图解决MAS中开放性的某些方面,但没有一种能够同时处理AO和TO而不受限制。例如,MOHITO (Anil et al., 2025) 明确针对TaO-MG下的*任务开放性*;尽管其交互超图表达力足以表示AO,但MOHITO并未显式建模或评估处理随机AO。深度隐式协调图(DICG)(Li et al., 2021) 虽然并非专门为开放性设计,但引入了灵活的协调结构,对AO和TO提供有限支持,但仍属于有界和填充输入操作。图卷积强化学习(DGN)(Jiang et al., 2018) 通过在智能体图上的图卷积进行协调,原则上可以适应变化的智能体邻域,但它并非为建模任务开放性而设计,且假设固定动作集和以智能体为中心的图结构。综合来看,这些方法代表了重要进展,但没有任何一种能同时应对AO和TO而不引入限制性假设或对智能体-任务空间施加固定界限。 我们通过面向智能体与任务开放性的指针学习器(即PLATO)解决这些挑战,这是一种采用集中式训练与分散式执行(CTDE)(Lowe et al., 2017) 的演员-评论家MARL算法。PLATO使用基于指针网络 (Vinyals et al., 2015) 的演员网络和集中式图神经网络(GNN)(Scarselli et al., 2008) 评论家网络,并通过多智能体近端策略优化(MAPPO)(Yu et al., 2022) 进行训练。PLATO通过学习一种基于内容的指向策略(受指针网络启发)来处理TO和AO,其中智能体通过仅针对当前可用任务的查询-键注意力机制指向任务,因此动作分布会随着智能体或任务的进入或离开而自适应,无需重新训练或有界化。 本工作的主要贡献是:(1) PLATO,首个通过基于内容的指向机制同时处理AO和TO的MARL架构,无需固定界限或重新训练;(2) 一个TaAgO-MG形式化,扩展了先前的任务开放形式,并形式化保证PLATO在由此产生的无界状态和动作空间上定义良好且具有置换不变性(附录A.2和A.1);(3) 在野火领域中对PLATO的性能和动作效率进行实证评估,涵盖多种AO/TO设置和网格大小,并与智能基线和启发式基线进行比较;(4) 通过在未见过的网格大小上部署训练好的策略而无需重新训练,进行零样本泛化能力评估。 ## 2 背景 ### 2.1 开放智能体系统(OASYS) 多智能体系统中的开放性是指环境中智能体或任务可以随时间变化。最近的一项综述 (Eck et al., 2023) 及早期讨论 (Shehory, 2001; Calmet et al., 2004; Jumadinova et al., 2013) 识别出三种主要形式:(1) *智能体开放性(AO)*:当智能体加入或离开系统时出现,改变团队组成和可用能力;(2) *任务开放性(TO)*:当任务在运行期间出现或消失时产生,要求智能体适应新的或消失的机会;(3) *框架开放性(FO)*:指智能体内部配置的变化——例如目标、偏好或能力,重新定义智能体如何感知环境并与之交互。 在这三类中,AO在先前工作中受到最多关注。它最初在二十多年前被定义为超出初始集合的智能体添加 (Shehory, 2001),后来被细化为变换系统以添加或移除一个智能体的复杂性 (Jamroga et al., 2013)。后续研究表明,显式推理智能体存在性可改善系统行为 (Chandrasekaran et al., 2016; Cohen et al., 2017; Eck et al., 2023; Kakarlapudi et al., 2022)。相比之下,TO的研究少于AO,且联合AO+TO设置很少在单一学习框架中被处理。一些模型同时处理任务到达/离开与智能体动态 (Jumadinova et al., 2013; Chen et al., 2016),在MARL中,MOHITO明确处理TO (Anil et al., 2025)。许多领域表现出外生TO,同时智能体集合也可以在线变化,这要求策略在两种开放性形式下仍保持良好定义。虽然FO捕捉更深层次的行为和认知变异性,但AO和TO使环境结构从根本上动态化。因此,我们的工作聚焦于AO和TO,它们直接决定系统的组成和协调模式,并将FO留待未来工作。 ### 2.2 任务开放马尔可夫博弈 任务开放马尔可夫博弈对随机多智能体决策问题进行建模,扩展了马尔可夫博弈 (Littman, 1994) 以处理任务开放性 (Anil et al., 2025)。一个TaO-MG定义为: TaO-MG ≜ ⟨M, X, Ψ⟩ 其中: ∙ M 是基础模型,为一个马尔可夫博弈,其中 N 是智能体集合,S 是状态空间,A_i 是智能体 i 的动作空间,T : S × ∏_{i∈N} A_i → Δ(S) 是转移函数,R_i : S × ∏_{i∈N} A_i → R 是智能体 i 的奖励函数,γ ∈ [0,1) 是折扣因子,s_0 是初始状态。 ∙ X 是当前任务的多重集合; ∙ Ψ 是一个生成器函数,其组件 (Ψ_S, Ψ_A, Ψ_T, Ψ_R) 针对一个马尔可夫博弈,将 M^t 适应为 M^{t+1},以应对在时间 t+1 的新任务集合 X^{t+1}。 在TaO-MG中进行强化学习意味着每个智能体 i ∈ N 学习一个策略 π_i,最大化该智能体的期望折现奖励和: E_{τ∼π} [∑_{t=0}^∞ γ^t R_i^t (s^t, a^t | s=s_0)], 其中轨迹在当前模型背景下,τ = ⟨s^t, a^t, X^t⟩,且 R_i^t = Ψ_R (R_i^{t-1}, X^t)。 该形式化使任务驱动的变化显式化,但它未说明策略应如何在可变任务集上行动(也未捕捉智能体开放性),这促使我们在第3节中提出TaAgO-MG扩展和基于集合的条件动作选择。 ### 2.3 指针网络 指针网络 (Vinyals et al., 2015) 通过从*当前*输入集合中选择输出来生成输出,而不是从固定词汇表中选择,这使其天然适用于大小可变的动作空间。这与OASYS直接相关:随着任务出现和消失(TO),可选动作集发生变化;随着智能体进入和离开(AO),调节这些选择的团队上下文发生变化。PLATO在每个时间步使用单步指针——每个智能体形成一个总结其团队上下文的查询,并通过加法注意力 (Bahdanau et al., 2014) 对每个可用任务打分——从而产生一个支撑集与当前任务集匹配的分布。正式机制在第4.1节中详述。 ## 3 多智能体系统中的开放智能体-任务 在本节中,我们定义任务-智能体开放马尔可夫博弈(TaAgO-MG),这是对TaO-MG(见第2.2节)的扩展,以同时考虑AO和TO。由于任务集和智能体集都可能随时间变化,每个任务动作的可行性和效用取决于当前任务和团队组成。因此,实用的策略应该评估当前可用任务和当前团队上下文,而不是假设具有固定含义的动作标签。 下面,我们通过流行的野火扑灭领域 (Chandrasekaran et al., 2016; Kakarlapudi et al., 2022; Anil et al., 2025; Eck et al., 2020; Patino et al., 2025) 实例化马尔可夫博弈,该领域同时表现出TO和AO。简要来说,环境是一个网格,消防员智能体驻扎在固定位置,每个火灾是一个具有位置和大小的任务 (Patino et al., 2025)。火灾可能被点燃(例如由闪电或蔓延引起)、自行熄灭或由消防员扑灭,从而改变活跃任务集并产生*任务开放性*。在每个时间步,智能体选择扑灭一个火灾或保持空闲(无操作);当灭火剂耗尽时,它也可以退出环境,从而产生*智能体开放性*。奖励也会变化:更大的火灾更具挑战性且奖励更高,新火灾创造扑灭机会,而自行熄灭和蔓延会改变潜在收益和损失。 考虑: TaAgO-MG ≜ ⟨M, X, N, Ψ⟩, 其中 N 和 X 分别是不断变化的智能体集合和任务集合,而非固定集合。我们将来自MOHITO (Anil et al., 2025) 的生成器 Ψ 扩展为也覆盖 N。具体地,我们将 Ψ 视为一个生成器,它接受基础游戏 M 和当前开放集合 (X^t, N^t),并返回时间索引的游戏,即 M^t := Ψ(M, X^t, N^t)。这使我们能够考虑新智能体对游戏带来的任意确定性变化。形式上,生成器定义为 M^t = ⟨Ψ_S(M, X^t, N^t), Ψ_A(M, X^t, N^t), Ψ_T(M, X^t, N^t), Ψ_R(M, X^t, N^t)⟩。 Ψ_S 更新状态,Ψ_A 更新动作集,Ψ_T 生成转移函数,Ψ_R 生成奖励函数。这种分解允许环境在任务集或智能体集发生变化时更新所有组件。 现在,令 A_i^t 表示智能体 n_i 在时间 t 的动作空间,并令 suppress(x) 表示扑灭火灾 x ∈ X^t 的动作。(注意,在我们的野火实例化中,每个任务只有一个动作,因此选择任务唯一地确定了非无操作动作。) 任务到达。如果在时间 t 出现新火灾,则 X^{t+1} = X^t ∪ {x_new}。生成器引发动作更新:A_i^{t+1} = A_i^t ∪ {suppress(x_new)},∀ n_i ∈ N^t,对应于 Ψ_A(M, X^{t+1}, N^t)。 智能体离开。如果智能体 n_i 耗尽灭火剂并退出,则 N^{t+1} = N^t ∖ {n_i}
相似文章
@TheTuringPost: 开源代理强化训练器(ART)——将GRPO嵌入任何Python应用 → 您的应用定义任务和奖励…
代理强化训练器(ART)是一个开源框架,将基于GRPO的强化学习嵌入任何Python应用,使代理能够通过环境交互学习,利用轨迹评分和LoRA更新,据称使用Qwen 2.5 14B模型在邮件检索任务上超越OpenAI的o3。
OPERA: 通过基于目标困惑度的强化学习对齐开放式推理
OPERA提出了一种针对开放式任务的强化学习方法,利用困惑度动态作为内在奖励,取代了不可靠的“LLM作为评判者”奖励模型。在Qwen3-8B上实现了最先进的结果,在创意写作及其他开放式任务中可媲美专有模型。
GROW: 将GRPO与状态-动作建模对齐用于开放世界VLM智能体
GROW提出了一种新颖的强化学习框架,通过将轨迹分解为状态-动作对并计算它们之间的优势,将GRPO适配到多轮VLM智能体任务中,在超过800个Minecraft任务上实现了最先进的性能。
具有对手学习感知的学习
OpenAI 提出了 LOLA (Learning with Opponent-Learning Awareness),一种多智能体强化学习方法,其中智能体能够塑造其他智能体的预期学习过程。该方法展示了在重复囚徒困境中合作的涌现现象,以及在博弈论设置中收敛到纳什均衡。
HyPOLE: 部分观测下基于超属性引导的多智能体强化学习
HyPOLE提出了一种在部分可观测性下进行多智能体强化学习的框架,它通过HyperLTL时序逻辑进行超属性引导学习,并与集中训练分散执行(CTDE)集成,在SMAC、MessySMAC和WildFire基准测试上展示了优于基线的结果。