HyPOLE: 部分观测下基于超属性引导的多智能体强化学习
摘要
HyPOLE提出了一种在部分可观测性下进行多智能体强化学习的框架,它通过HyperLTL时序逻辑进行超属性引导学习,并与集中训练分散执行(CTDE)集成,在SMAC、MessySMAC和WildFire基准测试上展示了优于基线的结果。
arXiv:2606.30966v1 公告类型:新
摘要:形式化规范是指导学习过程的强大工具,相比奖励塑造具有显著优势:(1)数学严谨性;(2)表达目标和约束的能力;(3)定义实现目标策略的能力。然而,这些优势在多智能体强化学习(MARL)中尚未得到充分探索。本文介绍了HyPOLE,一种在部分可观测性下进行MARL的新框架,其中学习由所谓的超属性(特别是时序逻辑HyperLTL)的表达能力引导。我们将集中训练分散执行(CTDE)技术与HyPOLE集成以合成分散策略,并在SMAC、MessySMAC和WildFire基准上的评估显示出了相对于基线的明显优势。
查看缓存全文
缓存时间: 2026/07/01 05:36
# HyPOLE: 超属性引导的部分观测多智能体强化学习 来源:https://arxiv.org/abs/2606.30966 查看PDF (https://arxiv.org/pdf/2606.30966) > **摘要:**形式化规范是指导学习过程的强大工具,与奖励塑形相比具有显著优势:(1) 数学严谨性;(2) 表达目标与约束的能力;(3) 定义达成目标策略的能力。然而,这些优势在多智能体强化学习(MARL)领域中尚未得到充分探索。本文提出了HyPOLE,一种新颖的部分观测MARL框架,其中学习由所谓的超属性(特别是时序逻辑HyperLTL)的表达能力所引导。我们将集中训练分散执行(CTDE)技术与HyPOLE相结合以综合分散策略,并在SMAC、MessySMAC和WildFire基准上的评估显示其相比于基线方法具有明显优势。 ## 提交历史 来自:Arshia Rafieioskouei [查看邮箱 (https://arxiv.org/show-email/71a408e0/2606.30966)] **\[v1\]**Mon, 29 Jun 2026 23:03:05 UTC (14,134 KB)
相似文章
PPO-HSC:一种基于广域策略覆盖优化的探索性强化学习框架
PPO-HSC引入了一种高阶采样覆盖奖励,以鼓励在LLM的强化学习微调中探索多样化的推理模式,从而在数学和代码任务上提升解决方案的多样性和状态空间覆盖。
分层实验者智能体
介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。
LambdaPO: 面向推理语言模型的Lambda风格策略优化
引入LambdaPO,一种新颖的强化学习框架,它通过将优势估计分解为成对偏好比较并添加语义密度奖励来改进GRPO,从而在数学推理任务上取得了更好的性能。
训练可观察的控制策略以通过动作暴露智能体状态
本文研究使用强化学习训练可观察的控制策略,从而能够通过智能体的动作估计其状态,并在通信受限条件下应用于多智能体协调与监控。
AgentHPOBench:评估LLM智能体作为顺序超参数优化器的基准
介绍了AgentHPOBench,这是一个顺序基准,用于在30个机器学习任务中评估LLM智能体作为超参数优化器的表现,结果显示当前智能体具有可测量的但有限的迭代优化能力。