HyPOLE: 部分观测下基于超属性引导的多智能体强化学习

arXiv cs.AI 论文

摘要

HyPOLE提出了一种在部分可观测性下进行多智能体强化学习的框架,它通过HyperLTL时序逻辑进行超属性引导学习,并与集中训练分散执行(CTDE)集成,在SMAC、MessySMAC和WildFire基准测试上展示了优于基线的结果。

arXiv:2606.30966v1 公告类型:新 摘要:形式化规范是指导学习过程的强大工具,相比奖励塑造具有显著优势:(1)数学严谨性;(2)表达目标和约束的能力;(3)定义实现目标策略的能力。然而,这些优势在多智能体强化学习(MARL)中尚未得到充分探索。本文介绍了HyPOLE,一种在部分可观测性下进行MARL的新框架,其中学习由所谓的超属性(特别是时序逻辑HyperLTL)的表达能力引导。我们将集中训练分散执行(CTDE)技术与HyPOLE集成以合成分散策略,并在SMAC、MessySMAC和WildFire基准上的评估显示出了相对于基线的明显优势。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:36

# HyPOLE: 超属性引导的部分观测多智能体强化学习
来源:https://arxiv.org/abs/2606.30966
查看PDF (https://arxiv.org/pdf/2606.30966)

> **摘要:**形式化规范是指导学习过程的强大工具,与奖励塑形相比具有显著优势:(1) 数学严谨性;(2) 表达目标与约束的能力;(3) 定义达成目标策略的能力。然而,这些优势在多智能体强化学习(MARL)领域中尚未得到充分探索。本文提出了HyPOLE,一种新颖的部分观测MARL框架,其中学习由所谓的超属性(特别是时序逻辑HyperLTL)的表达能力所引导。我们将集中训练分散执行(CTDE)技术与HyPOLE相结合以综合分散策略,并在SMAC、MessySMAC和WildFire基准上的评估显示其相比于基线方法具有明显优势。

## 提交历史

来自:Arshia Rafieioskouei [查看邮箱 (https://arxiv.org/show-email/71a408e0/2606.30966)] **\[v1\]**Mon, 29 Jun 2026 23:03:05 UTC (14,134 KB)

相似文章

分层实验者智能体

Hugging Face Daily Papers

介绍了HExA,一个无需训练的框架,使LLM能够通过主动实验和技能复用来学习,在新的Interphyre物理基准测试中实现了高达77%的成功率,比现有智能体有大幅提升。