深度强化学习掌握Baghchal的不对称策略
摘要
本文系统地探索了四种深度强化学习解决方案(DQN、REINFORCE、PPO和MuZero)用于尼泊尔不对称棋盘游戏Baghchal,发现MuZero由于通过蒙特卡洛树搜索进行基于模型的规划,获得了最佳胜率。
arXiv:2607.18296v1 公告类型:新
摘要:Baghchal是一种起源于尼泊尔的双人不对称棋盘游戏,四只老虎需要捕捉山羊,而二十只山羊则试图让老虎无法移动。尽管Baghchal具有复杂的结构、战略性强、完美信息结构以及文化意义,但在深度强化学习(RL)文献中尚未得到充分覆盖。本文系统性地探索了四种深度RL解决方案:深度Q网络(DQN)、REINFORCE、近端策略优化(PPO)和MuZero,它们在Baghchal的不对称玩法的一侧进行训练,然后在另一侧进行评估。算法基于胜率、平局率、平均捕获次数、训练收敛性和计算成本进行评级。实验发现,MuZero在两个任务中均表现出最佳性能,对老虎角色达到86%的胜率,对山羊角色达到62%的胜率,而这得益于通过蒙特卡洛树搜索进行的基于模型的规划。PPO是最实用的算法,在两个不对称任务中均具有竞争力,且与MuZero相比计算成本显著降低。涌现的策略行为分析表明,基于模型的策略在长时域规划中是最优的,而基于价值的对应方法(如DQN)由于更强烈的奖励信号,更偏向于老虎角色。
查看缓存全文
缓存时间: 2026/07/22 08:21
# 深度强化学习征服巴格查尔棋的非对称策略 来源:https://arxiv.org/abs/2607.18296 查看PDF (https://arxiv.org/pdf/2607.18296) > 摘要:巴格查尔棋是一种源自尼泊尔的双人非对称棋盘游戏,其中四只老虎需要捕捉山羊,而二十只山羊则试图让老虎无法动弹。尽管巴格查尔棋具有复杂的战略结构、完美信息结构以及文化意义,但在深度强化学习(RL)文献中尚未得到充分研究。本文系统性地探索了四种深度强化学习解决方案——深度Q网络(DQN)、REINFORCE、近端策略优化(PPO)和MuZero——这些方案在巴格查尔棋非对称对局的一侧进行训练,然后在另一侧进行评估。算法基于胜率、平局率、平均捕捉数、训练收敛性和计算成本进行评价。实验发现,MuZero在两个任务中均表现最佳,对阵老虎时胜率达到86%,对阵山羊时胜率达到62%,这得益于其基于模型的规划机制——蒙特卡洛树搜索。PPO是最具实用性的算法,在两个非对称任务中均具有竞争力,且计算成本相比MuZero显著降低。涌现的战略行为分析表明,基于模型的策略在长期规划中表现最优,而基于价值的对应方法(如DQN)由于奖励信号更强,更偏向老虎角色。 ## 提交历史 来自:Ranjit Raut [查看邮箱 (https://arxiv.org/show-email/55be6aee/2607.18296)] **\[v1\]**2026年7月2日星期四 14:22:42 UTC (351 KB)
相似文章
从单个演示中学习蒙特祖玛的复仇
OpenAI 展示了一种通过单个人类演示来训练强化学习智能体玩蒙特祖玛的复仇的方法,通过课程学习和仔细的超参数调优来解决稀疏奖励的挑战。该方法在这款臭名昭著的 Atari 游戏上取得了强劲表现,但在其他游戏上的泛化能力有限。
从模仿到交互:使用浅层强化学习掌握Schnapsen游戏
本文研究浅层神经网络代理是否能够通过强化学习掌握纸牌游戏Schnapsen,超越监督模仿基线,并在一项与基于强搜索的对手的对比中取得有竞争力的结果。
通过自我对弈发现格基约简策略
本文提出Delta-Star,一种采用AlphaZero风格自我对弈的深度强化学习方法,通过与LLL算法的原始操作交互,发现更优的格基约简策略。学习到的策略无需重新训练即可泛化到更高维度和未见过的模数。
Big 2中不完美信息下的自我对弈强化学习
本文提出了一个针对四人制不完美信息纸牌游戏Big 2的自我对弈强化学习框架,比较了策略梯度和基于价值的方法,并发现带有熵正则化的PPO优于其他方法。
DRG-MAPPO:用于协同空战的分层动态角色图多智能体强化学习
一种结合图注意力机制和动态角色分配的分层多智能体强化学习框架,提高了空战中的战术协调和胜率。