我们《Clash Royale》强化学习环境的浏览器演示:一个5.6k参数的REINFORCE策略学习防御布置对抗暴力最优解[P]

Reddit r/MachineLearning 工具

摘要

本文介绍了一个基于浏览器的开源《Clash Royale》强化学习环境演示,其中一个小的REINFORCE策略学习防御布置,并与暴力最优策略进行比较。

昨天我在这里分享了我们的开源《Clash Royale》模拟器和它的循环PPO代理。训练循环在可视时更容易理解,因此我们在线放置了一个小型交互式版本:https://itzik123.github.io/ClashRoyaleAi/lab/ 任务是一个决策。攻击者在敌人一侧的随机点生成,策略为一张防守卡牌选择一个合法单元格,然后给定该单元格有0到5秒的延迟。奖励是相对于无防御,所阻止的塔楼伤害比例。该策略有5,629个参数,使用REINFORCE(每次生成基线、退火熵奖励)在纯JavaScript中训练,梯度为手写。每个回滚都在项目编译为WebAssembly的C++引擎中运行,部署管道检查WASM构建与本地引擎完全一致。图表还显示了最优解,通过暴力搜索每个单元格和延迟(每个对决最多约30万次回滚)找到,因此学习策略与最佳答案之间的差距可见。构建过程中的一个观察:巨人对阵加农炮有一个强大的局部最优解,一个通道布置价值约为最佳的75%。使用恒定的熵系数0.01,6次运行中有5次(3个种子,批次16和64)停留在那里。在10k次尝试中,从0.1线性退火到0.005将这一情况减少到6次中的1次。一个配对,战斗攻城锤对阵瓦基里女武神,被保留,因为我们尝试的设置都没有超过最优解的55%。这是完整问题的缩影(4张手牌、圣水、完整对局、循环PPO)。其目的是使循环可见,而非追求强大。代码:https://github.com/itzik123/ClashRoyaleAi
查看原文

相似文章

基于标准的强化学习中奖励黑客行为的复现、分析与检测

Hugging Face Daily Papers

本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。