我们《Clash Royale》强化学习环境的浏览器演示:一个5.6k参数的REINFORCE策略学习防御布置对抗暴力最优解[P]
摘要
本文介绍了一个基于浏览器的开源《Clash Royale》强化学习环境演示,其中一个小的REINFORCE策略学习防御布置,并与暴力最优策略进行比较。
昨天我在这里分享了我们的开源《Clash Royale》模拟器和它的循环PPO代理。训练循环在可视时更容易理解,因此我们在线放置了一个小型交互式版本:https://itzik123.github.io/ClashRoyaleAi/lab/ 任务是一个决策。攻击者在敌人一侧的随机点生成,策略为一张防守卡牌选择一个合法单元格,然后给定该单元格有0到5秒的延迟。奖励是相对于无防御,所阻止的塔楼伤害比例。该策略有5,629个参数,使用REINFORCE(每次生成基线、退火熵奖励)在纯JavaScript中训练,梯度为手写。每个回滚都在项目编译为WebAssembly的C++引擎中运行,部署管道检查WASM构建与本地引擎完全一致。图表还显示了最优解,通过暴力搜索每个单元格和延迟(每个对决最多约30万次回滚)找到,因此学习策略与最佳答案之间的差距可见。构建过程中的一个观察:巨人对阵加农炮有一个强大的局部最优解,一个通道布置价值约为最佳的75%。使用恒定的熵系数0.01,6次运行中有5次(3个种子,批次16和64)停留在那里。在10k次尝试中,从0.1线性退火到0.005将这一情况减少到6次中的1次。一个配对,战斗攻城锤对阵瓦基里女武神,被保留,因为我们尝试的设置都没有超过最优解的55%。这是完整问题的缩影(4张手牌、圣水、完整对局、循环PPO)。其目的是使循环可见,而非追求强大。代码:https://github.com/itzik123/ClashRoyaleAi
相似文章
ClashRoyaleAi:一个开源、确定性的 Clash Royale 模拟器,用于强化学习,采用循环 PPO、前瞻搜索和专家迭代 [P]
ClashRoyaleAi 是一个开源、确定性的 Clash Royale 模拟器,专为强化学习设计,具有前瞻搜索和专家迭代的 PPO 智能体,通过简单的前瞻技术展示了胜率的提升。
基于标准的强化学习中奖励黑客行为的复现、分析与检测
本文介绍了CHERRL,一个用于研究基于标准的强化学习中奖励黑客行为的可控环境。在该环境中,可以注入LLM作为评判者的偏见,以复现和分析黑客行为。作者还探索了一种基于智能体的系统,用于从训练日志中自动检测奖励黑客行为的开始。
SERPO:面向开放式测试时强化学习的自演化评分策略优化
SERPO 提出了一种自演化评分策略优化框架,用于开放式生成中的测试时强化学习,用闭环替代答案投票,该闭环协同进化响应证据、查询特定评分标准和策略参数,在健康和研究基准上取得了显著改进。
我将 Pokelike.xyz 转变为一个用于大语言模型和强化学习的基准测试环境!
一位数据科学家通过将 Pokelike.xyz 转变为一个游戏环境,创建了用于强化学习和大语言模型的基准测试。在这个环境中,AI 机器人可以被训练和测试。该项目是开源的,并邀请贡献以改进机器人的性能。
@dair_ai: // 自对弈加上一点人类数据 // 结合人类演示和自对弈强化学习的超酷论文。30分钟…
一篇研究论文,将少量人类演示作为正则化目标与自对弈强化学习相结合,从而使用极少的人类数据(30分钟对比数千小时)并在单个消费级GPU上训练15小时,实现与人类兼容的驾驶策略。