标签
本文研究了在不完美信息纸牌游戏中训练轻量级强化学习智能体的设计选择,使用固定的基于规则的专家作为基准,针对金拉米和勒德克德州扑克。研究发现,信任区域更新、精心设计的奖励、课程学习、热启动和检查点保留能提升性能,而奖励塑形和大语言模型对手等几种常见技术并无帮助。
本文研究了在双人零和不完美信息博弈中学习有用的策略表示(嵌入)的方法,介绍了创建策略数据集、学习嵌入以及使用Kuhn和Leduc扑克在下游任务中评估这些方法的技术。
本文介绍了MAPLE,一种树搜索方法,它聚合来自多个采样子世界状态的策略和价值评估,将AlphaZero扩展至不完全信息游戏。在Phantom Go和Dark Hex上的实验显示,与基于PIMC的AlphaZero基线相比,Elo分别提升了291和136。
本文提出了一种使用线性代数运算的CFR算法并行化框架,在GPU上实现了比CPU实现高达四个数量级的加速。