标签
本文评估了基于AlphaZero启发的强化学习在电力网络拓扑控制中的应用,实现了98.43%的生存率,并强调了与领域启发式最小化集成的有效性。
本文以四子棋和Chomp为测试平台,研究了AlphaZero在稀疏奖励游戏中强对弈与完美对弈之间的差距,并提出了一种辅助损失(AZAL)以提高最优对弈中的Oracle一致性。
本文介绍了WallZero,一个基于AlphaZero的双人棋盘游戏WallGo的智能体,它能够击败职业围棋选手,并用于分析游戏平衡性和策略。
本文分析了 AlphaZero 的价值预测如何受到自我对弈训练数据和噪声的影响,并质疑尽管 AlphaZero 在实证中表现强劲,其预测值是否能可靠地评估对阵不同风格对手时的胜率。