标签
OpenAI Five 成为首个利用大规模深度强化学习和自我对弈击败 Dota 2 世界冠军的 AI 系统,在这款具有长期时间跨度和不完全信息的复杂游戏中展现了超人类的表现。
OpenAI Five成为首个击败世界冠军电竞职业选手的AI,在OpenAI Five总决赛中连胜OG两局。这一突破是通过前所未有的训练计算规模扩展实现的,而非新型算法,团队计划停用OpenAI Five同时宣布将其部署用于公开网络对战。
OpenAI Five 在2018年国际邀请赛中与顶级职业 Dota 2 战队竞争,尽管在与顶尖人类选手的两场比赛中都不幸落败,但展现了通过自我学习所掌握的具有竞争力的游戏表现和战略深度。
OpenAI 发布了其 Dota 2 游戏系统 OpenAI Five 的基准测试结果,详细介绍了六个主要版本的训练方法,计算需求从 8 到 35 petaflop/s-days 不等,并推出了新的网络架构工具。
OpenAI Five 完成了与人类的 Dota 2 基准测试对比赛,展示了改进的能力,包括扩展的英雄池(18 个英雄)、Roshan 坑机制和眼位系统。该系统展现了在学习复杂游戏技能方面的通用训练灵活性。
OpenAI Five 是一个强化学习智能体,通过自我对抗训练、课程学习和策略随机化来掌握 Dota 2,从随机行为逐步演进到执行复杂的人类级策略。
OpenAI 描述了他们在国际邀请赛期间对 Dota 2 机器人所做的迭代改进,将教练指导与自我对弈相结合,通过快速训练周期和在职业比赛中发现的战略优化来增强智能体性能。
OpenAI 创建了一个机器人,仅通过自我对弈学习就能在1v1匹配中击败世界顶级Dota 2职业选手,无需使用模仿学习或树搜索。这一成就展示了人工智能系统在动态、多智能体环境中实现复杂目标的进步。