ShuttleArena:基于物理的羽毛球中可解释的自对弈
摘要
本文介绍了ShuttleArena,一个基于物理的羽毛球自对弈环境,其中代理使用PPO学习可解释的战术策略,在击球选择和恢复方面显示出竞争性改进。
arXiv:2608.25246v1 公告类型:新
摘要:羽毛球是游戏AI领域中一个紧凑但具有挑战性的领域:玩家必须选择物理上可行的羽毛球轨迹,预判对手的拦截,并恢复到球场位置,其价值取决于对手的下一个反应。核心挑战在于击球选择和恢复不可分割:最佳恢复取决于击球引发的对手反应,而击球的价值取决于击球者能否覆盖回复。本文提出了ShuttleArena,一个基于物理的单打羽毛球自对弈环境,它结合了连续的羽毛球飞行、玩家拦截、结构化的击球生成和击球后恢复。策略使用角色条件输出:在接球者回合时使用掩码拦截选择,以及在击球者动作中分解为击球方位角、击球仰角、击球速度和恢复目标,使得可解释的战术探测成为可能。单集为单次回击而非完整计分比赛,训练使用近端策略优化 (PPO) 自对弈,对抗分阶段检查点对手池,具有稀疏的终端回击结果奖励和特定因子的恢复更新。通过冻结检查点播放、受控战术探测、恢复消融、定性展开和人类数据合理性检查进行评估,显示出竞争性改进以及可解释的对手条件下的击球几何和恢复行为变化。学习到的策略产生了可识别的羽毛球式结构,同时反映了模拟器的抽象,恢复干预表明学习到的恢复行为具有竞争重要性。这些结果表明,基于物理的球拍运动是交互式数字娱乐AI的有用测试平台,因为它们需要代理协调执行、定位和对手相对战术价值。
查看缓存全文
缓存时间: 2026/08/27 09:37
# ShuttleArena:基于物理的羽毛球运动中可解释的自我对弈 来源:https://arxiv.org/html/2608.25246 ###### 摘要 羽毛球是游戏AI领域一个紧凑但极具挑战性的领域:玩家必须选择物理上可行的羽毛球轨迹,预判对手的拦截,并恢复到一个取决于对手下一步回应的球场位置。核心挑战在于击球选择与恢复无法分离:最佳恢复取决于击球引发的对手回应,而击球的价值则取决于击球者能否覆盖对手的回球。本文提出ShuttleArena,一个基于物理的羽毛球单打自我对弈环境,它将连续的羽毛球飞行、玩家拦截、结构化击球生成和击球后恢复耦合在一起。策略使用角色条件输出:在接球方回合使用掩码拦截选择,在击球方回合使用分解的动作,包括击球方位角、击球仰角、击球速度和恢复目标,从而支持可解释的战术探查。每个回合是一个单回合对打而非完整得分比赛,训练使用近端策略优化(PPO)进行自我对弈,对手是分阶段检查点对手池,奖励为稀疏的终端回合结果奖励和特定因素的恢复更新。通过冻结检查点对战、受控战术探查、恢复消融分析、定性回放以及人类数据合理性检查进行评估,结果显示策略在竞争性提升的同时,击球几何与恢复行为上出现了可解释的、基于对手条件的改变。所学策略产生了可识别的类似羽毛球的结构,同时也反映了模拟器的抽象特征;恢复干预实验表明,学习到的恢复行为在竞争中具有重要作用。这些结果表明,基于物理的球拍运动是交互式数字娱乐AI的有用测试平台,因为它们要求智能体协调执行、定位以及相对于对手的战术价值。 哥伦比亚大学 美国纽约州纽约市 10027 [email protected] ## 引言 体育游戏是游戏AI的吸引人领域,它们结合了连续控制、长时域后果、对手建模以及视觉上可解释的行为。羽毛球尤其具有揭示性:智能体的即时选择是羽毛球轨迹,但该轨迹的战术价值取决于对手能否拦截它、它会引发何种回球,以及击球者能否恢复到有用下一个位置。对于不熟悉该运动的读者,单打羽毛球由两名对手交替击球过网,每方每次最多击球一次。当羽毛球落在界内、被击出界、未过网或玩家犯规时,回合结束;回合获胜者得一分。因此,杀球、高远球、挑球、平抽球或网前球的好坏并非孤立决定,其价值与对手的位置、速度、反应时间以及击球者的击球后恢复相关联。 自我对弈是训练此类相对对手决策的自然范式。它在游戏领域有悠久历史,从TD-Gammon(Tesauro 1995 (https://arxiv.org/html/2608.25246#bib.bib35))到AlphaGo和AlphaZero风格的自我对弈(Silver et al. 2016 (https://arxiv.org/html/2608.25246#bib.bib30); Silver et al. 2018 (https://arxiv.org/html/2608.25246#bib.bib31))。现代竞争系统通常结合策略梯度优化(如PPO (Schulman et al. 2017 (https://arxiv.org/html/2608.25246#bib.bib29)))、竞争性或基于种群的训练(Bansal et al. 2018 (https://arxiv.org/html/2608.25246#bib.bib2); Jaderberg et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib13))、回顾性技能评级(Elo 1978 (https://arxiv.org/html/2608.25246#bib.bib8); Herbrich, Minka, and Graepel 2006 (https://arxiv.org/html/2608.25246#bib.bib11))以及博弈论种群观点(如策略空间响应预言机 (Lanctot et al. 2017 (https://arxiv.org/html/2608.25246#bib.bib19)))。然而,球拍运动智能体带来了一个独特的评估问题:聚合的手工指标(如平均击球速度)可能提前饱和或波动,而策略质量本质上是相对于对手种群的。 本文将羽毛球自我对弈作为一个耦合的击球与恢复学习问题进行研究。评估不仅关注最终胜率,还关注学习到的策略在固定战术条件下如何变化。智能体在ShuttleArena中使用结构化动作表示进行训练,然后通过冻结检查点上的竞争性、受控性、人类数据合理性检查和消融探查进行评估。由于模拟器使用了受羽毛球启发的移动、拦截和高阻力羽毛球飞行参数,涌现的击球与恢复模式可以被审视为可识别的羽毛球战术,而无需将环境视为完全校准的物理复制品。主要的游戏AI贡献是ShuttleArena:一个使击球-恢复-对手回应耦合变得可学习和可解释的环境。结构化策略暴露了耦合的动作因素,实现上使用了轻量级的恢复头信用调整以支持训练。中心经验性主张是,竞争性的自我对弈提升和战术可解释性应一起衡量:胜率矩阵和评分曲线显示策略是否提升,受控击球和恢复探查显示行为上发生了什么变化,人类数据合理性检查将模式锚定于观察到的回合,恢复消融测试这些行为变化是否在竞争中重要。 论文做出六项贡献: - • ShuttleArena,一个基于物理的羽毛球回合击球环境,耦合了击球执行、羽毛球阻力、接球方拦截、终端回合结果和击球后恢复。 - • 一个角色条件化结构化策略,在接球方回合使用20路掩码拦截头,在击球方回合使用分解的分支(包括击球方位角、仰角、速度和恢复目标),将11,000路击球选择减少到49个组件逻辑值,并暴露恢复决策以供受控分析。 - • 一个自我对弈训练配置,使用PPO、稀疏的终端回合结果奖励,以及先纯近期性阶段后接更广泛线性近期性延续。 - • 一个评估套件,结合冻结循环赛胜率、Bradley–Terry/Elo风格评分、受控接触探查、恢复演进探查、人类数据合理性比较、恢复消融和定性回合回放。 - • 在报告的评估中,证据显示竞争性提升伴随非单调、依赖对局的动态变化,以及击球和恢复行为上可解释的变化。 - • 与人类对比的模式合理但不同于观察到的回合,并提供了学习到的恢复选择以及训练中使用的恢复头更新的消融证据。 这些贡献共同确立ShuttleArena为一个紧凑的游戏AI测试平台,其中策略学习可以直接被审视。ShuttleArena通过击球轨迹、恢复和回合结果使学习到的行为可见;结构化策略暴露了智能体的战术选择;评估套件将竞争性提升与相对于对手的比赛变化联系起来。 ## 相关工作 #### 游戏中的强化学习。 游戏为强化学习提供了核心基准,包括通过街机学习环境(Bellemare et al. 2013 (https://arxiv.org/html/2608.25246#bib.bib3); Mnih et al. 2015 (https://arxiv.org/html/2608.25246#bib.bib23))的Atari游戏、OpenAI Gym(Brockman et al. 2016 (https://arxiv.org/html/2608.25246#bib.bib5))、MuJoCo控制(Todorov, Erez, and Tassa 2012 (https://arxiv.org/html/2608.25246#bib.bib36))、Obstacle Tower(Juliani et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib15))以及多智能体库如PettingZoo和OpenSpiel(Terry et al. 2021 (https://arxiv.org/html/2608.25246#bib.bib34); Lanctot et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib18))。自我对弈在西洋双陆棋、围棋、国际象棋、将棋、Dota 2、星际争霸II和多人夺旗设置中产生了强大的智能体(Tesauro 1995 (https://arxiv.org/html/2608.25246#bib.bib35); Silver et al. 2016 (https://arxiv.org/html/2608.25246#bib.bib30); Silver et al. 2018 (https://arxiv.org/html/2608.25246#bib.bib31); Berner et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib4); Vinyals et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib37); Jaderberg et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib13))。这些系统展示了相对对手学习的力量,但其内部决策变量通常不如球拍运动中空间击球和恢复决策那样直接可解释。 #### 策略梯度与Actor-Critic方法。 实现基于策略梯度和Actor-Critic思想(Sutton et al. 1999 (https://arxiv.org/html/2608.25246#bib.bib32); Konda and Tsitsiklis 1999 (https://arxiv.org/html/2608.25246#bib.bib16))、PPO(Schulman et al. 2017 (https://arxiv.org/html/2608.25246#bib.bib29))、信赖域方法和广义优势估计(GAE)方法(Schulman et al. 2015a (https://arxiv.org/html/2608.25246#bib.bib27); Schulman et al. 2015b (https://arxiv.org/html/2608.25246#bib.bib28)),以及可靠的开源RL实现(Raffin et al. 2021 (https://arxiv.org/html/2608.25246#bib.bib26))。由于策略具有显式的击球和恢复因素,PPO更新可以为恢复因素分配单独的优势信号,同时保留相同的Actor-Critic骨架。该信号的反事实部分在精神上与信用分配的反事实基线相关,特别是反事实多智能体(COMA)策略梯度(Foerster et al. 2018 (https://arxiv.org/html/2608.25246#bib.bib10)),但将比较应用于一个动作因素而非合作多智能体团队中的一个智能体。 #### 结构化与混合动作空间。 羽毛球动作天然是结构化的:高层意图决定轨迹族,而连续或离散化的参数决定方向、高度、速度和恢复位置。这类似于参数化、分支和混合动作空间的研究(Masson, Ranchod, and Konidaris 2016 (https://arxiv.org/html/2608.25246#bib.bib22); Tavakoli, Pardo, and Kormushev 2018 (https://arxiv.org/html/2608.25246#bib.bib33); Fan et al. 2019 (https://arxiv.org/html/2608.25246#bib.bib9))。ShuttleArena策略使用这种结构不仅为了可扩展性,也为了分析:可以在固定战术状态下探查单个动作因素。 #### 体育与羽毛球AI。 体育环境已成为重要的RL基准,包括Google Research Football(Kurach et al. 2020 (https://arxiv.org/html/2608.25246#bib.bib17))和多智能体足球自我对弈研究(Jaderberg et al. 2017 (https://arxiv.org/html/2608.25246#bib.bib14))。羽毛球特定AI工作专注于击球预测、战术数据集、击球影响分析、羽毛球轨迹重建和数据驱动环境(Wang et al. 2022b (https://arxiv.org/html/2608.25246#bib.bib42); Wang et al. 2023 (https://arxiv.org/html/2608.25246#bib.bib41); Wang, Du, and Peng 2023 (https://arxiv.org/html/2608.25246#bib.bib40); Wang et al. 2022a (https://arxiv.org/html/2608.25246#bib.bib39); Liu and Wang 2022 (https://arxiv.org/html/2608.25246#bib.bib21); Ibh, Graßhof, and Hansen 2024 (https://arxiv.org/html/2608.25246#bib.bib12); Wang et al. 2024 (https://arxiv.org/html/2608.25246#bib.bib38); Li et al. 2026 (https://arxiv.org/html/2608.25246#bib.bib20))。特别是,ShuttleSet提供了用于战术分析的人类标注单打击球级数据集,而ShuttleSet22将击球级羽毛球数据框定为击球预测基准(Wang et al. 2023 (https://arxiv.org/html/2608.25246#bib.bib41); Wang, Du, and Peng 2023 (https://arxiv.org/html/2608.25246#bib.bib40))。这些工作提供了有价值的数据驱动模型和基准。CoachAI Badminton Environment、CoachAI+/RallyNetV2和ShuttleEnv与ShuttleArena尤其互补(Wang et al. 2024 (https://arxiv.org/html/2608.25246#bib.bib38); Peng et al. 2025 (https://arxiv.org/html/2608.25246#bib.bib25); Li et al. 2026 (https://arxiv.org/html/2608.25246#bib.bib20))。CoachAI+/RallyNetV2在击球事件级别运行,从比赛数据预测离散击球类型、落点位置和玩家移动,而ShuttleArena在基于物理的环境中通过在线自我对弈执行显式的三维羽毛球轨迹并训练策略。与已发布的事件级策略进行头对头比较需要状态/动作适配器和逆轨迹控制器,因此其结果会混淆策略质量和跨环境映射。因此,我们不声称ShuttleArena优于CoachAI+/RallyNetV2或在人类行为模仿方面更优。这些系统针对互补目标:ShuttleArena提供了一个基于物理的平台,其中击球执行和恢复可以分别被探查和干预,而数据驱动系统强调人类比赛序列建模和从记录回合中进行策略评估。羽毛球本身是高阻力抛射体,其轨迹与抛物线球飞行有显著差异,这促使了显式阻力建模(Cohen et al. 2015 (https://arxiv.org/html/2608.25246#bib.bib6); Collet 2026 (https://arxiv.org/html/2608.25246#bib.bib7); Nokihara et al. 2023 (https://arxiv.org/html/2608.25246#bib.bib24))。 ## ShuttleArena环境 ### 状态与球场几何 参见图例图1:ShuttleArena概览,包括状态、角色条件策略、回合转换和评估流程。策略观察玩家位置、羽毛球/接触特征、可行拦截信息和回合上下文。在接球方回合,它选择一个可行的拦截候选点;接触后,在击球方回合,它将发出动作分解为击球方位角、仰角、速度和恢复。左图在一个接发球链中紧凑地展示了这些连续决策;它们在模拟器的一个步长中并非联合采样。ShuttleArena通过羽毛球物理和对手回应推进回合,而PPO自我对弈针对检查点混合进行训练,冻结检查点通过循环赛胜率和评分分析进行评估。 如图1 (https://arxiv.org/html/2608.25246#Sx3.F1) 总结,ShuttleArena在二维球场上表示羽毛球单打回合,具有三维羽毛球飞行。在每个策略决策点,当前智能体观察玩家位置、羽毛球/接触特征、接球时的可行拦截信息以及回合上下文。策略在每个模拟器步长中以两个角色之一行动。作为接球方,它为来球选择一个可行的拦截点;成功接触后,它作为击球方行动,选择发出的击球和恢复目标。该表述是回合级的:一个回合是一次对打,终端奖励是该回合的获胜者,实验不模拟完整的21分比赛、比赛计分、换边或服务状态影响(除了随机回合初始化)。分析运行的主要模拟器、动作空间、训练和评估设置总结在表1 (https://arxiv.org/html/2608.25246#Sx4.T1) 中。状态包括击球者和接球者位置、羽毛球接触高度和速度相关特征、边/发球方信息以及描述反应风险和可行未来拦截的特征。
相似文章
竞争性自我对弈
OpenAI 证明在模拟 3D 机器人环境中进行竞争性自我对弈,能够使 AI 智能体在没有明确指导的情况下发现复杂的物理行为,如铲球、躲闪和虚晃等,表明自我对弈将成为未来强大 AI 系统的基础。
镜中的攻击者:通过锚定双策略自我博弈打破安全中的自洽性
本文介绍了锚定双策略自我博弈(Anchored Bipolicy Self-Play),这是一种通过在冻结的基础模型上训练特定的角色专用 LoRA 适配器来改善 AI 安全性的方法,旨在解决标准自我博弈红队测试中的局限性。
SPADE:自适应合成可执行环境中的自我博弈
SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。
PACE-Bench:动态环境中通过代码演化进行物理适应的基准测试
PACE-Bench 引入了一个基于模拟器的基准,用于评估在物理适应任务中,经过环境突变后需要迭代重新设计代码的自进化智能体,并揭示了相比参数推断,机制重新设计是一个主要瓶颈。
Big 2中不完美信息下的自我对弈强化学习
本文提出了一个针对四人制不完美信息纸牌游戏Big 2的自我对弈强化学习框架,比较了策略梯度和基于价值的方法,并发现带有熵正则化的PPO优于其他方法。