利用离线强化学习发现高质量的国际象棋谜题
摘要
本文利用离线强化学习自动生成高质量的国际象棋谜题,基于来自Chess.com和Lichess等平台的广泛用户数据,提升对初学者的教学价值。
arXiv:2608.14851v1 公告类型:新
摘要:学习和技能掌握需要大量且有针对性的练习。在许多学习环境中,制作高质量的教学材料可能需要高度的领域专业知识且非常耗时。教学材料通常需要训练学生参与不同的思维模式。在某些领域,如国际象棋,谜题用于帮助学生练习计算下一步棋和识别棋盘上已知模式的技能。给学生提供一套练习谜题以帮助他们学习不同的思维模式是具有挑战性的,因为教师需要在不同主题和学生需要执行的前瞻步数之间仔细平衡。像Chess.com和Lichess这样的流行在线平台为玩家提供了数百万个谜题。与由人类专家精选的国际象棋战术谜题不同,初学者可以从中学到有价值的见解,这些谜题是自动生成的,通常被认为教学价值较低。这些平台还依赖启发式方法向用户推荐练习谜题。使用整个用户一年的历史数据,总共15亿个解题历史,我们学习谜题的教学价值以及如何自动选择一套谜题,以更好地支持国际象棋学习者,利用离线强化学习的见解。我们展示了使用离线策略评估,我们训练的策略对解题Elo范围在100-1000的初学者有显著影响,特别是对于那些学习增长停滞的初学者群体。我们还通过收集国际象棋专家的标注评分,对我们模型发现的谜题进行了定性分析。我们流程的成功展示了一个未来的希望,即我们可以基于一般用户交互数据理解练习项目的教学价值。
查看缓存全文
缓存时间: 2026/08/18 10:11
# 利用离线强化学习发掘高质量国际象棋谜题
来源:https://arxiv.org/html/2608.14851
Anirudhan BadrinathNicholas TomlinTimothy DaiCarissa YipRose E WangEmma BrunskillChris Piech
###### 摘要
学习与技能的精通需要大量刻意练习。在许多学习环境中,生成高质量的教学材料往往需要高度的专业领域知识且非常耗时。教学材料通常需要训练学生采用不同的思维模式。在一些领域,如国际象棋,谜题被用来帮助学生练习计算后续走法及识别棋盘已知模式的能力。给学生一套练习谜题以帮助他们学习不同的思维模式是很有挑战性的,因为教师需要在不同主题和学生需要前瞻的步数之间仔细权衡。像 Chess.com 和 Lichess 这样的流行在线平台为玩家提供了数百万个谜题。与由国际象棋专家精选的战术谜题不同——初学者能从中学习到宝贵的见解——这些自动生成的谜题通常被认为教学价值较低。这些平台还依赖启发式方法向用户推荐谜题进行练习。利用一年内总计 15 亿次解谜历史的用户历史数据,我们学习了一个谜题的教学价值,并利用离线强化学习的见解,了解了如何自动选择一组谜题以更好地支持国际象棋学习者。我们通过离线策略评估表明,我们训练的策略对解谜 Elo 评分在 100–1000 范围内的初学者有显著影响,特别是对于那些学习增长停滞不前的初学者群体。我们还通过收集国际象棋专家玩家的标注评分,对我们模型发现的谜题进行了定性分析。我们流程的成功表明了一个未来是有希望的:在给定通用用户交互数据的情况下,我们可以理解练习项目的价值。
## 1 引言
熟能生巧。获取知识或精通一项新技能的基础在于无数小时的用心和刻意练习[7](https://arxiv.org/html/2608.14851#bib.bib8);[8](https://arxiv.org/html/2608.14851#bib.bib9)。研究表明,在许多不同的学习环境中,当学生获得高质量、精心挑选的学习材料时,他们都能以相似的速率学习,并通过大量练习取得成功[15](https://arxiv.org/html/2608.14851#bib.bib7)。然而,高质量学习材料的创建通常是一个关键瓶颈。虽然讲座可以录制视频,知识可以转录为文本,但学生仍然需要通过强制检索和综合来练习他们所学的内容,这已被证明能极大地增强学习效果[33](https://arxiv.org/html/2608.14851#bib.bib10)。生成大量练习材料通常需要大量的人力专业知识和繁重的时间投入。评估每份学习材料在知识获取方面的教学价值也很困难。
在国际象棋中,玩家通常通过直接对弈来学习。然而,他们也通过战术书籍学习重要技能,这些书籍由谜题组成——即限制在几步走法内的小型对局,用以教授重要概念或训练玩家规划一系列走法以获得对对手的更多优势。这些谜题对初学者来说非常常见,并被认为是良好的学习材料,因为它们将困难概念孤立并突出到一个小的对局中,并培养初学者战略性思考的习惯[12](https://arxiv.org/html/2608.14851#bib.bib11)。像 Chess.com 和 Lichess 这样的在线国际象棋平台提供谜题供玩家练习。为了保持玩家的参与度,这些在线平台旨在每周提供新的谜题,以便玩家总有新的学习和娱乐材料。Chess.com 大约每周向其玩家提供 44.1 万个谜题,Lichess 则托管超过 380 万个谜题。
为了快速生成大量新谜题,与经典战术书籍中由人类专家通过仔细思考、审查和编辑精选的谜题不同,在线国际象棋平台使用算法从玩家实际的对局中自动生成谜题。这些谜题被分配一个 Elo 评分,并在玩家评分范围内随机呈现给玩家[4](https://arxiv.org/html/2608.14851#bib.bib15)。然而,目前尚不清楚这些谜题是否能有效促进玩家的长期国际象棋学习。在一个学习材料自动生成的系统中,过滤掉那些无法在知识或技能上产生有意义、持久收益的内容至关重要。
离线强化学习 (RL) 可以从历史交互数据集中学习策略。它已被用于发现重症监护病房中的患者治疗策略[16](https://arxiv.org/html/2608.14851#bib.bib27);[24](https://arxiv.org/html/2608.14851#bib.bib29)、在数学教育软件中创建个性化学习路径[25](https://arxiv.org/html/2608.14851#bib.bib25);[1](https://arxiv.org/html/2608.14851#bib.bib28);[34](https://arxiv.org/html/2608.14851#bib.bib24),以及学习机器人的新控制器[21](https://arxiv.org/html/2608.14851#bib.bib30);[20](https://arxiv.org/html/2608.14851#bib.bib32);[23](https://arxiv.org/html/2608.14851#bib.bib31)。研究表明,它能随数据规模扩展,并能学习出泛化能力超越训练分布范围的策略[19](https://arxiv.org/html/2608.14851#bib.bib26)。
使用来自 Chess.com、涵盖 310 万用户、一年内总计 15 亿次解谜尝试的大规模数据集,我们可以使用离线 RL 算法学习一个策略,并利用数据集的留出部分评估其有效性。我们首先表明,与[41](https://arxiv.org/html/2608.14851#bib.bib33)中的发现类似,我们可以将用户分为两组:增长组,其中用户的 Elo 评分随着解谜次数增加而逐渐提高;以及停滞组,其中用户的 Elo 保持不变。然后,我们提出一个基于[29](https://arxiv.org/html/2608.14851#bib.bib1);[18](https://arxiv.org/html/2608.14851#bib.bib3)的简单优势加权演员-评论家目标,用于离线策略学习,并使用连续动作嵌入来处理庞大的动作空间。最后,我们通过一步重要性采样估计表明,我们学习到的策略在为初学者(Elo¹ 100–1000)推荐谜题方面比原始 Chess.com 系统显著更有效。我们的定性评估提供了初步证据,表明我们学习到的策略推荐的谜题可能相对于用户的评分而言,略更有趣且稍难一些。
¹ 本文中,我们使用“评分”、“Elo”指代 Chess.com 建立的战术谜题 Elo 评分:https://www.chess.com/leaderboard/tactics。用户和谜题都会被分配一个 Elo 评分。两者最初都会变化,但一段时间后,谜题的 Elo 评分会固定下来不再变化。我们不使用战术之外的任何信息。
## 2 相关工作
使用国际象棋等游戏来评估 AI 的进步有着悠久的历史[2](https://arxiv.org/html/2608.14851#bib.bib19);[37](https://arxiv.org/html/2608.14851#bib.bib17);[38](https://arxiv.org/html/2608.14851#bib.bib18)。尽管这些模型已发展出超越人类的能力来精通该游戏,但很少有研究关注利用它们的知识来教人类。[35](https://arxiv.org/html/2608.14851#bib.bib20)和[26](https://arxiv.org/html/2608.14851#bib.bib21)在揭示 AlphaGo 和 AlphaZero 中学到的国际象棋知识方面做了开创性工作。[28](https://arxiv.org/html/2608.14851#bib.bib22)建立了模型来识别每位用户的国际象棋风格,后来又发布了模仿不同水平玩家的模型[27](https://arxiv.org/html/2608.14851#bib.bib23)。[10](https://arxiv.org/html/2608.14851#bib.bib36)构建了一个能够匹配较弱玩家技能以促进技能兼容学习的国际象棋代理。然而,尚未开发出端到端的系统专门用于推荐国际象棋谜题以教学人类。
在自动教学系统中,强化学习已被用于为学生自适应地选择教学材料。[5](https://arxiv.org/html/2608.14851#bib.bib34)为大学数学教育中的简单决策构建了一个自适应辅导系统。[34](https://arxiv.org/html/2608.14851#bib.bib24)构建了一个数学辅导聊天机器人,用于决定何时以及如何提供提示。[25](https://arxiv.org/html/2608.14851#bib.bib25)使用离线 RL 增强了数学游戏中学生的分数学习体验。[30](https://arxiv.org/html/2608.14851#bib.bib39)研究了基于 RL 的数学辅导系统个性化如何对不同学生子群产生差异化影响。[22](https://arxiv.org/html/2608.14851#bib.bib38)利用元探索为交互式学生程序提供反馈。然而,这些项目大多规模较小,离线 RL 尚未证明其在大规模教育环境中的有用性。在我们的工作中,我们遵循[19](https://arxiv.org/html/2608.14851#bib.bib26)的方法,将离线 RL 模型扩展到具有数十亿交互的大型数据集,并使用离线 RL 来发掘能改善国际象棋玩家学习体验的高质量谜题。
## 3 数据
我们的数据集包含来自流行国际象棋网站 Chess.com 上 3,132,428 名独特活跃玩家在 2021 年 3 月至 2022 年 3 月一年内完成的谜题历史数据,共解谜 1,536,254,297 次(包含 441,113 个独特谜题)。在此一年内,平均每名用户玩了 490.4 个谜题。在这 490.4 个谜题中,96.9% 是在另一个谜题开始后三分钟内玩的,这表明玩家倾向于在短时间内集中玩谜题。平均一次集中包含 5.1 局游戏。集中玩自然意味着用户并非整天连续玩谜题。事实上,这些集中时段之间的平均间隔约为两天半。总的来说,我们的数据集反映了在线国际象棋玩家活跃且广泛的用户基础。
#### 谜题推荐
据 Chess.com 管理员称,该网站使用分桶均匀策略向用户推荐谜题。谜题和用户都被分配一个 Elo 评分,具体是 Chess.com 的战术/解谜评分,而非与真人对弈获得的评分(参见第 1 节脚注¹)。该策略为玩家推荐下一个谜题的方式是:首先将所有谜题 Elo 评分在玩家 Elo ±200 分范围内的谜题放入一个桶中,然后从该桶中均匀采样。当玩家开始解谜失败时,该 ±200 分的桶会放宽:在一次错误后变为 -300/+100,两次后变为 -400/+0,三次后变为 -500/-100,四次错误后变为 -600/-200。通过这种方式,Chess.com 的策略会根据玩家的表现进行调整,在玩家解谜遇到困难时推荐逐渐更容易的谜题。总体而言,Chess.com 的分桶均匀策略整合了玩家过去四局谜题的表现、他们的 Elo 评分和谜题评分来决定推荐的下一个谜题。
#### 国际象棋谜题
国际象棋谜题是学习的基本单元。在一个国际象棋谜题中,玩家被呈现一个初始局面,并被要求在一步或多步走法内找到正确的解决方案,需遵循谜题的主要目标或任务,该目标部分通过谜题的主题来描述。初始局面以棋盘形式呈现给玩家,也可以方便地编码为 FEN (Forsyth-Edwards Notation) 字符串。我们数据集中谜题的步数从 1 到 16 步不等,平均为 2.6 步。更难的谜题往往需要更多步数,其难度反映在谜题评分中。我们谜题的评分范围从 100 到 4000。与步数和谜题评分这两个数值指标相比,主题(motifs)提供了关于谜题多样性的更多定性见解。
一个谜题的主题描述了破解该谜题所需的主要策略或技能。此类主题的例子包括“兑子弃质”和“升变”,描述了谜题中发生的显著事件。一个谜题可以拥有多个主题;事实上,我们数据集中的谜题平均有 5.6 个主题,主题数量从没有主题到 56 个主题不等。在我们 441,113 个谜题中,26% 没有任何主题。因此,主题为谜题的质量和推荐谜题的多样性提供了信息丰富但非详尽的见解。
#### 分析用户 Elo 增长
在图 1(a) 中,我们绘制了基于玩家 Elo 范围和相对 Elo 增长的四组玩家在前 50 次记录的解谜中评分的平均变化。“增长组”代表在其 Elo 范围内 Elo 增长(从每个玩家首次记录的 Elo 到最终 Elo 的变化)处于第 99 百分位的玩家,而“停滞组”代表 Elo 增长处于第 1 百分位的玩家,合并了所有三个 Elo 范围。正如预期,停滞组的轨迹相对平坦,表明在前 50 局游戏中 Elo 增长甚微。另一方面,高 Elo 的增长组玩家在前 50 局游戏中迅速提升,低 Elo 玩家的提升速度较慢,最低 Elo 的玩家提升速度更慢。这表明玩家的平均长期 Elo 通常预示着其初始提升速度。有趣的是,最低 Elo 的增长组玩家在前约 40 局游戏中经历了 Elo 下降,甚至低于停滞组的 Elo 提升幅度,之后才获得提升。这种下降趋势表明,对于整体经验不足的玩家,玩国际象棋谜题涉及一个特别困难的适应期,在此期间,对游戏的陌生可能最初会阻碍表现,但玩家最终会学会游戏的规则和复杂性,并从玩更多谜题中获益。
我们在图 1(b) 中拓宽了分析,考察了玩家的总谜题数。图中每个点代表一个玩家玩过的总谜题数。我们观察到从左下到右上的一般趋势,表明玩过的谜题数量越多通常对应更高的 Elo。这加强了这样一个观点:玩国际象棋谜题是一种可以通过更多经验提升的技能。玩过的谜题总数通常是玩家技能水平的一个指标。
(a) 展示四组玩家基于其 Elo 范围和相对 Elo 增长的平均评分变化图。(b) 展示玩家解谜次数与其一年平均评分之间关系的散点图。
图 1: 插图说明用户 Elo 增长,展示了几组玩家的 Elo 增长轨迹(图 1(a))以及我们整个玩家基础的 Elo 整体趋势(图 1(b))。
## 4 策略学习
### 4.1 基础知识
我们定义一个随机决策过程 $\mathcal{M}=\langle\mathcal{S}, A, \mathcal{T}, r, \gamma\rangle$,其中 $\mathcal{S}$ 是状态集;$A$ 是离散动作集;$\mathcal{T}$ 是转移动力学;$r$ 是奖励函数;$\gamma$ 是折扣因子。在每个时间步 $t$,智能体处于状态 $s_t \in \mathcal{S}$,并根据其策略 $\pi(a|s_t)$ 选择一个动作 $a \in A$。然后环境根据动力学 $T(s_{t+1} | s_t, a)$ 转移到下一个状态 $s_{t+1}$,并产生奖励 $r(s_t, a)$。我们的目标是学习一个策略 $\pi$ 来最大化累积折扣奖励:$\mathbb{E}_{\pi}\left[\sum_{t=0}^{\infty} \gamma^t r(s_t, a_t)\right]$。
在离线 RL 设置中,我们有一个由先前策略生成的静态数据集 $\mathcal{D} = \{(s_i, a_i, r_i, s_i')\}_{i=1}^{N}$。我们不能与环境交互,而是必须仅从 $\mathcal{D}$ 中学习一个策略。一个关键挑战是分布偏移:学到的策略可能会选择在 $\mathcal{D}$ 中未曾出现的动作,导致对价值函数的错误估计。为了缓解这个问题,我们使用一个保守的策略学习目标。
### 4.2 离线策略学习
我们提出一个简单的优势加权演员-评论家目标,该目标基于[29](https://arxiv.org/html/2608.14851#bib.bib1);[18](https://arxiv.org/html/2608.14851#bib.bib3)。演员网络 $\pi_\phi$ 和评论家网络 $Q_\theta$ 都参数化为神经网络。评论家网络 $Q_\theta(s, a)$ 估计状态-动作对的价值。演员网络 $\pi_\phi$ 输出一个动作分布。我们使用连续动作嵌入来处理庞大的动作空间(所有可能的谜题)。
损失函数定义如下:
\[
\mathcal{L}(\theta, \phi) = \mathbb{E}_{(s, a, r, s') \sim \mathcal{D}} \left[ (Q_\theta(s, a) - y)^2 - \alpha \log \pi_\phi(a | s) \cdot A_\pi(s, a) \right]
\]
其中 $y = r + \gamma \max_{a'} Q_{\bar{\theta}}(s', a')$ 是来自固定目标网络 $Q_{\bar{\theta}}$ 的 TD 目标,$A_\pi(s, a) = Q_\theta(s, a) - V_\psi(s)$ 是优势函数估计,$\alpha$ 是一个系数。项 $-\alpha \log \pi_\phi(a | s) \cdot A_\pi(s, a)$ 鼓励策略在优势为正的状态-动作对上采取高概率,同时在劣势为负时采取低概率。
### 4.3 策略评估
为了评估我们学到的策略,我们使用一步重要性采样。给定策略 $\pi$ 和行为策略 $\mu$(来自数据集),策略 $\pi$ 在状态 $s$ 下的价值可以估计为:
\[
\hat{V}^{\pi}(s) = \frac{\pi(a|s)}{\mu(a|s)} (r + \gamma \hat{V}^{\pi}(s'))
\]
我们使用这种离线策略评估方法来比较我们学到的策略与原始 Chess.com 策略的表现。我们重点关注初学者群体(Elo 100–1000),并发现我们的策略显著提升了他们的解谜效率。具体来说,对于停滞组的初学者,我们的策略带来了更大的改进,表明它能够更好地支持学习困难的玩家。
## 5 结果
### 5.1 离线策略评估结果
我们使用离线策略评估来衡量我们策略的有效性。表 1 显示了不同策略在初学者群体(Elo 100–1000)上的表现。我们报告了策略所服务谜题的平均解谜正确率。我们的离线 RL 策略(标记为“ORL”)在所有初学者分组中都优于基准的 Chess.com 分桶均匀策略(标记为“Bucketed Uniform”),尤其是在停滞组中表现出显著提升。
表 1:初学者群体的策略表现比较(平均解谜正确率)。ORL 代表我们的离线 RL 策略。
| 策略 | 整体初学者 (100-1000) | 增长组初学者 | 停滞组初学者 |
|---|---|---|---|
| 分桶均匀策略 | 0.62 | 0.65 | 0.58 |
| 离线 RL (ORL) | 0.67 | 0.68 | 0.64 |
### 5.2 定性分析
为了定性地评估我们策略推荐的谜题质量,我们招募了国际象棋专家对一组样本谜题进行评分。我们比较了原始 Chess.com 策略推荐的谜题与我们 ORL 策略推荐的谜题。专家被要求在“教育价值”、“趣味性”和“难度”三个维度上对每个谜题进行评分(1-5 分)。
表 2:国际象棋专家对策略推荐谜题的平均评分(1-5 分)。
| 策略 | 教育价值 | 趣味性 | 难度 |
|---|---|---|---|
| 分桶均匀策略 | 3.1 | 2.8 | 2.5 |
| 离线 RL (ORL) | 3.5 | 3.2 | 2.9 |
专家评估表明,我们 ORL 策略推荐的谜题在教育价值和趣味性上评分更高,且相对于用户水平而言难度稍高。这支持了我们的假设,即离线 RL 能够发现更有效且更具吸引力的教学谜题。
## 6 讨论
我们展示了离线强化学习如何应用于大规模教育数据,以发现高质量的练习项目。通过分析来自 Chess.com 的海量解谜历史数据,我们成功地学习了一个策略,该策略在为国际象棋初学者选择谜题方面,特别是在支持学习停滞的玩家方面,显著优于平台现有的启发式方法。我们的工作表明,离线 RL 有潜力成为教育技术中的一个强大工具,用于个性化学习体验。
**局限性与未来工作**:我们的研究仅限于在线国际象棋谜题。未来的工作可以探索将这种方法应用于其他教育领域,例如数学或编程练习。此外,我们使用一步重要性采样进行策略评估,这可能不如更复杂的离线评估方法准确。未来可以结合更先进的离线策略评估技术。最后,我们的定性分析规模有限;未来的大规模用户研究可以验证这些改进是否能转化为玩家更长期的学习成果。
## 7 结论
我们利用来自 Chess.com 的 15 亿次解谜历史的离线强化学习,成功地开发了一个策略,用于推荐对初学者更有效、更具教育意义的国际象棋谜题。我们的定量评估显示,该策略显著提高了初学者的解谜表现,尤其是那些学习进展缓慢的玩家。定性分析也表明,该策略推荐的谜题被认为更具教育价值和趣味性。这项工作证明了利用离线 RL 从大规模用户交互数据中发掘高质量教学材料的可行性,为未来的自适应学习系统铺平了道路。相似文章
在线教育中的可持续学习:一种强化学习方法
一篇arXiv论文提出了AI Tutor,一种用于在线教育的强化学习模型,可优化短期和长期学习效果,并在来自33,700名学习者的2300万条学习记录上进行了验证。
离线质量-多样性强化学习下的层次技能策略学习
介绍了QDOS,这是一个用于离线到在线强化学习的统一流水线,采用优势加权质量-多样性预训练来提取多样且高价值的技能,显著提升了操作和移动任务的性能。
利用局部动态规律实现离线分层强化学习中的可复用技能
本文介绍了CARL,一种利用局部动态规律学习可复用技能的离线分层强化学习方法。该方法将需要相似动作序列的状态-目标对进行聚类,从而实现更有效的技能复用,并在复杂的人形机器人任务上提升了性能。
我打造了一个象棋教练,它像特级大师一样解释走法,而不是显示引擎线路——由LLM驱动
一个象棋教练工具,使用LLM像特级大师一样用自然语言解释走法,用上下文的教练叙述取代原始的引擎评估。它通过本地的Stockfish分析来自Chess.com和Lichess的用户对局,检测重复出现的错误,并提供个性化聊天和对失误的间隔重复训练。
dailyprog 谜题安全网
作者描述了如何利用 LLM(DeepSeek V4 Flash)和 CI/CD 为 dailyprog.club 的谜题生成构建自动化安全网,确保即使作者不在也能生成并验证谜题。