CAST: 游戏求解器作为LLM智能体的回合级教师
摘要
CAST是一种方法,利用游戏求解器的状态值来提供回合级信用分配信号,通过强化学习训练LLM智能体,在多个游戏中的领域内和未见难度评估中均优于基线。
arXiv:2607.25308v1 公告类型:新
摘要:训练大型语言模型(LLM)在长视界游戏中行动是迈向通用决策制定的有前景的一步,然而基于可验证奖励的强化学习(RLVR)依赖于稀疏的最终奖励,这几乎无法揭示哪些决策决定了成功。更密集的过程信号可以提供缺失的回合级信用,但现有的来源难以同时保持廉价和准确。我们观察到,游戏求解器状态值的变化可以揭示一个动作是否使状态向成功推进。基于这一洞察,我们提出了CAST(来自求解器教师的信用分配),它将这些值变化转换为求解器优势,并作为回合级信号注入RLVR。我们进一步证明,在软最优求解器假设下,最大化求解器优势等价于从求解器进行在线策略蒸馏,只需要标量值而不是教师logits。在Sokoban、Minesweeper和Rush Hour上,CAST在领域内和未见难度评估中均优于所有训练的基线,并在ALFWorld和WebShop上取得了最高的平均零样本性能。我们的代码可在 https://github.com/Wloner0809/CAST 获取。
查看缓存全文
缓存时间: 2026/07/29 09:55
# CAST:游戏求解器作为LLM智能体的回合级教师
来源:https://arxiv.org/html/2607.25308
Yu Wang1,4\*, Yi-Kai Zhang2,4\*, Wentao Shi1, Ziang Ye1,4, Yuchun Miao3,4, Yueqing Sun4
Qi Gu4, Xunliang Cai4, Lan-Zhe Guo2, Han-Jia Ye2, Fuli Feng1
1中国科学技术大学
2南京大学
3武汉大学
4美团,中国
###### 摘要
训练大型语言模型(LLM)在长期博弈中行动是迈向通用决策的有前景的一步,然而基于可验证奖励的强化学习(RLVR)依赖于稀疏的最终奖励,这些奖励很少能揭示哪些决策决定了成败。更密集的过程信号可以提供缺失的回合级信用分配,但现有来源难以同时保持廉价和准确。我们观察到游戏求解器状态值的变化可以揭示一个动作是否将状态推向成功。基于这一洞见,我们提出**CAST**(来自求解器教师的信用分配),它将这些值的变化转化为求解器优势,并将其注入RLVR中作为回合级信号。我们进一步表明,在软最优求解器假设下,最大化求解器优势等价于从求解器进行在线策略蒸馏,仅需要标量值而非教师logits。在推箱子、扫雷和塞车游戏中,CAST在领域内和未见难度评估下均优于所有训练基线,并在ALFWorld和WebShop上取得了最高的平均零样本性能。我们的代码可在github.com/Wloner0809/CAST(https://github.com/Wloner0809/CAST)获取。
\*\*footnotetext:同等贡献。\raisebox{0.4pt}{\faIcon[regular]{envelope}}\raisebox{0.4pt}{\faIcon[regular]{envelope}}
\*\*footnotetext:通讯作者:[email protected] 和 [email protected]。
## 1 引言
随着大型语言模型(LLM)和多模态基础模型(Yang et al., 2025(https://arxiv.org/html/2607.25308#bib.bib36);Team et al., 2026(https://arxiv.org/html/2607.25308#bib.bib43))从被动生成转向主动决策,一个核心目标是构建能够在具身和开放世界环境中进行决策的通用智能体(Intelligence et al., 2025(https://arxiv.org/html/2607.25308#bib.bib44))。这些智能体需要在不断变化的状态中行动,其中早期决策的影响可能直到后期才显现,并且往往难以逆转(Ye et al., 2026(https://arxiv.org/html/2607.25308#bib.bib59))。这些设置需要广泛的能力,包括长期规划、目标导向的探索和从错误中恢复。经典游戏,如推箱子和扫雷,为这些能力提供了理想的测试平台(Junghanns and Schaeffer, 2001(https://arxiv.org/html/2607.25308#bib.bib46);Mnih et al., 2015(https://arxiv.org/html/2607.25308#bib.bib45);Hu et al., 2025(https://arxiv.org/html/2607.25308#bib.bib11)),具有定义明确的规则、可验证的反馈和可扩展的决策环境。事实上,这类游戏已经可以通过领域特定的求解器高效求解,包括启发式搜索、动态规划和专门的DQN值网络(Mnih et al., 2013(https://arxiv.org/html/2607.25308#bib.bib47))。相比之下,通用LLM即使在这些结构化环境中也仍然不可靠,如图1(https://arxiv.org/html/2607.25308#S1.F1)(左)所示。因此,游戏为研究通用LLM如何成为可靠的交互智能体提供了一座桥梁(Ouyang et al., 2026(https://arxiv.org/html/2607.25308#bib.bib13);Paglieri et al., 2025(https://arxiv.org/html/2607.25308#bib.bib10))。
训练通用LLM游戏智能体的一个核心瓶颈是缺乏可扩展的细粒度学习信号。基于可验证奖励的强化学习(RLVR)在单回合任务中已证明有效(Zhang et al., 2026(https://arxiv.org/html/2607.25308#bib.bib48);Chen et al., (https://arxiv.org/html/2607.25308#bib.bib49);Guo et al., 2025(https://arxiv.org/html/2607.25308#bib.bib50)),但在游戏中,最终奖励往往过于稀疏。如图1(https://arxiv.org/html/2607.25308#S1.F1)(右)所示,这类结果信号无法揭示轨迹中哪些决策导致最终胜负,从而产生了根本性的信用分配挑战。为了解决这一挑战,现有方法通过昂贵的搜索(Hao et al., 2023(https://arxiv.org/html/2607.25308#bib.bib24))、学习到的过程奖励模型(Xi et al., 2026(https://arxiv.org/html/2607.25308#bib.bib22))或交叉轨迹比较(如GiGPO(Feng et al., 2026(https://arxiv.org/html/2607.25308#bib.bib4)))来获得更密集的过程信号,但仍在计算、监督和信号可靠性之间面临权衡。
我们观察到游戏求解器可以提供这一缺失的信号,因为求解器可以从执行动作的状态评估该动作。然而,在求解器生成的专家轨迹上进行SFT并未充分利用这一能力:它只将LLM暴露给专家访问过的状态,一旦模型在交互过程中偏离,则几乎不提供指导。这促使我们采用一种在线策略RL范式,其中LLM在其自身策略下进行探索,而求解器充当“回合级教师”。将模型的在线策略探索与即时求解器反馈对齐,本质上是一种在线策略蒸馏(OPD)。然而,现有的LLM蒸馏方法(Lu and Lab, 2025(https://arxiv.org/html/2607.25308#bib.bib29);Gu et al., 2024(https://arxiv.org/html/2607.25308#bib.bib28))通常依赖于整个token空间上的教师logits,而经典求解器仅返回一个最优动作或一个标量的剩余代价(cost-to-go),而非这样的分布。因此,我们提出**CAST**(来自求解器教师的信用分配),这是一种直接构建在求解器上的蒸馏策略。由于求解器可以从中间状态完成游戏,它为每个状态分配一个**状态值**:该状态离获胜有多近。对于LLM采样的每个动作,CAST比较动作前后立即的求解器值,得到求解器优势,并将其注入RLVR中作为回合级信号。这将结果奖励转化为过程监督,指示当前动作是否使状态更接近成功,且训练开销可忽略不计。我们的理论分析表明,对于足够强的求解器,动作在求解器隐式动作分布下的对数概率与其状态值的一步变化严格成比例。因此,增加具有更大求解器优势的动作的似然性,在数学上等价于将LLM的动作分布与求解器对齐的在线策略蒸馏。这一等价性解决了上述障碍:标量优势已经携带了教师的动作偏好,因此一个标量足以进行蒸馏,无需教师的完整动作分布,从而实现了高效的无需logits的蒸馏。
参见图注
图1:概览。(左)当前一些闭源LLM在经典游戏上表现不佳。(右)仅基于结果的RLVR缺乏细粒度反馈,而我们的求解器导出的信号提供了准确的回合级信用分配。
在实践中,求解器信号的绝对量级在不同游戏间存在差异,且常包含极端值,从而破坏训练稳定性。我们通过两个轻量级整形步骤来解决这个问题。首先,asinh变换平滑地压缩极端值,同时在小信号区域保持分辨率;理论分析表明这相当于一个稳健化的KL约束。其次,批次级别的均方根(RMS)归一化消除了跨领域的量级差异。这些使得求解器优势能够作为稳定、可比较的过程信号,无缝集成到RLVR中。
我们在推箱子、扫雷和塞车游戏上评估了CAST,这些游戏涵盖了长期规划、部分观测推断和约束组合搜索等互补挑战。在领域内和未见难度设置下,CAST在所有游戏上均取得了所有训练方法中的最佳性能,始终优于仅基于结果的RLVR基线和过程级基线GiGPO(Feng et al., 2026(https://arxiv.org/html/2607.25308#bib.bib4))。它还在显著更少的训练步骤内达到了DAPO(Yu et al., 2026a(https://arxiv.org/html/2607.25308#bib.bib2))的峰值验证性能,并零样本迁移到保留的ALFWorld(Shridhar et al., (https://arxiv.org/html/2607.25308#bib.bib34))和WebShop(Yao et al., 2022(https://arxiv.org/html/2607.25308#bib.bib35))领域,无需进一步微调。消融实验验证了求解器优势加权和信号变换的有效性;进一步分析表明求解器开销可忽略不计,且学习到的值网络可以保留精确求解器指导的大部分收益。
总之,我们的贡献如下:
- **求解器导出的信用分配。** 我们将游戏求解器视为回合级教师,并定义了一个求解器优势,为RLVR中LLM采样的动作分配细粒度信用。
- **无需logits的蒸馏。** 我们证明最大化这一优势等价于在线策略蒸馏,从而得到一个无需教师logits的蒸馏目标,并通过asinh压缩和批次级RMS归一化使其稳定。
- **性能和泛化能力。** CAST在领域内和未见难度下,在所有三个游戏上均达到最先进结果,提高了样本效率,并零样本迁移到ALFWorld和WebShop。
- **实用性。** 精确求解器增加的开销可忽略不计,而在没有精确求解器的情况下,学习到的值网络可提供相当的性能。
## 2 方法
我们的方法让特定游戏的求解器充当回合级教师,对LLM采取的每个动作进行评分,将稀疏的终端奖励细化为密集的逐步骤过程信号。第2.1节将游戏形式化为强化学习问题,并指出仅基于结果的RLVR为何存在局限。第2.2节引入求解器教师,构建其逐步骤分数,给出使其稳定并集成到训练中的完整流程,最后解释为何该分数等价于在线策略蒸馏(OPD,定理2.1)。
### 2.1 预备知识
##### 游戏视为多回合MDP。
我们将每个游戏形式化为一个有限时域马尔可夫决策过程(MDP)$\mathcal{M}=(\mathcal{S},\mathcal{A},P,r,H)$,时域为$H$。在回合$t$,LLM策略$\pi_\theta$观察状态$s_t\in\mathcal{S}$的文本渲染,采样动作$a_t\sim\pi_\theta(\cdot\mid s_t)$,环境通过$P(s_{t+1}\mid s_t,a_t)$转换,直到情节在某个步骤$T\leq H$终止,产生轨迹$\tau=(s_0,a_0,\ldots,s_T)$。对于推箱子和塞车,$s_t$是完整的棋盘;对于扫雷,$s_t$是*信息状态*(已揭示的棋盘加上其对隐藏地雷施加的约束),这是一个充分的统计量,使过程保持马尔可夫性质。奖励稀疏且可验证:$r_t=0$($t<T$),结束时的$r_T=1$(成功)或$0$(失败)。在这个MDP中,RLVR面临的核心挑战是信用分配:稀疏的终端奖励无法揭示哪些中间动作导致了成功或失败,这使得学习高效策略变得困难,尤其是在长期时域任务中。
##### 基于结果的信用分配。
考虑一个输出的模型训练,例如LLM推理链。为了将上文的MDP与LLM训练联系起来,我们可以将LLM的输出视为一系列动作。为了获得足够的多样性,我们为每个问题生成$G$个输出$\{o_i\}_{i=1}^G$。每个输出对应一个轨迹。当前最先进的方法GRPO(Shao et al., 2024(https://arxiv.org/html/2607.25308#bib.bib1))通过组内比较计算优势:
$$\hat{A}_i^{\text{outcome}} = \frac{r_T^{(i)} - \frac{1}{G}\sum_{j=1}^G r_T^{(j)}}{\text{std}(\{r_T^{(j)}\}_{j=1}^G) + \delta},$$
其中添加小常数$\delta>0$以保证数值稳定性。这个轨迹级标量被分配给轨迹的每个token,并通过一个裁剪的替代目标进行优化,其中$\pi_\theta$与$\pi_{\theta_{\text{old}}}$之间的重要性采样比$\rho_t$被裁剪到$[1-\varepsilon,1+\varepsilon]$:
$$\mathcal{J}_{\mathrm{GRPO}}(\theta)=\mathbb{E}_{q,\,\{o_i\}\sim\pi_{\theta_{\text{old}}}}\!\Bigg[\frac{1}{G}\sum_{i=1}^G\frac{1}{|o_i|}\sum_{t=1}^{|o_i|}\Big(\min\!\big(\rho_t\,\hat{A}_i,\,\operatorname{clip}(\rho_t,1-\varepsilon,1+\varepsilon)\,\hat{A}_i\big)-\beta_{\text{kl}}\,D_{\mathrm{KL}}\!\big[\pi_\theta\,\|\,\pi_{\text{ref}}\big]\Big)\Bigg].$$
瓶颈现在很明显:因为$\hat{A}_i=\hat{A}_i^{\text{outcome}}$仅由终端结果计算,轨迹中的每一回合都获得相同的信用。这种粗粒度的轨迹级信用是长期游戏中信用分配失败的根源,从而促成了下一节引入的回合级求解器信号。
### 2.2 求解器引导的回合级信用分配
参见图注
图2:方法概览。我们将GRPO的结果优势与来自回合级剩余代价变化的移位求解器优势相结合。
##### 来自求解器的逐步骤分数。
为了对每个动作单独评分,我们需要一种衡量当前状态好坏的方法。$0/1$终端奖励无法做到这一点,因为它只在结束时才有值。求解器可以做到,因为它可以从任何状态完成游戏。这一特性为任何求解器配备了一个通用度量,我们称之为**剩余代价**$N(s)$:从状态$s$达到获胜所需的最小工作量。其确切单位因游戏而异,但“离目标还有多远”的含义是普遍的:对于推箱子和塞车,$N(s)$是解决棋盘所需的最少动作数;对于扫雷,则是清除所有安全格子所需的最少揭示次数。一个自然的逐步骤分数是$N(s_t)-N(s_{t+1})$,即该动作导致的剩余代价下降。我们通过在RL中定义一个辅助的最短路径目标(每个动作$-1$,终端值为$0$)并设置$V^{\pi_{\text{Solver}}}(s)=-N(s)$来将该分数建立在RL基础上,这使得更接近目标的状态具有更高价值。
$$
Q^{\pi_{\text{Solver}}}(s_t,a_t) = -1 + \mathbb{E}_{s_{t+1}}[V^{\pi_{\text{Solver}}}(s_{t+1})],\quad\text{且}\quad V^{\pi_{\text{Solver}}}(s_t)=-N(s_t)
$$
$$
A^{\pi_{\text{Solver}}}(s_t,a_t) = -1 + N(s_t) - \mathbb{E}_{s_{t+1}}[N(s_{t+1})].
$$
优势$A=Q-V$衡量了一个特定动作相比求解器策略下期望结果的优势程度。$\mathbb{E}_{s_{t+1}}$是对环境转换的期望;对于本文研究的确定性游戏,它简化为单个结果状态,我们保留期望以保持一般性。
##### 移位使进展映射到正信用。
在求解器的最优策略下,期望的下一个状态剩余代价$\mathbb{E}_{s_{t+1}}[N(s_{t+1})]$等于$N(s_t)-1$,因为求解器总是恰好减少一个剩余步骤。代入公式(4)得到$A^{\pi_{\text{Solver}}}=-1+(N(s_t)-(N(s_t)-1))=0$:最优动作的优势为零,任何未能将剩余代价减少一整步的次优动作都会得到负分。这使得原始优势非正,作为信号不方便。移位$+1$给出了**移位求解器优势**:
$$
\widetilde{A}^{\pi_{\text{Solver}}}(s_t,a_t)=A^{\pi_{\text{Solver}}}(s_t,a_t)+1=N(s_t)-\mathbb{E}_{s_{t+1}}[N(s_{t+1})],
$$相似文章
@SharonYixuanLi:扩展基于结果的强化学习无法解决长周期智能体任务。信用分配是瓶颈,而轮次级奖励…
TRACE 提出了一种轮次级奖励分配方法,利用冻结参考模型的对数概率和时间差分学习来解决长周期智能体任务中的信用分配问题,在没有评论家或过程标签的情况下,在搜索基准测试中取得了显著改进。
LeAct:从专家动作中学习推理
LeAct 提出了一种方法,通过将链式思维(CoT)视为潜在变量,仅保留那些能显著提高学生复现专家动作概率的 CoT,从而从静默专家动作中恢复链式思维推理。在游戏和机器人任务中,该方法优于各类基线。
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。
评估SageMath增强的LLM智能体在计算与实验数学中的应用
本文提出了一种ReAct风格的智能体设置,将LLM推理与SageMath的可验证反馈相结合,并在研究级数学问题上进行了评估。结果显示,各模型性能显著提升,其中GPT-5.5取得了最高的75.2%解题率。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。