LeAct:从专家动作中学习推理

arXiv cs.CL 论文

摘要

LeAct 提出了一种方法,通过将链式思维(CoT)视为潜在变量,仅保留那些能显著提高学生复现专家动作概率的 CoT,从而从静默专家动作中恢复链式思维推理。在游戏和机器人任务中,该方法优于各类基线。

arXiv:2607.21856v1 Announce Type: cross 摘要:现代推理模型依赖于推理数据,这些数据目前来自人工标注或从更强的 LLM 中蒸馏得到。然而,一个丰富且尚未充分利用的监督来源在于专家系统(例如游戏引擎、经典规划器、定理证明器),它们能在多种领域中常规地生成近乎最优的动作。但这些专家是“沉默”的:它们在执行动作时不会写下背后的链式思维(CoT)。以自然语言推理的形式恢复该 CoT,可以将专家知识蒸馏到一个能够泛化到演示动作之外的学生模型中。我们将 CoT 视为一个潜在变量,并研究如何仅从动作中恢复它。我们的方法 LeAct(从动作中学习推理)优化了这个潜在变量:学生为每个专家动作采样候选 CoT,我们仅保留那些能够显著提高学生自身复现该动作概率的 CoT。在多个规模的不完美信息游戏以及一个模拟机器人基准测试中,LeAct 在小型可枚举游戏上达到了求解器的数值下限。在更大规模上,它比最强的专家迭代基线更接近求解器 $5$ 倍。在 Flop Hold'em(约 $10^9$ 个信息集)中,LeAct 以 $+60$ mbb/g 的优势直接获胜;在机器人探针任务中,它是唯一一个比直接模仿有所改进的训练方案。我们提出了一个原则性的框架,并得到了如下结果:专家系统成为基础模型的推理教师的一个全新来源。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:42

# LeAct: 从专家行动中学习推理 来源: https://arxiv.org/html/2607.21856 Ziran Yang Chengshuai Shi Raj Ghugare Benjamin Eysenbach Karthik Narasimhan Chi Jin 普林斯顿大学 ###### 摘要 现代推理模型依赖于推理数据,目前这些数据来自人工标注或从更强的LLM中蒸馏。然而,一个丰富且尚未充分开发的监督来源是专家系统(例如,游戏引擎、经典规划器、定理证明器),它们在各种领域中常规地产生近乎最优的行动。但这些专家是沉默的:它们只执行行动,而不写下背后的思维链(CoT)。恢复该思维链作为自然语言推理,可以将专家知识提炼到一个学生模型中,该模型能够在演示行动之外进行泛化。我们将CoT视为潜在变量,并研究如何仅从行动中恢复它。我们的方法LeAct(从行动中学习推理)优化了这个潜在变量:学生模型为每个专家行动采样候选CoT,我们保留那些能够可测量地提高自身恢复该行动概率的CoT。在多个规模的不完美信息游戏和一个模拟机器人基准测试中,LeAct在可枚举的小游戏上达到了求解器的数值下限。在更大规模上,它比最强的专家迭代基线更接近求解器5倍。在翻牌圈德州扑克(~10^9信息集)中,LeAct以+60 mbb/g的头对头优势获胜,在机器人探针任务中,它是唯一一种在直接模仿基础上有所改进的训练方案。我们提出了一个基于原则的框架和结果:专家系统成为基础模型推理教师的一个全新来源。

## 1 引言

构建思维链(CoT)数据现在已成为推理语言模型的关键瓶颈[33, 11]。大量工作试图通过自动标注CoT来超越人工标注,无论是通过从更强的LLM中蒸馏[14, 30, 11],还是通过自举模型自身的输出[59, 10, 37]。但这些方法很少直接闭环在CoT本身。对合成CoT进行筛选通常针对答案的正确性或表面合理性。但CoT是否真正有助于学生的预测仍然不确定。

我们从一个不同的来源获取:沉默的行动专家(游戏求解器[62, 45, 5]、经典规划器、机器人规划器[46]、定理证明器[26])。每个专家在每个状态下执行近乎最优的行动,但行动及其背后的推理都不以自然语言表达。朴素的方法是要求学生LLM为每个专家行动编写一个CoT,但这会遇到合理化问题[50, 22]:CoT可能看似合理,但与它所伴随的行动没有因果联系。

我们转而直接闭环。对于每个状态-行动对,学生采样多个候选CoT,我们只保留那些提高学生自身恢复专家行动概率的CoT。这个筛选步骤是关键的:在我们的消融实验中,用随机排序替换它会消除优势。LeAct(从行动中学习推理)将这个思想实现为迭代训练流程(图1)。传统的“先推理后行动”范式[56]在推理时将推理作为输入并产生行动;LeAct在训练时反向运行这个循环,以专家行动为条件,采样能恢复它的推理,并训练那些通过筛选的推理。该配方接受任何仅提供行动的神谕:CFR求解器、深度RL策略、或执行单一演示轨迹的前沿LLM。我们测试了所有三类:在Leduc德州扑克[44]等可枚举扑克设置中的CFR求解器;在翻牌圈德州扑克(~10^9信息集)上的DeepCFR[5]策略;以及在模拟机器人基准测试[9]上的前沿LLM成功轨迹。

参考图注
图1: LeAct将沉默的行动专家转变为推理教师。对于每个状态x,学生以神谕的行动π*(·|x)为条件采样候选解释。我们保留那些提高学生预测行动概率的解释,并将其用作CoT来微调学生。

**贡献。** 我们做出三点贡献:一个非LLM的CoT监督新来源,一个算法的潜在变量推导,以及在多种游戏和机器人基准测试上的实证结果。

-   **非LLM的CoT监督数据来源。** 与其挖掘中间文本[37, 59],LeAct将来自任何非LLM神谕的结构化行动策略π*(·|x)转化为自然语言推理数据,这是一种与先前CoT流水线截然不同的监督模态。
-   **基于原则的算法(§3)。** 我们将CoT视为连接状态X和专家行动Y*~π*的潜在变量,并从这个视角推导出学习过程。E步简化为根据每个候选CoT对学生自身决策的帮助程度进行排序,M步将π*指定为SFT目标。LeAct属于最近的潜在EM自我改进系列[37],但将潜在变量锚定到外部专家行动,而不是模型自身产生的文本。
-   **实证结果(§5–6)。** 我们在多个规模的不完美信息游戏[20]和模拟机器人方块堆叠基准[9]上测试了LeAct。使用LeAct训练的学生在小游戏上与专家求解器匹配,在我们测试的大型游戏中击败了行为克隆和专家迭代基线,并且是我们机器人设置中唯一在直接模仿基础上有所改进的方案。优势在未见状态上仍然保持,我们将其归因于解释-选择步骤。

## 2 相关工作

**CoT监督中的闭环反馈缺口。** CoT监督的工作并不少:人类手动标注理由[55, 17],更强的LLM将其蒸馏到较小的学生[14, 30, 11],自我改进循环从模型自身产生的文本中挖掘潜在思想[59, 15, 58, 10, 42, 37]。但这些都无法提供一个闭环反馈信号,通过对照外部权威检查来决定哪些CoT值得训练。现有流水线要么完全跳过筛选(标注、蒸馏),要么根据单一可验证答案的二元正确性进行筛选[59, 10, 42],要么根据模型自身的似然进行筛选[37, 7]。每种情况中,监督信号要么不存在,要么是LLM内部的。LeAct填补了这个缺口:每个候选CoT只有在其可测量地提高学生恢复外部神谕行动的概率时才被保留,从而用LLM家族外部的监督来闭环。

**用于训练推理的外部可验证反馈。** 第二类工作使用外部神谕或验证器作为训练信号,而不是(或同时使用)LLM自身产生的文本。将生成器与外部检查器配对是一种长期的训练方案,涉及游戏结果、形式验证器和定理证明器[41, 29, 40, 48, 16, 34, 25, 26, 61, 23, 31]。在LLM推理文献中,这种信号有三种形式。在结果层面,带有可验证奖励的强化学习[39, 11, 19, 33, 13, 28, 18, 52]在最终答案与真实结果匹配时,对二元奖励运行RL。专家迭代[2]和拒绝采样微调[8, 57, 47]在SFT循环中使用相同的结果信号:采样候选,保留神谕认可的那些,对幸存者进行微调。在步骤层面,过程奖励模型[51, 24, 53, 60, 38]训练一个单独的验证器并将其应用于每个推理步骤。LeAct使用专家迭代信号的一个分级版本:每个候选CoT根据其提高学生对神谕完整行动分布的概率的程度进行评分,这是一个连续信号,在最优行动是混合的且没有单个token是正确答案的情况下起作用。以专家行动为条件对逆向CoT进行条件设置是一个事后重标记步骤[1, 27],将每个状态与模型已知为正确的结果重新配对。一个互补的线路将推理本身视为推理时的搜索[12, 43];LeAct在训练时起作用,选择哪些CoT样本成为监督,而不是如何部署它们。

## 3 方法

目标是将仅提供行动的神谕转化为用于训练LLM的思考轨迹。两个障碍:推理轨迹z从未被观察到,本质上是一个潜在变量;观察到的行动在结构化的游戏行动空间中,而非文本,模态不匹配。我们设计了一个闭环,将Ruan等人[37]的提议与评分框架调整到我们的行动监督范围,而不是文本回填。

### 3.1 问题形式化

**设置。** 我们考虑一个决策环境,其中状态x∈X来自感兴趣的任务,一个行动神谕(CFR求解器、经典规划器、可验证控制器或训练好的策略)提供每个状态的专家行动分布π*(·|x)。学生LLM遵循先推理后行动范式,在生成行动y之前生成中间思维链z;我们通过将z视为潜在推理变量并将联合分布分解为pθ(z,y|x)=pθ(z|x)pθ(y|x,z)来显式建模这一点。训练数据为{(xi, π*(·|xi))}i:我们观察到状态和专家策略,但没有推理轨迹。

**目标。** 最大化学生LLM下专家行动的边际对数似然,
J(θ) = E_x E_{y~π*(·|x)}[log pθ(y|x)], (1)
由于pθ(y|x)=∑_z pθ(z|x)pθ(y|x,z)对潜在自然语言轨迹进行边际化,因此难以处理。外部期望E_{y~π*}在M步(§3.3)中实现:当神谕暴露完整分布时,以闭式形式针对π*;当神谕只执行单个行动时,为Dirac质量。

### 3.2 从变分EM的角度看

**逆向提议和IWAE界。** 引入一个逆向提议q_{bwd}(z|x,y),通过提示LLM给定(x,y)生成CoT来实例化,并为每个状态抽取N个候选z1,...,zN ~ q_{bwd}(·|x,y)。N样本重要性加权界[7],我们记作L_N(θ),为:
J(θ) ≥ L_N(θ) := E_x E_{y~π*} E_{z1..N~q_{bwd}(·|x,y)}[log (1/N) ∑_{i=1}^N (pθ(zi,y|x) / q_{bwd}(zi|x,y))], (2)
它严格比标准ELBO紧,并且当N→∞时精确,对任何q_{bwd}成立,包括固定的LLM(这避免了N=1 ELBO所需的通过q_{bwd}的变分梯度)。Burda等人[7, 式8]表明,L_N(θ)的梯度是一个每个样本加权的SFT更新:
∇_θ L_N = E_x E_{y~π*} E_{z1..N~q_{bwd}} [∑_{i=1}^N w̃_i ∇_θ log pθ(zi,y|x)], (3)
其中归一化软权重w̃_i=w_i/∑_j w_j,权重w_i=pθ(zi,y|x)/q_{bwd}(zi|x,y),并且在每一轮内q_{bwd}保持为上轮参数的固定值,跨轮通过共享的M步演变。

相似文章

面向高效可控LLM推理的代理式思维链引导

Hugging Face Daily Papers

ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。

CoRA: 面向可靠思维链推理的置信度-理由对齐

arXiv cs.CL

本文介绍了CoRA,一种基于GRPO的强化学习框架,旨在将LLM的置信度与生成的理由对齐,以提高思维链推理的可靠性,在多个基准测试中将不对齐误差降低了高达26.51%。

LongAct:利用内在激活模式进行长上下文强化学习

Hugging Face Daily Papers

LongAct 提出了一种显著性引导的稀疏更新策略,通过选择性更新与查询和键向量中高幅值激活相关的权重来改进 LLMs 的长上下文推理能力,在 LongBench v2 上实现了约 8% 的提升。