训练连续思维链模型:两种机制的故事

arXiv cs.AI 论文

摘要

本文介绍了C-MTP,一种用于训练连续思维链模型的直接监督方法,该方法将推理轨迹压缩为潜在表示。该方法在简单任务上表现良好,但揭示了直接和间接监督方法在处理复杂长推理轨迹时均存在困难,性能下降约65%。

arXiv:2607.16972v1 公告类型:新 摘要:连续思维链方法用短序列的密集潜在表示替换冗长的推理轨迹。早期的连续CoT方法间接监督潜在表示,使其最终状态与冗长推理轨迹匹配,需要在训练过程中进行自回归、缓慢的生成。我们引入C-MTP,一种更简单、更快速的直接监督方法,将每个潜在变量建模为待压缩的CoT轨迹中嵌入的平均值。我们的方法优于先前近似压缩令牌分布的直接监督方法,并在现有简化CoT轨迹(少于100个令牌)的评估设置中与较慢的间接监督方法表现相当。最后,我们将连续CoT方法的评估扩展到具有更长推理轨迹($\ge$ 数百个推理令牌)的复杂任务。我们发现直接和间接监督训练方法在此设置下表现不佳(性能下降约65%),揭示了当前连续CoT方法的局限性。代码和检查点已发布在 https://github.com/Varun221/cmtp_research
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:41

# 训练连续思维链模型:两种机制的对比研究 来源:https://arxiv.org/html/2607.16972

###### 摘要

连续思维链方法将冗长的推理过程替换为一段短小的密集潜在表示序列。早期的连续CoT方法间接监督这些潜在表示,使其最终状态与冗长的推理轨迹匹配,因此在训练期间需要自回归的慢速生成。我们提出C-MTP,一种更简单、更快速的直接监督方法,它将每个潜在表示建模为要压缩的CoT轨迹中嵌入的平均值。我们的方法优于先前一种近似压缩token分布的监督方法,并在使用简化CoT轨迹(少于100个token)的现有评估设置中,与较慢的间接监督方法性能相当。最后,我们将连续CoT方法的评估扩展到具有较长推理轨迹(≥数百个推理token)的复杂任务。我们发现,在这种设置下,直接和间接监督训练方法均表现不佳(性能下降约65%),揭示了当前连续CoT方法的局限性。代码和检查点已发布于https://github.com/Varun221/cmtp_research。

机器学习,ICML

参见图注

图1:在三种具有不同CoT轨迹的数据集上,标准CoT微调与两种连续CoT训练方法(直接监督:C-MTP(我们提出的方法)和间接监督:CODI)的正面比较。*结构化*包含约25个token的紧凑数学表达式,*半自然*包含每步解释的句子(约62个token),而*真实*则捕获来自现成LLM的轨迹(平均约350个token)。两种方法在结构化/半自然轨迹上均与CoT-SFT竞争,但在真实轨迹上性能骤降至其准确率的约35%。

## 1 引言

近期的大语言模型通过生成描述其推理过程的长序列token(通常称为思维链轨迹)(Wei等人,2022b;Kojima等人,2022),在复杂推理任务上取得了显著性能,扩展了LLM的表达能力(Merrill和Sabharwal,2024)。然而,自回归地生成长CoT轨迹会显著增加计算成本。连续思维链(ContinuousCoT)由Hao等人(2025)开创,允许LLM完全在一段短小的密集潜在表示中进行推理,无需离散的“思考”token,从而大幅减少推理长度,进而降低推理计算量。当前方法在结构化图搜索任务(如ProsQA(Hao等人,2025)和ProntoQA(Saparov和He,2023))上超越了离散CoT的性能,并在数学推理任务(Cobbe等人,2021;Deng等人,2024)上表现出具有竞争力的性能(约10%的性能下降)。这些方法(Shen等人,2025;Wei等人,2026)训练模型自回归地预测中间潜在表示,并使用CoT教师来监督最终输出。这使得模型能够将不同长度的CoT轨迹压缩为固定数量的潜在表示。训练所需的顺序自回归过程使得计算开销很大。由于这些方法间接使用思维链轨迹,我们将其称为使用**间接监督**。这些方法从一个预训练的离散token LLM开始,并进行微调以预测潜在表示,然后将这些表示反馈给模型进行固定步数的处理。最近的工作CoLaR(Tan等人,2026)通过将潜在表示建模为参数化的高斯分布(该分布以从CoT教师聚合的token嵌入为条件)来缓解这一问题。这使得训练目标可以并行化,并使训练分布更接近预训练分布。然而,模型必须预测潜在空间上的分布,这带来了优化挑战。由于该方法直接使用CoT轨迹进行训练和预测,我们将其称为使用**直接监督**的方法。与间接监督方法不同,直接监督方法支持并行训练。在这项工作中,我们引入了一种新的直接监督方法:**C-MTP**,它通过多token预测来模拟潜在推理。我们将中间潜在表示形式化为思维链中聚合的token嵌入,训练模型预测组成每个潜在表示的token,而不是预测一个连续向量。这与预训练目标保持一致,同时通过教师强制在CoT轨迹上实现完全并行训练,消除了对顺序自回归过程的需要。我们的评估表明,C-MTP由于其简单性和与预训练目标的对齐,显著优于现有的直接监督方法。对于小型结构化推理轨迹,C-MTP比间接监督方法更快、更节省样本,并且对分布外问题具有更好的泛化能力(第4.2.1节和第4.2节)。在冗长的半自然CoT上,我们发现间接监督优于直接监督,这主要是因为其循环训练将长推理轨迹压缩为少量潜在表示,而直接监督则受限于原始轨迹长度,并且在推理时在教师强制下会遭受错误累积。最后,在迁移到来自强教师的真实CoT轨迹时,两种机制都远不及CoT-SFT。这表明,当前基准测试中占主导地位的结构化CoT评估夸大了连续CoT方法的实际效用。我们总结贡献如下:

- • 我们提出了**C-MTP**,一种新颖的直接监督框架,使用多token预测来模拟连续潜在推理。
- • 在结构化推理任务上,C-MTP优于现有的直接监督方法,并与间接监督方法性能相当或更优,同时速度更快、更节省样本,并且对分布外问题具有更好的泛化能力。
- • 我们对结构化、半自然和真实的CoT轨迹机制进行了系统性的实证比较,表明间接监督通过其压缩目标在冗长的半自然轨迹上超越了直接监督,并且在真实轨迹上,两种机制都远不及CoT-SFT,暴露了连续CoT方法的局限性。

## 2 相关工作

思维链(CoT)(Wei等人,2022b;Kojima等人,2022)已找到广泛的应用。它提高了自一致性(Wang等人,2023b),通过分解简化了复杂问题的求解(Zhou等人,2023),促进规划(Wang等人,2023a),自动化演示生成(Zhang等人,2023),并增强了监督微调(Wei等人,2022a;Chung等人,2024;Zelikman等人,2022;Hsieh等人,2023)。这些进展最终催生了近期的“思考”模型(Guo等人,2025;OpenAI,2026)。连续CoT,或称潜在推理,包含多种方法。COCONUT(Hao等人,2025)开创了使用潜在表示进行自回归生成的先河,并启发后续研究。形式化分析(Zhu等人,2025a;Zou等人,2026;Xu和Sato,2025)展示了其在特定场景下相对于显式CoT的理论优势。在此背景下,*潜在表示*可以编码多个解决方案轨迹(Gozeten等人,2025;Zhang等人,2025b;Wu等人,2025b;Tang等人,2026;Butt等人,2025),通过填充token提供额外计算(Pfau等人,2024;Goyal等人,2024),或使用循环迭代(Saunshi等人,2025;Fu等人,2025;Zeng等人,2026;Zhu等人,2025b;Geiping等人,2025)。在这项工作中,我们通过间接监督(Shen等人,2025;Wei等人,2026)和直接监督(Tan等人,2026;Cheng和Durme,2024)两种方式,利用潜在表示来编码中间推理步骤。与此同时,该领域正在推动新颖的训练架构(Wu等人,2025a;Shao等人,2025)以及能够自适应地在潜在推理和基于token生成之间切换的混合模型(Shi等人,2026;Yue等人,2025;Xu等人,2026;Zhu等人,2026;Zhang等人,2025a)。我们的工作强调了这种自适应性的必要性。最后,虽然多token预测(MTP)改进了预训练(DeepSeek-AI和团队,2025;Gloeckle等人,2024),加速了推测解码(Cai等人,2024),并且可以通过自蒸馏学习(Zhao等人,2026),但在潜在推理的上下文中,它基本上仍未被探索。

## 3 方法论

### 3.1 符号与问题设置

考虑一个大语言模型 \(M_\theta\)。设 \(\mathcal{V}\) 为其词汇表,\(E \in \mathbb{R}^{|\mathcal{V}| \times d}\) 为嵌入矩阵。给定一个输入提示 \(Q = (q_1, q_2, \ldots, q_m) \in \mathcal{V}^m\),我们将嵌入后的提示记为 \(E(Q) = (e(q_1), e(q_2), \ldots, e(q_m))\),其中 \(e(q_i) \in \mathbb{R}^d\)。给定一个提示,我们可以从学生模型 \(M_\theta\) 获得最终位置处的最终层隐藏状态,该函数记为 \(H_\theta(\cdot) \in \mathbb{R}^d\)。假设对于给定的提示,我们有 \(K\) 个推理步骤。将它们记为 \(y := (y_1, y_2, \ldots, y_K)\)。每个 \(y_i = (y_{i1}, y_{i2}, \ldots, y_{iL_i}) \in \mathcal{V}^{L_i}\),其中 \(L_i\) 是第 \(i\) 个文本推理步骤的token长度。最后,我们将答案记为 \(a = (a_1, a_2, \ldots, a_n) \in \mathcal{V}^n\)。标准的CoT监督微调优化以下目标:

\[
L_{CoT} = -\log P_\theta(a \mid Q, y_1, y_2, \ldots, y_K) \tag{1}
\]

其中 \(P_\theta(\cdot)\) 是学生模型 \(M_\theta\) 定义的概率分布(通过 \(H_\theta(\cdot)\) 和词汇表上的softmax得到)。连续CoT旨在用一列密集的潜在表示替换文本推理向量,记为 \(z := (z_1, z_2, \ldots, z_K)\) ***注意,潜在表示的数量不必等于问题的推理步骤数。这里为了简单,我们考虑相等的情况。***,通过以下方式获得:

\[
z_k = H_\theta(I^{(k-1)}) \quad I^{(k)} = I^{(k-1)} \oplus z_k \tag{2}
\]

其中 \(I^{(0)} = E(Q)\) 是嵌入后的输入提示,每个 \(z_i \in \mathbb{R}^d\)。\(\oplus\) 表示沿序列轴的拼接。因此,连续思维链被定义为连续向量序列 \(z := z_1, z_2, \ldots, z_K\)。所有连续CoT方法的主要目标是设计一个有效的训练方案来学习 \(z\),使得最终答案 \(a\) 可以仅基于 \(z\) 和 \(Q\) 生成。

表1:连续CoT训练的间接和直接监督机制比较。间接方法通过循环重用模型自身的最终层激活,生成连续的潜在表示。直接方法则将预测通过嵌入表映射,将输出约束到token空间。对于间接方法,推理长度(循环潜在步数)是在训练前设置好的固定超参数,而直接方法则通过教师强制在可变长度的CoT轨迹上操作。

### 3.2 先前工作:间接监督方法

Coconut(Hao等人,2025)使用基于课程的学习策略,在每次迭代中,从 \(i=0\) 开始,将其中一个文本推理步骤 \(y_i\) 替换为相应的潜在表示 \(z_i\)。在每一步 \(i\) 优化以下目标:

\[
L_i = -\log P_\theta(a \mid Q, z_1, \ldots, z_i, y_{i+1}, \ldots, y_K) \tag{3}
\]

这逐步教会 \(M_\theta\) 生成语义上有用的潜在表示,并最终仅基于这些潜在表示来回答。CODI(Shen等人,2025)通过用蒸馏替换课程训练,提高了训练效率。学生模型 \(M_\theta\) 在训练期间自回归生成 \(K\) 个潜在表示。使用这些潜在表示,它被训练来生成答案。

\[
L_{Student} = -\log P_\theta(a \mid Q, z_1, z_2, \ldots, z_K) \tag{4}
\]

教师模型 \(M_\phi\)(用 \(\theta\) 进行热启动)使用标准的CoT轨迹(公式(1)†††Shen等人(2025)使用多任务训练,学生和教师共享相同的权重。我们在附录F.1中更详细地看到了其效果。)进行训练。\(M_\phi\) 的中间层激活被蒸馏到 \(M_\theta\),以指导学生的训练,显著提高了训练效率和下游性能。

\[
L_{KD} = \frac{1}{M} \sum_{l=1}^D \|sg[h_\phi^l] - h_\theta^l\| \tag{5}
\]

其中 \(D\) 是模型的层数,\(sg\) 表示停止梯度,\(h^l\) 表示第 \(l\) 层。

相似文章

基于代理上下文的链式思维微调长上下文推理

arXiv cs.CL

提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。

推理模型难以控制其思维链,但这其实是好事

OpenAI Blog

OpenAI的研究人员研究了推理模型是否能故意隐藏其思维链以逃避监控,发现当前模型即使知道自己被监控,也难以控制自己的推理过程。他们推出了CoT-Control,一个包含超过13,000个任务的开源评估套件,用于衡量推理模型中思维链的可控性。