隐式思维链推理的结构化过程监督

arXiv cs.AI 论文

摘要

本文提出了原型中介过程监督(PMPS),用于隐式思维链推理,实现了token压缩并提高了显式思维链方法的准确性。

arXiv:2609.09928v1 宣布类型:新 摘要:隐式推理方法通过用紧凑的连续空间嵌入替代冗长的显式思维链token,提高了token级别的效率和鲁棒性。然而,现有方法缺乏对这些隐式嵌入的直接过程监督,这常常导致表示崩溃和信息分布不均。为了解决这个问题,我们提出了原型中介过程监督(PMPS),它引入可学习的推理原型作为语义锚点,为隐式推理提供结构化的过程级监督。PMPS将隐式嵌入和显式思维链嵌入投影到共享的原型空间中,通过原型分配实现不等长表示之间的多对多软对齐。同时,我们引入了渐进序列对齐(PSA)模块来进一步指导训练:位置先验最初鼓励序列对齐结构,然后逐渐放松以允许自适应匹配。实验结果显示,PMPS在GSM8K-Aug上将输出token长度压缩到显式思维链的50%以下。与领先的基线SIM-CoT相比,我们的方法在不同模型族上平均准确度提高了2.08%。在GPT-2上,PMPS甚至超过了CoT-SFT。在更大模型和更具挑战性的任务上,PMPS在所有隐式推理方法中始终获得最高的准确度,且输出长度相当。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:42

# 潜在链式思维推理的结构化过程监督
来源:https://arxiv.org/html/2609.09928
徐晨††thanks:通讯作者所属单位:淘宝与天猫集团电子邮箱:[yuwangsjtu@sjtu\.edu\.cn](mailto:)陈菊所属单位:淘宝与天猫集团电子邮箱:[huaisong\.cx@taobao\.com](mailto:)姚江超所属单位:淘宝与天猫集团李朝阳所属单位:淘宝与天猫集团蓝劲松所属单位:淘宝与天猫集团朱小勇郑峥王宇11footnotemark:1所属单位:上海交通大学所属单位:淘宝与天猫集团

###### 摘要

潜在推理方法通过将冗长显式的链式思维(CoT)令牌替换为紧凑的连续空间嵌入,提升了令牌级效率和鲁棒性。然而,现有方法缺乏对这些潜在嵌入的直接过程监督,常导致表示崩塌和信息分布不均。为此,我们提出原型中介过程监督(PMPS),引入可学习的推理原型作为语义锚点,为潜在推理提供结构化过程级监督。PMPS将潜在嵌入和显式CoT嵌入投影到共享原型空间,通过原型分配实现不等长表示的多对多软对齐。同时,我们引入渐进式序列对齐(PSA)模块进一步指导训练:位置先验初始鼓励序列对齐结构,随后逐步放松以允许自适应匹配。实验结果表明,PMPS在GSM8K-Aug数据集上将输出令牌长度压缩至显式CoT的50%以下。与领先的基线SIM-CoT相比,我们的方法在不同模型系列上平均准确率提升2.08%。在GPT-2模型上,PMPS甚至超越CoT-SFT。在更大规模模型和更具挑战性的任务中,PMPS在输出长度相当的所有潜在推理方法中持续取得最高准确率。

## 1引言

参考图片图1:不同CoT方法的比较。我们提出的PMPS对所有潜在嵌入提供过程监督。为克服大语言模型(LLMs)在数学推理和逻辑推理等复杂任务中展现出的显著推理能力(Achiam等人,2023 (https://arxiv.org/html/2609.09928#bib.bib1);Grattafiori等人,2024 (https://arxiv.org/html/2609.09928#bib.bib2);Comanici等人,2025 (https://arxiv.org/html/2609.09928#bib.bib3);Yang等人,2025 (https://arxiv.org/html/2609.09928#bib.bib4);Liu等人,2025 (https://arxiv.org/html/2609.09928#bib.bib5);Zeng等人,2026 (https://arxiv.org/html/2609.09928#bib.bib6)),尤其在使用链式思维(CoT)提示技术时(Wei等人,2022 (https://arxiv.org/html/2609.09928#bib.bib7))。然而,显式CoT推理存在多重局限,包括推理效率低和表达能力受限(Chen等人,2025 (https://arxiv.org/html/2609.09928#bib.bib12);Li等人,2025b (https://arxiv.org/html/2609.09928#bib.bib13);Zhu等人,2025 (https://arxiv.org/html/2609.09928#bib.bib14)),这促使研究者探索更高效灵活的推理范式。为克服显式CoT的局限,研究者提出了在潜在空间而非语言空间执行推理的潜在推理方法(Li等人,2025a (https://arxiv.org/html/2609.09928#bib.bib17);Zhang等人,2025 (https://arxiv.org/html/2609.09928#bib.bib15);Tan等人,2025 (https://arxiv.org/html/2609.09928#bib.bib18))。与显式CoT相比,潜在推理具有三大优势:(1)效率:用紧凑隐藏状态替代冗长CoT令牌,大幅降低推理成本。(2)表达能力:连续高维表示突破离散令牌瓶颈,编码更丰富的语义信息,这是自然语言无法忠实捕捉的(Deng等人,2024 (https://arxiv.org/html/2609.09928#bib.bib16);Hao等人,2024 (https://arxiv.org/html/2609.09928#bib.bib9);Deng等人,2026 (https://arxiv.org/html/2609.09928#bib.bib19))。(3)可控性:推理长度和隐式CoT可通过预设潜在令牌数量控制。尽管具有这些优势,现有潜在推理方法仍存在关键局限。如图1 (https://arxiv.org/html/2609.09928#S1.F1)所示,CODI(Shen等人,2025 (https://arxiv.org/html/2609.09928#bib.bib8))仅通过最终答案优化潜在嵌入,导致中间推理过程未受指导,常引发表示崩塌。SIM-CoT(Wei等人,2025 (https://arxiv.org/html/2609.09928#bib.bib10))通过辅助解码器在固定数量的潜在嵌入和可变长度CoT步骤间建立一对一对齐来缓解这种崩塌。该设计引入与基础模型相同架构的解码器,不仅增加训练开销,还因过度压缩推理步骤而引入信息瓶颈,同时剩余嵌入未受监督。实证实验(图3 (https://arxiv.org/html/2609.09928#S4.F3))揭示了现有方法中普遍存在的两种表示崩塌:奇偶崩塌(奇偶位置的嵌入崩塌为两个交替组)和尾部崩塌(最后几个嵌入变得几乎相同)。

为解决上述局限,我们提出原型中介过程监督(PMPS),这是一个为潜在推理提供结构化过程监督的新框架。我们引入可学习的推理原型作为语义锚点,并将潜在嵌入和显式CoT嵌入投影到统一的原型空间,对潜在表示施加结构化的语义组织。通过基于Sinkhorn-Knopp(Cuturi, 2013 (https://arxiv.org/html/2609.09928#bib.bib11))的软分配,我们建立潜在与CoT表示之间的多对多对齐,并制定双向交叉预测损失,迫使每个潜在嵌入捕获差异化的推理语义。此外,我们引入渐进式序列对齐(PSA)模块,应用高斯位置先验对匹配施加序列结构,然后通过余弦退火逐步放松约束以允许自适应对齐。重要的是,所有组件仅在训练时使用,训练开销可忽略,推理成本为零。

大量实验证明了PMPS的有效性。在GSM8K-Aug数据集上,相对于显式CoT,PMPS在GPT-2上将推理长度减少超过50%的同时将准确率提升3.96%,并分别超越CODI和SIM-CoT基线4.33%和2.86%。PMPS在不同模型系列、规模和更具挑战性的任务中,持续优于所有潜在推理基线。总之,我们的主要贡献可总结如下:
- •我们提出PMPS,这是首个为潜在推理引入结构化过程级监督的框架。PMPS通过基于原型的双向交叉预测目标在潜在和显式CoT嵌入间建立软对齐,有效缓解表示崩塌。
- •为利用推理的序列结构,我们引入PSA,它采用高斯位置先验与余弦退火指导早期序列对齐并逐步放松约束,在结构偏好与灵活性之间取得平衡,实现自适应匹配。
- •在多样基准和模型规模上的大量实验表明,PMPS在保持推理效率的同时持续优于领先的潜在推理基线,证实了其强有效性和广泛泛化能力。

## 2相关工作

### 2\.1大语言模型中的潜在推理

链式思维(CoT)提示(Wei等人,2022 (https://arxiv.org/html/2609.09928#bib.bib7))提升了LLM推理能力,但推理成本随冗长推理长度显著增加,推动了在连续隐藏状态空间中进行推理的研究。iCoT(Deng等人,2024 (https://arxiv.org/html/2609.09928#bib.bib16))和Coconut(Hao等人,2024 (https://arxiv.org/html/2609.09928#bib.bib9))通过课程学习逐步用潜在嵌入替代显式CoT令牌。CODI(Shen等人,2025 (https://arxiv.org/html/2609.09928#bib.bib8))通过在答案位置进行教师-学生蒸馏来稳定训练。SIM-CoT(Wei等人,2025 (https://arxiv.org/html/2609.09928#bib.bib10))通过辅助解码器在CoT步骤和潜在嵌入间强制执行严格的一对一分配。CoLaR(Tan等人,2025 (https://arxiv.org/html/2609.09928#bib.bib18))和Latent-SFT(Deng等人,2026 (https://arxiv.org/html/2609.09928#bib.bib19))将连续的CoT令牌序列压缩为单个潜在嵌入。然而,这些方法要么缺乏直接的推理监督,要么在CoT与潜在嵌入间强制执行过于严格的对应关系,限制了潜在表示的表达能力。我们提出PMPS通过结构化的原型中介软对齐来解决这些局限,无需辅助解码器也无需硬性CoT分区。

### 2\.2过程监督与基于原型的表示学习

过程奖励模型(Lightman等人,2024 (https://arxiv.org/html/2609.09928#bib.bib20))表明,与仅使用结果奖励相比,步骤级正确性标签能产生更好的推理验证器,后续工作通过蒙特卡洛树搜索自动化此类监督(Wang等人,2024 (https://arxiv.org/html/2609.09928#bib.bib21))。然而,现有过程监督方法需要显式的离散推理步骤,与连续潜在嵌入不兼容。同时,来自视觉自监督学习的SwAV(Caron等人,2020 (https://arxiv.org/html/2609.09928#bib.bib22))和PCL(Li等人,2020 (https://arxiv.org/html/2609.09928#bib.bib23))表明,可学习原型能有效组织嵌入空间,无需负样本对。知识蒸馏方法(Sun等人,2019 (https://arxiv.org/html/2609.09928#bib.bib32);Wang等人,2020 (https://arxiv.org/html/2609.09928#bib.bib33))对齐教师-学生表示,但通常假设序列长度匹配。我们的工作通过利用原型为不同数量的潜在嵌入和CoT嵌入提供多对多结构化过程级监督来桥接这些领域,并辅以教师在答案位置的蒸馏以确保结果级对齐。

参考图片图2:PMPS框架概览。训练期间,PMPS采用常规的并行教师-学生架构,并利用教师任务的显式CoT嵌入,通过原型空间中的双向交叉预测损失监督学生任务的潜在嵌入。推理时,仅执行学生任务,进行潜在推理,无额外开销。

## 3方法

本节介绍我们所提框架的技术细节。我们首先回顾常规的自蒸馏框架。然后引入PMPS,它为潜在嵌入提供结构化过程级监督。最后,描述PSA模块,它应用课程调度的位置先验来指导训练期间的序列对齐结构。我们框架的概览如图2 (https://arxiv.org/html/2609.09928#S2.F2)所示。

### 3\.1预备知识

为获得与模型内在分布对齐的高质量显式链式思维(CoT)嵌入作为监督信号,我们采用广泛使用的自蒸馏框架(Zhang等人,2019 (https://arxiv.org/html/2609.09928#bib.bib36);Liao等人,2023 (https://arxiv.org/html/2609.09928#bib.bib35);Liu等人,2026 (https://arxiv.org/html/2609.09928#bib.bib34))作为基础架构。在此框架内,模型针对两个任务进行联合优化:执行显式CoT推理的教师任务和执行目标潜在推理范式的学生任务。受CODI(Shen等人,2025 (https://arxiv.org/html/2609.09928#bib.bib8))启发,我们在答案令牌位置对齐教师和学生任务的隐藏状态。此基础架构的目标函数表述为:

Lbase=Lcestu\+Lcetea\+Ldist\\mathcal\{L\}\_\{\\text\{base\}\}=\\mathcal\{L\}\_\{ce\}^\{stu\}\+\\mathcal\{L\}\_\{ce\}^\{tea\}\+\\mathcal\{L\}\_\{dist\}\(1\)其中Lcestu\\mathcal\{L\}\_\{ce\}^\{stu\}和Lcetea\\mathcal\{L\}\_\{ce\}^\{tea\}分别是学生答案预测和教师全序列预测的交叉熵损失,Ldist\\mathcal\{L\}\_\{dist\}是平滑L1损失,用于在答案令牌处对齐教师和学生隐藏状态。然而,仅依赖此基础架构缺乏对潜在嵌入的过程级监督,可能导致潜在同质化和表示崩塌。

### 3\.2原型中介过程监督

为缓解缺乏过程监督导致的表示崩塌,我们提议利用教师任务的CoT嵌入作为监督信号。这些显式CoT嵌入是合适目标,原因有二:(1)Lcetea\\mathcal\{L\}\_\{ce\}^\{tea\}损失确保它们编码高质量、语义有意义的推理信息;(2)由于显式CoT嵌入和潜在嵌入由同一模型生成,它们本质上共分布,有利于更有效的知识迁移。

然而,直接的一对一蒸馏不可行,因为潜在嵌入数量NlN\_\{l\}远小于CoT令牌数量NcN\_\{c\}。因此,我们提出原型中介过程监督(PMPS),引入KK个可学习原型向量P=\{p1,...,pK\}∈RK×d\\mathbf\{P\}=\\\{\\mathbf\{p\}\_\{1\},\\ldots,\\mathbf\{p\}\_\{K\}\\\}\\in\\mathbb\{R\}^\{K\\times d\}作为共享语义锚点,介导两组表示之间的软多对多对齐,对潜在空间施加结构化的语义组织。令Hl=\{l1,...,lNl\}∈RNl×D\\mathbf\{H\}\_\{l\}=\\\{\\mathbf\{l\}\_\{1\},\\ldots,\\mathbf\{l\}\_\{N\_\{l\}\}\\\}\\in\\mathbb\{R\}^\{N\_\{l\}\\times D\}和Hc=\{c1,...,cNc\}∈RNc×D\\mathbf\{H\}\_\{c\}=\\\{\\mathbf\{c\}\_\{1\},\\ldots,\\mathbf\{c\}\_\{N\_\{c\}\}\\\}\\in\\mathbb\{R\}^\{N\_\{c\}\\times D\}分别表示潜在嵌入和显式CoT嵌入,其中DD为隐藏维度,dd为原型维度。

投影与评分。一个共享的带批归一化的两层MLP作为投影头g⁡\(⋅\)g\(\\cdot\),将Hl\\mathbf\{H\}\_\{l\}和Hc\\mathbf\{H\}\_\{c\}从原始隐藏空间投影到原型空间,随后进行l2\\ell\_\{2\}归一化:

z=g⁡\(h\)/‖g⁡\(h\)‖2\\mathbf\{z\}=g\(\\mathbf\{h\}\)/\\\|g\(\\mathbf\{h\}\)\\\|\_\{2\}\(2\)其中h\\mathbf\{h\}表示潜在嵌入或显式CoT嵌入。每个单位特征向量z\\mathbf\{z\}通过内积s=z⊤pks\_\{k\}=\\mathbf\{z\}^\{\\top\}\\mathbf\{p\}\_\{k\}与l2\\ell\_\{2\}-归一化的原型进行评分,得到得分矩阵Sl∈RNl×K\\mathbf\{S\}\_\{l\}\\in\\mathbb\{R\}^\{N\_\{l\}\\times K\}和Sc∈RNc×K\\mathbf\{S\}\_\{c\}\\in\\mathbb\{R\}^\{N\_\{c\}\\times K\}。

原型分配。为获得软分配同时防止原型崩塌,我们应用Sinkhorn-Knopp算法(Cuturi, 2013 (https://arxiv.org/html/2609.09928#bib.bib11))来强制等分约束。给

相似文章

训练连续思维链模型:两种机制的故事

arXiv cs.AI

本文介绍了C-MTP,一种用于训练连续思维链模型的直接监督方法,该方法将推理轨迹压缩为潜在表示。该方法在简单任务上表现良好,但揭示了直接和间接监督方法在处理复杂长推理轨迹时均存在困难,性能下降约65%。

基于代理上下文的链式思维微调长上下文推理

arXiv cs.CL

提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。

SuperThoughts:叠加态中的推理令牌

arXiv cs.LG

SuperThoughts 将连续的思维链令牌压缩为潜在表示,并每步解码两个令牌,在数学推理基准上实现了约20-30%的思维链长度缩减,准确率损失极小,同时将推理吞吐量提高了一倍。