在潜在空间中思考,在语言中解释:自解释潜在推理
摘要
本文介绍了SELR,一个统一的自解释潜在推理框架,它训练单个模型以执行高效推理,同时生成人类可读的解释,从而消除了对外部解码器的需要。
arXiv:2608.13570v1 公告类型:新
摘要:潜在推理已成为基于文本的链式思维(CoT)的强大替代方案,通过将冗长的推理压缩为紧凑的嵌入,显著提高了计算效率。然而,将推理压缩到潜在空间中会使思考变得不透明,阻碍其可解释性。当前方法存在明显的权衡:它们要么作为不可解释的“黑箱”(例如Coconut)运行,其中的潜在推理不可读,要么依赖单独的事后解码器来实现可解释性(例如Heima),引入了架构开销并将解释与实际推理过程解耦。在这项工作中,我们提出了一个统一的自解释潜在推理(SELR)框架,该框架训练单个模型以执行高效且本质上可解释的潜在推理。我们的核心贡献是一个新颖的多任务训练目标,同时优化两个目标:(1)答案损失,优化潜在推理轨迹以产生准确的最终答案;(2)CoT损失,明确训练同一模型将其自身的潜在表示解码回人类可理解的推理步骤。这种设计确保生成的潜在表示既任务有效又语义可解释,消除了对外部解码器的需要。我们在大型语言模型(LLMs)和视觉语言模型(VLMs)上验证了SELR的有效性,表明SELR在令牌效率和准确性方面优于基线,同时独特地提供了无需辅助模型的自包含可解释性。项目页面可在 https://jasondayuan.github.io/SELR/ 查看。
查看缓存全文
缓存时间: 2026/08/17 09:38
# 在潜在空间思考,用语言解释:自解释的潜在推理
来源:https://arxiv.org/html/2608.13570
###### 摘要
潜在推理已成为文本链式思考(CoT)的强大替代方案,通过将冗长的推理压缩为紧凑的嵌入,在计算效率上实现了显著提升。然而,将推理压缩到潜在空间会使思考过程变得不透明,阻碍了其可解释性。当前方法呈现出明显的权衡:它们要么作为不可解释的“黑箱”运行(例如 Coconut),其潜在推理对人类不可读;要么依赖独立的后验解码器来实现可解释性(例如 Heima),这增加了架构开销并将解释与实际推理过程解耦。在本文中,我们提出了一个统一的自解释潜在推理(SELR)框架,训练单一模型执行高效且内在可解释的潜在推理。我们的核心贡献是一种新颖的多任务训练目标,同时优化两个目标:(1) 优化潜在推理轨迹以产生准确最终答案的答案损失,以及 (2) 显式训练同一模型将其潜在表示解码回人类可理解推理步骤的 CoT 损失。此设计确保生成的潜在表示既对任务有效又具有语义可解释性,无需外部解码器。我们在大语言模型(LLMs)和视觉语言模型(VLMs)上验证了 SELR 的有效性,表明 SELR 相比基线在 token 效率和准确性上均表现卓越,同时独特地提供了无需辅助模型的自包含可解释性。项目页面:https://jasondayuan.github.io/SELR/ 。
机器学习,ICML
参见插图
图 1:SELR 框架演示。左(推理):图像和问题作为输入提供给 VLM,VLM 在潜在空间进行推理以生成潜在思考和最终答案。右(解码):生成的潜在思考随后作为输入反馈回同一 VLM,并附带解码提示。然后 VLM 解码自身的潜在思考,将其编码的信息呈现为人类可读的文本。
## 1 引言
大语言模型(LLMs)传统上被训练在 *语言空间* 中进行推理,其中它们通过文本链式思考(CoT)来阐述其思考过程(Wei 等人,2022 (https://arxiv.org/html/2608.13570#bib.bib2))。然而,这种离散的语言空间可能不是推理的最佳媒介:基于文本的 CoT 可能过于冗长,许多 token 服务于文本连贯性而非实际推理,并且从根本上受限于固定的离散词汇表。为了克服这些限制,一种在 *连续潜在空间* 中推理的新范式出现了(Hao 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib1)):模型可以通过将最后的隐藏状态(“连续思考”)直接反馈回模型作为下一个输入嵌入,绕过离散文本生成步骤,从而更有效地进行推理。这允许模型用连续 token 产生其思考过程,这些 token 可以编码更密集的信息,因为它们不再受离散嵌入空间的约束。这种范式在视觉语言模型(VLMs)中实现了独特的协同作用,因为它弥合了连续视觉嵌入与离散文本 token 之间的模态差距,允许模型以其原生连续格式处理视觉信息。因此,潜在空间推理模型有望比其基于文本的对应模型 *显著更节省 token*。
尽管有此前景,当前的潜在空间推理模型面临两大挑战。
第一个是 *缺乏监督*。虽然人类可以编写文本 CoT 步骤作为基于文本推理模型的监督来源,但我们无法用同样的方法监督潜在空间模型,因为这类连续思考没有人类可解释的“真实标准”。先前的工作探索了多阶段课程学习(Hao 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib1))等方法,逐步将思考过程从语言空间转移到潜在空间,但对于如何有效学习潜在空间推理,尚无公认的通用方法。
第二个问题是 *缺乏可解释性*。当潜在空间推理模型在潜在空间中产生其思考过程时,我们没有直接的方法来了解 *模型在“思考”什么*。尽管我们可以探测连续思考 token 以在模型的语言空间中找到最相似的文本 token(Hao 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib1)),但这每次只能解释一个 token,且人类可读性差。另一种被探索的方法(Shen 等人,2025a (https://arxiv.org/html/2608.13570#bib.bib3))通过训练一个独立的、事后解码器模型来实现可解释性,但这种分离的架构引入了显著的参数开销,并可能使解释与实际推理逻辑脱节,因为解释器与推理器是分离的。虽然思考的 token 效率是期望的,但我们在必要时会失去便捷理解模型推理路径的关键能力。
为了解决这些挑战,我们提出了一个统一的框架——自解释潜在推理(SELR),旨在同时解决监督和可解释性问题。我们的核心设计是一个 *多任务学习目标*,训练单一模型同时成为高效的潜在空间 *推理器* 和自身的潜在到语言 *翻译器*。具体而言,模型被训练同时优化两个目标:(1) 引导潜在推理产生正确最终答案的 *答案损失*,确保高推理性能;以及 (2) 显式训练 *同一模型* 将其自身潜在表示解码回人类可理解推理步骤的 *CoT 损失*。此过程的演示见图 1 (https://arxiv.org/html/2608.13570#S0.F1)。
这种多任务方法为上述两个挑战提供了协同解决方案。CoT 损失提供了丰富的、基于文本的监督信号来指导潜在思考的形成,解决了监督挑战。同时,它迫使模型学习与人类逻辑固有对齐的潜在表示,从而解决了可解释性问题。模型学习生成 *token 高效* 的思考,这些思考不仅对于解决任务 *有效*,而且 *内在可解释*。
我们进行了全面的实验来探索训练此类模型的最佳实践。首先,我们在小型、纯文本数据集上对轻量级 LLMs 进行了大量的消融和对比实验,以确定最有效的策略。然后,我们证明这些策略可以成功推广到复杂的 VLM 领域。特别是,我们展示了一个最先进的 VLM(Qwen2.5-VL(Bai 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib8)))经过 SELR 微调后,通过生成显著更少的 token 并在多个 VLM 基准测试中获得更高分数,同时通过解码其自身的连续思考展现出强大的可解释性,实现了效率和准确性的同步提升。
我们的主要贡献有三点:
1. 我们提出了一个新颖的框架 SELR,*首次*训练单一模型在潜在空间中高效推理,同时能够将其潜在思考翻译成人类可读的文本,同时解决了监督和可解释性问题。
2. 我们 *首次*成功地将这种可解释的潜在推理范式应用于 VLMs,证明了最先进的模型可以在推理准确性和 token 效率上同时实现改进。
3. 我们提供了对训练策略的全面分析,为开发高效且可解释的潜在空间推理模型建立了一套可推广的最佳实践。
## 2 相关工作
**链式思考推理。**链式思考(CoT)推理范式始于在 LLMs 中激发逐步推理的提示技术,无论是通过少样本示例(Wei 等人,2022 (https://arxiv.org/html/2608.13570#bib.bib2))还是简单提示(Kojima 等人,2022 (https://arxiv.org/html/2608.13570#bib.bib13))。这种方法通过自我一致性(Wang 等人,2023 (https://arxiv.org/html/2608.13570#bib.bib14))等解码策略得到增强,并通过思维树(Yao 等人,2023 (https://arxiv.org/html/2608.13570#bib.bib15))等基于搜索的结构得到推广。CoT 框架也适用于视觉语言任务(Zhang 等人,2024 (https://arxiv.org/html/2608.13570#bib.bib16))。CoT 已从提示转向内部化,使用过程监督来训练像 OpenAI o1(OpenAI, 2024b (https://arxiv.org/html/2608.13570#bib.bib17))这样的模型,或基于强化学习如 DeepSeek R1(DeepSeek-AI, 2025 (https://arxiv.org/html/2608.13570#bib.bib18))。
**潜在空间推理。**为了克服显式 CoT 的计算低效,开创性的 Coconut 框架(Hao 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib1))将推理转移到连续潜在空间,通过训练模型“内化”基于文本的 CoT 轨迹,将最后的隐藏状态作为“连续思考”反馈回去。潜在空间推理允许模型执行高级、非确定性推理,如潜在广度优先搜索(Zhu 等人,2025a (https://arxiv.org/html/2608.13570#bib.bib19)),并在多个方向得到扩展,如迭代优化(Geiping 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib20))、能量最小化(Gladstone 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib21))或预训练整合(Zhu 等人,2025b (https://arxiv.org/html/2608.13570#bib.bib22))。Coconut 的后续方法,如 CODI(Shen 等人,2025b (https://arxiv.org/html/2608.13570#bib.bib25))、CoLaR(Tan 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib23))和 HRPO(Yue 等人,2025 (https://arxiv.org/html/2608.13570#bib.bib24)),通过课程学习或强化学习等策略压缩 CoT 来提高效率。然而,“黑箱”可解释性问题依然存在。虽然 Heima 框架(Shen 等人,2025a (https://arxiv.org/html/2608.13570#bib.bib3))解决了这个问题,但它需要训练多个独立的模型:一个编码器来压缩思考,一个解码器来解释它们。我们的 SELR 方法通过训练一个单一的、统一的模型,使其既是高效的推理器又是自己的解释器来解决这个问题。
## 3 方法
参见插图
图 2:我们的 SELR 框架可视化,包含两个阶段。(I) 潜在空间推理:模型首先根据图像和问题生成一系列潜在思考和最终答案。Heima 使用特殊的“思考总结/描述/推理” token 进行潜在推理,而 SELR 顺序生成潜在思考,类似于 Coconut。(II) CoT 解码:生成的潜在思考随后被解码。Heima 需要为每个推理步骤训练多个、独立的 LLM 解码器,而 **SELR** 训练 *单一的原始模型* 成为自己的翻译器,使用生成潜在空间推理的同一 VLM 来解码其自身的潜在思考。对于使用单步损失训练的 SELR 方法,我们从每个潜在思考逐一解码推理步骤;对于使用完整 CoT 损失训练的 SELR 方法,我们一次性解码包含所有潜在思考的整个 CoT。
在本节中,我们首先建立 VLM 生成过程的预备知识。在此基础上,我们介绍 SELR 的核心优化目标,特别是答案损失和 CoT 损失。最后,我们详细介绍完整的训练框架,呈现我们的单阶段和多阶段课程策略。
### 3.1 预备知识:VLM 生成
给定一张图像 \(I\) 和一个文本 token 序列 \(X_t\),VLM 的生成过程可以描述如下:
\[
\begin{aligned}
E_v &= \mathcal{P}(\mathcal{V}(I)), \\
E_t &= \mathcal{E}(X_t), \\
H &= \text{LLM}([E_v; E_t]), \\
p(x_{l+1} | I, X_t) &= \text{Softmax}(W h_l),
\end{aligned}
\]
其中 \(\mathcal{V}\) 是视觉编码器(例如,ViT(Dosovitskiy 等人,2021 (https://arxiv.org/html/2608.13570#bib.bib4)));\(\mathcal{P}\) 是投影层;\(\mathcal{E}\) 是嵌入矩阵;\(E_v \in \mathbb{R}^{l_v \times d}\) 是图像嵌入序列;\(E_t \in \mathbb{R}^{l_t \times d}\) 是文本 token 嵌入序列;\(H \in \mathbb{R}^{l \times d}\) 是最终隐藏状态序列,其中 \(l = l_v + l_t\);\(h_l\) 是位置 \(l\) 对应的最终隐藏状态,即输入序列的最后一个位置;\(W\) 是语言模型头的参数。
### 3.2 学习目标
参见插图
图 3:SELR 多任务损失目标图示。**答案损失** 在答案 token 上计算,以图像、问题和潜在思考为条件。**完整 CoT 损失** 和 **单步损失** 训练模型将其潜在思考解码回人类可读文本,分别在完整的 CoT 序列和采样的 CoT 步骤上计算。
SELR 的核心设计是模型的内部推理状态应既能解决任务又 *可自我解释*。为此,我们在一个包含图像-问题对的数据集上采用多任务学习目标,该数据集标注了真实 CoT 和最终答案。每个实例可以定义为:
\[
(I, X_q, \{X_{\text{CoT}_k}\}_{k=1}^K, X_a),
\]
其中 \(I\) 是图像,\(X_q\) 是问题,\(X_{\text{CoT}_k}\) 是第 \(k\) 个推理步骤,\(X_a\) 是答案。我们的优化目标是两个损失分量的加权和:
1. **答案损失:** 给定图像 \(I\)、问题 \(X_q\) 和潜在推理,答案 token \(X_a\) 的交叉熵损失。
2. **CoT 损失:** 给定潜在推理,整个 CoT 序列 \(X_{\text{CoT}} = [X_{\text{CoT}_1}, \dots, X_{\text{CoT}_K}]\) 或单个 CoT 步骤 \(X_{\text{CoT}_i}\) 的交叉熵损失。
作为补充说明,尽管此公式是为 VLMs 呈现的,但它可以通过简单地移除与图像相关的组件(例如 \(I\) 和 \(E_v\))而适用于 LLM 训练。
#### 3.2.1 潜在空间推理生成
为了定义答案损失和 CoT 损失,我们首先指定潜在空间推理的生成过程,因为两个损失都以它为条件。与标准生成将最终隐藏状态投影到词表上的分布以采样离散 token 不同,潜在空间推理直接将最终隐藏状态反馈作为下一个输入嵌入,有效地绕过了语言模型头,如图 2 (https://arxiv.org/html/2608.13570#S3.F2) 所示。
SELR 使用两个特殊 token:`<LATENT_START>` 和 `<LATENT_END>`,来标记潜在推理过程的开始和结束。完整的生成过程详见算法 1 (https://arxiv.org/html/2608.13570#alg1)。该过程首先用图像特征 \(\mathcal{P}(\mathcal{V}(I))\)、问题嵌入初始化嵌入序列 \(E\)。相似文章
潜在推理模型是否易于解释?
该论文研究了潜在推理模型的可解释性,发现推理令牌通常不是必要的,但在需要时可以被解码以显示可解释的痕迹,表明这些模型实现了预期的解决方案。
LC-ERD:通过一致性规约的奖励分解挖掘潜在逻辑实现自我进化推理
LC-ERD是一个框架,从LLM生成的推理链中挖掘潜在逻辑,将全局奖励分解为步骤级信号,实现无需人工标注的自我进化推理。它通过变分逻辑势和多智能体值分解来解决标签噪声、粗粒度监督和分布崩溃问题。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
揭示语言模型中的潜在推理策略
本文提出了一种方法,利用潜变量将语言模型的响应分布分解为结构化的、策略条件化的表示,并通过模型导向的重建目标来解决后验塌陷问题。
可观测模式并非解释:隐式推理模型的因果几何分析
本文分析了隐式推理模型(LRM),并论证隐状态中的可观测模式并非推理的因果解释;它倡导在可解释性研究中采用匹配对照和因果测试。