潜在推理模型是否易于解释?

Lobsters Hottest 论文

摘要

该论文研究了潜在推理模型的可解释性,发现推理令牌通常不是必要的,但在需要时可以被解码以显示可解释的痕迹,表明这些模型实现了预期的解决方案。

<p>模型通常在连续的隐藏状态中进行所有推理,而不是输出可读文本,这使得它们难以监控。作者测试了Coconut和CODI模型,结果发现这些模型在逻辑任务如PrOntoQA和ProsQA中几乎不使用它们的隐藏推理步骤。你可以强制模型提前停止思考,它们几乎总是输出相同的响应。结果发现,它们在逻辑任务上的高性能实际上来自其特定的训练数据,而不是推理过程中的额外思考。</p> <p>当模型在数学问题中实际需要这些推理令牌时,事情变得更加有趣。研究人员想知道标准的逐步数学解决方案是否隐藏在潜在空间中,并将隐藏状态投影回常规词汇单词以进行检查。果然,当模型正确解决数学问题时,研究人员在它们的隐藏状态中发现正确的中间数学步骤,高达93%的时间。这一发现强烈表明,模型基本上在后台执行标准的数学步骤。</p> <p>他们通过调整提示中的数字并观察隐藏状态的反应来确认发生的精确数学操作,这使得能够为大多数正确预测解码经过验证的推理路径。但他们很少能对错误预测做到这一点,证明模型实际上比AI社区假设的要容易解释得多。你甚至可以利用这种可解释性作为信号来猜测模型即将给出正确还是错误的答案。</p> <p><a href="https://lobste.rs/s/obo3ie/are_latent_reasoning_models_easily">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/08/15 17:45

# 潜在推理模型是否易于解释?  
来源:https://arxiv.org/html/2604.04902  
Connor Dilgren & Sarah Wiegreffe  
单位:计算机科学系  
单位:马里兰大学  
单位:美国马里兰州帕克市  
单位:\{cdilgren, sarahwie\}@umd\.edu  

###### 摘要  
潜在推理模型(LRMs)因其相对于显式推理模型更低的推理成本以及理论上能够并行探索多条推理路径的能力,吸引了大量研究兴趣。然而,这些优势是以可解释性降低为代价的:LRM 因不以自然语言进行推理而难以监控。本文通过考察两个最先进的 LRM,对 LRM 的可解释性进行了探究。首先,我们发现 LRM 的预测往往并不依赖潜在推理 token;在逻辑推理数据集上,即使完全不使用潜在推理,LRM 也几乎总能得出相同的最终答案。这种推理 token 的利用不足,可能部分解释了 LRM 为何未能持续优于显式推理方法,并对先前研究中这些 token 所声称的作用提出了质疑。其次,我们证明了当潜在推理 token 确实对性能必要时,对于正确预测的实例,我们有多达 65-93% 的时间可以解码出黄金推理路径。这表明 LRM 通常实现的是预期的解决方案,而非不可解释的推理过程。最后,我们提出了一种方法,在无需事先知道黄金推理路径的情况下,从潜在 token 中解码出一个经过验证的自然语言推理路径,证明对于大多数正确预测可以找到验证过的路径,但对于少数错误预测则不然。我们的发现强调,当前的 LRM 主要编码了可解释的过程,且可解释性本身可以作为预测正确性的信号。  

## 1 引言  
诸如思维链(CoT;49 (https://arxiv.org/html/2604.04902#bib.bib1))等推理方法通过逐步解决问题来提高语言模型(LM)的性能。理论工作表明,推理 token 的生成通过延长网络的最长路径来增加其“有效深度”(15 (https://arxiv.org/html/2604.04902#bib.bib26);24 (https://arxiv.org/html/2604.04902#bib.bib25)),并帮助模型解决更困难的问题类别(30 (https://arxiv.org/html/2604.04902#bib.bib23);33 (https://arxiv.org/html/2604.04902#bib.bib27);39 (https://arxiv.org/html/2604.04902#bib.bib15))。推理 token 的生成还有一个额外好处,即以自然语言的形式为用户提供模型计算过程的某种解释。虽然显式推理路径并不总是忠实于模型的真实推理过程(50 (https://arxiv.org/html/2604.04902#bib.bib40);46 (https://arxiv.org/html/2604.04902#bib.bib2);7 (https://arxiv.org/html/2604.04902#bib.bib3)),但它仍然是用户校准对模型输出信任度的重要信号(2 (https://arxiv.org/html/2604.04902#bib.bib4))。然而,在推理时生成推理 token 计算成本高昂,许多最先进的推理模型(RMs)每个查询会产生数千个 token(5 (https://arxiv.org/html/2604.04902#bib.bib33);51 (https://arxiv.org/html/2604.04902#bib.bib34))。一系列近期工作专注于提高 RM 的推理时效率(34 (https://arxiv.org/html/2604.04902#bib.bib29);53 (https://arxiv.org/html/2604.04902#bib.bib30);27 (https://arxiv.org/html/2604.04902#bib.bib31);43 (https://arxiv.org/html/2604.04902#bib.bib32);16 (https://arxiv.org/html/2604.04902#bib.bib35);1 (https://arxiv.org/html/2604.04902#bib.bib36)),所提方法范围从基于提示或解码的技巧(47 (https://arxiv.org/html/2604.04902#bib.bib28)),到微调模型以使用更少的推理 token(29 (https://arxiv.org/html/2604.04902#bib.bib39)),再到根据推理必要性动态分配查询(42 (https://arxiv.org/html/2604.04902#bib.bib38))。一种近期显示出良好前景的方法是潜在推理模型(LRMs),它提议通过完全放弃文本解码过程来使推理更高效。例如 13 (https://arxiv.org/html/2604.04902#bib.bib8);21 (https://arxiv.org/html/2604.04902#bib.bib5);11 (https://arxiv.org/html/2604.04902#bib.bib6);8 (https://arxiv.org/html/2604.04902#bib.bib7);17 (https://arxiv.org/html/2604.04902#bib.bib9) 等方法训练模型以自回归或循环方式生成额外的中间潜在“推理”状态。潜在推理架构的动机也可以是这样的直觉:将中间推理隐藏状态解码为文本是信息流的一个不必要瓶颈(54 (https://arxiv.org/html/2604.04902#bib.bib17)),以及理论结果证明其具有更高的表达能力上限(20 (https://arxiv.org/html/2604.04902#bib.bib19);52 (https://arxiv.org/html/2604.04902#bib.bib14))。不幸的是,与显式推理模型(ERMs)不同,LRM 不产生人类可检查的自然语言推理 token。这引发了对 LRM 日益增长的安全担忧,并呼吁通过“思维链可监控性”来保留显式推理(22 (https://arxiv.org/html/2604.04902#bib.bib21))。但是,我们对当前的 LRM 是否有理由感到担忧呢?先前的工作(21 (https://arxiv.org/html/2604.04902#bib.bib5);44 (https://arxiv.org/html/2604.04902#bib.bib20))仅提供了有限的案例研究来支持 LRM 的可解释性,且缺乏跨架构或数据集的标准化比较。目前尚不清楚理论上证明的 LRM 更高容量是否已在当前架构中实现。我们进行了迄今为止关于潜在推理可解释性最全面的研究。代码可在 https://github.com/connordilgren/are-lrms-easily-interpretable 获取。我们回答了三个主要研究问题:  
图 1:我们的发现概览。左:LRM 倾向于在耗尽其预算之前就确定最终答案,表明它们并未有效利用所有可用的推理 token。中:潜在 token 的词汇表投影通常编码了黄金推理路径,表明模型遵循可解释的推理路径而非不透明的路径。右:我们可以生成由潜在 token 编码的候选步骤,并通过检查在修改提示下词汇表投影是否按预期变化来验证它们。  
- 研究问题 1:潜在推理 token 对模型性能是否必要?  
- 研究问题 2:黄金推理路径是否易于从潜在推理 token 中恢复?  
- 研究问题 3:我们能否从潜在 token 中提取模型正在遵循的推理路径?  

我们首先研究了最先进 LRM 中的潜在推理 token 对性能是否必要,这是有意义解释的前提。具体而言,我们研究了基于宽度的 LRM Coconut 和 CODI(第 2 节 https://arxiv.org/html/2604.04902#S2)。有些反直觉的是,我们发现它们对于某些任务并非必要:无论推理时有多少潜在 token 可用,LRM 在逻辑推理数据集上的预测几乎总是相同的。我们发现证据表明,先前工作中报告的性能提升来自于模型的训练过程,而非额外的测试时计算。当模型确实需要潜在推理 token 时,我们接下来调查是否可以找到编码在潜在推理 token 中的黄金推理路径。我们发现,当模型正确时,确实可以使用简单的启发式方法解码出黄金推理路径,但当模型错误时则不太容易。这表明 LRM 通常遵循预期的推理路径,而非不可解释的推理过程。除了解码预期的推理路径外,我们还提出了一种新颖的方法,可以在事先不知道黄金推理路径的情况下,解码出一个经过验证的自然语言推理路径。我们证明了对于大多数正确预测可以找到并验证推理路径,但对于少数错误预测则不然。我们的发现强调,当前的 LRM 主要编码了可解释的过程,且可解释性本身可以作为预测正确性的信号。  

## 2 相关工作  

#### 潜在推理模型。  
潜在推理模型在连续的隐藏状态中进行推理,而非自然语言,这使得其中间步骤不透明(54 (https://arxiv.org/html/2604.04902#bib.bib17))。我们研究了 Coconut(21 (https://arxiv.org/html/2604.04902#bib.bib5))和 CODI(41 (https://arxiv.org/html/2604.04902#bib.bib22)),这是两种基于宽度的 LRM,它们自回归地生成中间潜在推理 token,并通过将其直接作为下一个 token 反馈回模型来绕过将其解码为文本的过程(见图 6 https://arxiv.org/html/2604.04902#A1.F6)。关于其他类型 LRM 的额外讨论包含在 A.1 节 https://arxiv.org/html/2604.04902#A1.SS1 中。我们专注于这些模型是因为它们在文献中越来越普遍,与使用思维链的 ERM 在架构上相似,并且有公开可用的源代码。在训练过程中,Coconut 和 CODI 模型都从关于真实推理路径的监督中学习推理。Coconut 模型被实例化为一个 ERM;在训练课程的每个阶段,一个显式推理步骤被替换为一个潜在推理 token,直到没有显式推理步骤剩余。CODI 模型训练一个 ERM 和一个 LRM,并通过对齐模型间一个关键 token 的隐藏状态将知识蒸馏到 LRM 中。更多细节请读者参阅原始论文。在推理时,对于这两个模型,一个特殊的“思考开始” token 标志着潜在推理的开始,之后模型处理预定的、特定于数据集的潜在 token 数量。每个潜在 token 是前一个位置的最终层隐藏状态,绕过了自回归生成的标准解码(和重新嵌入)步骤。一个“思考结束” token 标志着返回标准解码以产生最终答案。CODI 还会在潜在推理期间,将每个最终层隐藏状态通过一个训练好的两层多层感知器,然后才用作下一个输入 token。从理论角度来看,近期工作(52 (https://arxiv.org/html/2604.04902#bib.bib14);56 (https://arxiv.org/html/2604.04902#bib.bib43);20 (https://arxiv.org/html/2604.04902#bib.bib19);4 (https://arxiv.org/html/2604.04902#bib.bib53))确定了基于宽度的 LRM 比 ERM 具有更高的表达能力上限,这是由于移除了文本解码瓶颈。在此基础上,他们提出了 LRM 可以比 ERM 更有效解决的问题类别,例如图可达性或其他并行广度优先搜索问题。然而,当前的 LRM 在多大程度上实际实现了这些行为尚无定论。我们在第 4 节(https://arxiv.org/html/2604.04902#S4)中发现了反驳 LRM 在某些逻辑推理任务中表现出复杂搜索行为这一说法的证据。  

#### 解读潜在推理模型。  
关于解读 LRM 的工作有限。一些提出 LRM 的研究包含了可解释性分析,但主要通过案例研究。41 (https://arxiv.org/html/2604.04902#bib.bib22) 发现初步证据表明,对于正确回答的数学问题,潜在 token 可以编码中间推理步骤,步骤结果出现在词汇表投影的前 5 个 token 中,步骤操作数出现在前 10 个关注的输入 token 中。21 (https://arxiv.org/html/2604.04902#bib.bib5) 检查了潜在 token(在词汇表投影后)分配给图中节点的概率,并假设 LRM 同时遵循多条推理路径。然而,目前尚不清楚这些发现在多大程度上更普遍地成立,或者是否能够预测模型的正确性。一些同期工作使用机制可解释性技术分析 LRM。9 (https://arxiv.org/html/2604.04902#bib.bib42) 调查了 LRM 之所以比 ERM 和非推理模型性能更高,是由于潜在推理还是其训练过程。25 (https://arxiv.org/html/2604.04902#bib.bib44) 发现 LRM 在少于 3 跳的多跳任务中编码了中间状态。这些工作的额外讨论包含在 A.2 节 https://arxiv.org/html/2604.04902#A1.SS2 中。  

## 3 实验细节  
数据集。我们在先前 LRM 研究中常用的三个数据集上进行实验:GSM8k-Aug(14 (https://arxiv.org/html/2604.04902#bib.bib37)),PrOntoQA(38 (https://arxiv.org/html/2604.04902#bib.bib13))和 ProsQA(21 (https://arxiv.org/html/2604.04902#bib.bib5))。更多细节(包括数据集统计和示例)请参见附录 B(https://arxiv.org/html/2604.04902#A2)。GSM8k-Aug 是一个算术问题数据集,每个问题都有一个 1-8 步的黄金推理路径,其中每一步都是一个方程,将操作数(例如“3”、“5”)与运算符(例如“+”、“-”)组合以产生结果。我们添加了来自 MultiChain GSM8k-Aug 数据集(11 (https://arxiv.org/html/2604.04902#bib.bib6))的其他有效推理路径,每个实例产生 1-10(中位数 5)条黄金路径。PrOntoQA 和 ProsQA 都是逻辑推理数据集,分别需要 6 步和 3-6 步推理。两个任务都需要在给定一组分层的“是-一种”关系的情况下,确定一个实体是否属于所述类别。ProsQA 通常比 PrOntoQA 有更多的干扰路径;它由 21 (https://arxiv.org/html/2604.04902#bib.bib5) 提出,旨在解决 PrOntoQA 在测试 LRM 搜索能力方面的缺陷。  

GSM8k-Aug | PrOntoQA | ProsQA  
--- | --- | ---  
方法 | 基础模型 | 准确率(%) | Token 数 | 准确率(%) | Token 数 | 准确率(%) | Token 数  
无 CoT | GPT-2 Small | 16.8(16.5†) | 3.2 | 87.9(93.8†) | 3.0 | 76.0(76.7†) | 9.5  
CoT | GPT-2 Small | 41.6(42.9†) | 31.0 | 99.3(98.8†) | 92.7 | 74.2(77.5†) | 51.6  
Coconut | GPT-2 Small | 33.1(34.1†) | 9.2 | 99.0(99.8†) | 9.0 | 98.0(97.0†) | 15.5  
CODI | GPT-2 Small | 42.2*(43.7‡) | 12.3 | 95.1 | 12.0 | 81.6 | 18.2  
无 CoT | Llama-3.2-1B | 30.1(30.9‡) | 4.2 | 99.8 | 3.0 | 87.8 | 8.6  
CoT | Llama-3.2-1B | 59.4(61.6‡) | 29.7 | 99.6 | 85.6 | 95.2 | 42.6  
Coconut | Llama-3.2-1B | 35.7(45.3‡) | 10.2 | 98.8 | 9.0 | 97.6 | 14.7  
CODI | Llama-3.2-1B | 56.0(55.6‡) | 13.2 | 93.6 | 12.0 | 99.0 | 17.7  

表 1:模型性能。括号内显示了来自 21 (https://arxiv.org/html/2604.04902#bib.bib5)† 和 41 (https://arxiv.org/html/2604.04902#bib.bib22)‡ 的结果(如果有)。关于 Coconut + Llama-3.2-1B-Instruct 在 GSM8k-Aug 上与已发表结果的比较,请参见附录 G(https://arxiv.org/html/2604.04902#A7)。  

模型。遵循先前的工作,我们使用 Coconut 和 CODI 的潜在训练方法微调 GPT-2 Small(35 (https://arxiv.org/html/2604.04902#bib.bib12))和 Llama-3.2-1B-Instruct(45 (https://arxiv.org/html/2604.04902#bib.bib45));详见 §2(https://arxiv.org/html/2604.04902#S2)。我们还微调了两个基线:一个 ERM(即使用思维链的模型)和一个无 CoT 模型(即立即回答的模型)。我们使用来自 21 (https://arxiv.org/html/2604.04902#bib.bib5);41 (https://arxiv.org/html/2604.04902#bib.bib22) 的训练代码,分别对四种模型类型在每个数据集上进行微调,得到十二个模型。除了 CODI + GPT2-Small 在 GSM8k-Aug 上的情况外,我们使用提供的检查点:https://huggingface.co/zen-E/CODI-gpt2。遵循 21 (https://arxiv.org/html/2604.04902#bib.bib5) 和 41 (https://arxiv.org/html/2604.04902#bib.bib22),我们使用 6 个潜在推理 token 训练和评估我们的 Coconut 和 CODI 模型。

相似文章

大规模推理模型(尚)不是多语言潜在推理器

arXiv cs.CL

本文研究了大规模推理模型在11种语言上的多语言潜在推理能力,发现虽然存在潜在推理能力,但分布不均——在资源丰富的语言中较强,在低资源语言中较弱。研究发现,尽管表面存在差异,但内部推理机制在很大程度上与英语中心的路径保持一致。