并非所有LLM推理都可见于思维链

arXiv cs.CL 论文

摘要

本文证明,前沿语言模型能够利用语义无关的填充令牌进行“不可见推理”,在合成推理任务上准确率提升高达13个百分点,这动摇了思维链监控能捕获所有推理的假设。

arXiv:2607.22925v1 公告类型: 新 摘要: 人工智能安全的一个关键问题是语言模型是否将其所有推理表达在输出令牌中。我们展示了一个具体的失效模式:前沿模型通过利用语义无关的填充令牌来提升合成推理任务的性能,从而表现出不可见推理。我们评估了13个前沿语言模型在三个任务上的表现,发现许多模型从填充令牌中显著受益,准确率提升高达13个百分点。这种收益取决于使用的令牌类型,并在不同模型间存在差异。我们进一步证明,填充令牌使Claude Opus 4.5能够在不牺牲主要任务准确性的情况下满足隐藏的模算术约束,这表明不可见推理可以服务于完全不可见CoT监控的目标。强化学习使Qwen3-235B对填充令牌内容产生强烈偏好,但无论是强化学习还是监督微调,都无法使填充令牌的收益在测试时持续存在。我们的结果表明,前沿模型已经在进行重要的计算,但其输出令牌中没有可解释的痕迹。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

# 并非所有大语言模型推理都体现在思维链中  
来源:https://arxiv.org/html/2607.22925  

Tom Goldstein  
马里兰大学  
[email protected]  

Ashwinee Panda  
TogetherAI  
[email protected]  

###### 摘要  

人工智能安全中的一个关键问题是,语言模型是否将其全部推理过程都表达在输出词元中。我们展示了一个具体的失败模式:前沿模型利用语义不相关的**填充词元**在合成推理任务上提升性能,从而展现出**隐形推理**。我们在三项任务上评估了13个前沿语言模型,发现许多模型从填充词元中获益显著,准确率提升高达13个百分点。这种收益取决于所使用的词元类型,并且在不同模型之间存在差异。我们进一步证明,填充词元使Claude Opus 4.5能够在不牺牲主任务准确率的前提下满足隐藏的模算术约束,这表明隐形推理可以服务于思维链监控完全不可见的任务目标。强化学习使Qwen3-235B对填充词元内容产生了强烈偏好,但无论是强化学习还是监督微调,都没有产生能在测试时持续存在的填充词元收益。我们的结果表明,前沿模型已经在执行重要计算,而在其输出词元中没有可解释的痕迹。  

## 1 引言  

思维链监控为审计越来越强大的语言模型提供了一种可行的途径(Korbak et al., 2025 (https://arxiv.org/html/2607.22925#bib.bib21))。然而,这种方法基于一个假设:模型将其推理过程外部化在输出词元中。先前的研究表明,思维链可能并非模型内部推理过程的忠实表征(Turpin et al., 2023 (https://arxiv.org/html/2607.22925#bib.bib40); Lanham et al., 2023 (https://arxiv.org/html/2607.22925#bib.bib22); Arcuschin et al., 2025 (https://arxiv.org/html/2607.22925#bib.bib1); Chen et al., 2025 (https://arxiv.org/html/2607.22925#bib.bib5); Boppana et al., 2026 (https://arxiv.org/html/2607.22925#bib.bib4))。在本文中,我们将这一方向推向极致,探讨推理是否始终能在潜在空间中被观察到——即使在完全没有有意义词元的情况下也是如此。模型的一次前向传递包含数十亿次计算和数千个潜在向量表示,之后才将这些信息压缩为单个输出词元。鉴于潜在表示的丰富性以及单个词元相对较低的信息含量,我们预期会出现不需要思维链的内部推理过程。本文从基本角度研究隐形推理的存在性。然而,开发者也有实际动机在其模型中引发隐形推理。非思维链性能是标准的基准测试标准,而服务成本倾向于简洁的输出。一个利用预填充计算来提高准确率的模型可以更高效地提供服务响应。最近,Ramji等人 (2026 (https://arxiv.org/html/2607.22925#bib.bib31))提出使用“抽象”思维链来训练模型,以实现更高效的推理。隐形推理也对蒸馏具有抵抗力,因为有意义的计算不会出现在输出痕迹中。因此,我们预计未来的模型将被显式优化以进行潜在计算,这使得我们对其何时以及如何出现的描述直接与实践相关。正如本文所示,**前沿模型已经展现出隐形推理的能力**,而无需任何额外的显式优化。  

我们证明前沿模型利用语义不相关的**填充词元**:固定的词元序列,允许模型在回答之前进行更多计算。这些序列对每个问题和答案都是相同的,因此它们引发的推理在词元空间中无法区分。我们将其视为*隐形推理*的一个实例,即模型执行对阅读其输出的观察者不可见的计算。我们通过三个诊断标准形式化隐形推理,并表明该能力已经存在于最近的前沿模型中(第4节 (https://arxiv.org/html/2607.22925#S4), 第5节 (https://arxiv.org/html/2607.22925#S5))。然后,我们证明提供填充词元(从而为隐形推理提供更多空间)使Claude Opus 4.5能够在主要任务之外同时完成一个简单的隐藏目标(第5节 (https://arxiv.org/html/2607.22925#S5))。这些实验在合成场景中展示了这种能力;我们并不声称填充词元能在现实的不当行为环境中避开监控。我们还研究了是否可以通过显式训练来增强隐形推理(第6节 (https://arxiv.org/html/2607.22925#S6))。通过强化学习,Qwen3-235B对填充词元内容产生了强烈偏好,但填充词元的收益在测试时并未持续存在,而监督微调也无法迁移该收益。我们的结果表明,**模型可以执行重要计算,而在输出词元中没有可解释的痕迹**。  

## 2 相关工作  

#### 思维链推理  
思维链提示(Wei et al., 2023 (https://arxiv.org/html/2607.22925#bib.bib42); Kojima et al., 2023 (https://arxiv.org/html/2607.22925#bib.bib20))是激发基于Transformer的语言模型进行复杂推理的标准技术。思维链扩展了Transformer的计算能力(Merrill and Sabharwal, 2024 (https://arxiv.org/html/2607.22925#bib.bib28)),特别是通过提高其解决串行问题的能力(Li et al., 2024 (https://arxiv.org/html/2607.22925#bib.bib23))。  

#### 思维链忠实性  
虽然思维链推理提高了语言模型的问题解决能力,但尚不清楚思维链是否准确反映了模型的内部计算。众所周知,大语言模型会在思维链中错误地描述其推理过程,通常是对预设答案提供事后解释,而非其内部推理的真实描述(Turpin et al., 2023 (https://arxiv.org/html/2607.22925#bib.bib40); Lanham et al., 2023 (https://arxiv.org/html/2607.22925#bib.bib22); Arcuschin et al., 2025 (https://arxiv.org/html/2607.22925#bib.bib1); Chen et al., 2025 (https://arxiv.org/html/2607.22925#bib.bib5))。Korbak等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib21))认为,尽管思维链在简单场景中可能不忠实,但解决复杂问题通常需要大语言模型外部化其推理过程。然而,最近的研究表明,语言模型可以通过强化学习学会用抽象的、不可解释的语言进行推理(Ramji et al., 2026 (https://arxiv.org/html/2607.22925#bib.bib31))。此外,Boppana等人 (2026 (https://arxiv.org/html/2607.22925#bib.bib4))提供了思维链中表演性推理的具体证据,表明模型的最终答案可以从思维链中比监控器所能检测到的早得多的激活中解码。这些发现表明,大语言模型不一定需要输出可解释的推理描述才能利用思维链的计算优势。  

#### 语言模型中的隐写术  
人工智能监督的一个关键问题是模型是否可以在其输出中隐藏信息。Roger and Greenblatt (2023 (https://arxiv.org/html/2607.22925#bib.bib32))表明,语言模型可以经过训练,在输出文本中编码读者难以察觉的隐藏推理步骤,并且这种风险随着模型规模的增大而增加。Mathew等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib26))进一步证明,隐写式串通可能因错误的奖励激励而无意中出现,并且诸如释义等标准缓解措施不足以阻止它。隐形推理是一个相关现象,其中计算隐藏在潜在表示中,而不是输出文本的统计属性中。  

#### 隐式推理与内化推理  
不忠实的思维链提出了一个问题:模型是否可以在不产生可解释的中间步骤的情况下有效推理。Deng等人 (2023 (https://arxiv.org/html/2607.22925#bib.bib8))表明,从显式思维链教师模型进行蒸馏可以训练模型跨层而非跨词元进行推理,而Deng等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib9))通过微调过程中逐步移除思维链步骤进一步扩展了这一方法,在GSM8K上实现了超过50%的准确率,且没有任何可见推理。Hao等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib17))通过将模型的最后一个隐藏状态直接反馈作为下一个输入嵌入,进一步扩展了这种方法,使得在人类不可解释的连续潜在空间中进行推理成为可能。Su等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib37))尝试混合离散潜在词元和文本词元,以产生部分不透明的推理痕迹。这些方法需要显式训练来抑制或替换思维链,而我们发现隐形推理在标准的预训练模型中已经出现。  

#### 隐形推理与填充词元  
即使没有针对隐式推理进行训练,上下文中的额外词元也可以提供计算优势。Pfau等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib29))表明,语义无意义的填充词元可以提高可并行化任务的性能,但仅在模型专门使用填充词元进行训练时有效。Goyal等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib14))类似地发现,可学习的暂停词元有助于推理模型,但收益在测试时无法迁移到标准预训练模型。Greenblatt (2025 (https://arxiv.org/html/2607.22925#bib.bib15))表明,最近的前沿模型可以在没有任何额外训练的情况下利用填充词元,包括重复问题的词元,这表明这是一种涌现能力(Wei et al., 2022 (https://arxiv.org/html/2607.22925#bib.bib41))。Shi等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib36))将这种收益归因于MLP激活的变化,并通过推理时的干预来复现。相对于这些工作,我们刻画了这种提升如何联合依赖于填充词元类型、少样本上下文、任务和模型,并将填充词元与隐藏约束满足和训练动态联系起来。Balesni等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib3))进一步证明,前沿模型能够在没有思维链的情况下执行多跳隐形推理。  

#### 欺骗、密谋与思维链监控  
越来越多的研究表明,语言模型可以追求隐藏目标。Hubinger等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib18))证明,欺骗性行为可以被植入并通过安全训练持续存在。Greenblatt等人 (2024 (https://arxiv.org/html/2607.22925#bib.bib16))表明,模型可以推断自己何时被评估,并在后训练期间策略性地服从有害请求以保留其价值观,而Meinke等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib27))表明,这可以扩展到无需训练的上下文密谋。Zolkowski等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib45))表明,在优化压力下,模型可以完成对抗性任务,同时向思维链监控器隐藏其意图,而Baker等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib2))发现,针对思维链监控器进行优化会导致模型在推理过程中隐藏奖励黑客行为。Marks等人 (2025 (https://arxiv.org/html/2607.22925#bib.bib25))表明,可解释性工具可以恢复一些思维链监控遗漏的隐藏目标,而Fang and Marks (2025 (https://arxiv.org/html/2607.22925#bib.bib10))表明,当模型被训练用密码推理时,对数几率透镜分析可以重建隐藏推理。  

## 3 方法论  

语言模型并不总是通过可解释的思维链来表达其推理。我们将**隐形推理**定义为在模型前向传递过程中内部潜在表示中发生的重要计算,而不在输出词元中留下任何可解释的痕迹。在模型上下文中插入语义不相关的词元可以通过扩大前向传递计算来增强隐形推理(Pfau et al., 2024 (https://arxiv.org/html/2607.22925#bib.bib29))。我们将这些不相关的词元称为**填充词元**。这些词元之所以不相关,是因为相同的固定序列出现在每个问题中,因此这些词元不携带任何关于特定问题或答案的信息。这些词元仍可能作为程序性线索,我们下面的第二个标准直接衡量了这种可能性。  

我们识别出三种隐形推理现象:  
1. 使用填充词元时性能提高,表明存在隐形推理。  
2. 性能取决于填充词元内容,表明某些词元的表示比其他词元更有利。  
3. 填充词元偏好因模型而异,证明填充词元的提升并非源于语义内容,而是模型特定的词元表示。  

这些标准确立了填充词元因果性地影响模型的潜在计算,但模型在填充区间内执行何种算法尚不清楚。插入词元也会改变位置和注意力模式,因此我们不将提升仅归因于额外计算。在第4.2节 (https://arxiv.org/html/2607.22925#S4.SS2)中,我们探讨了在填充词元存在情况下潜在计算背后的潜在机制。  

### 3.1 合成任务  

本文的目标是隔离并量化隐形推理的存在性。我们聚焦于简单的合成测试场景,在此类场景中可以隔离和量化推理的影响。我们还专注于具有可验证真/假答案的问题,以消除混杂变量和主观性。此外,我们选择问题陈述简洁的任务,以便预填充的填充词元有意义地增加测试时的计算量。我们在附录A.2 (https://arxiv.org/html/2607.22925#A1.SS2)中提供了完整的任务细节和可复现的随机种子。  

#### 多位数乘法  
我们生成了一个多位整数乘法问题的合成数据集,在主要实验中使用4位数的操作数。每个问题格式为:X 乘以 Y 等于多少?  

#### 多步算术  
参照Greenblatt (2025 (https://arxiv.org/html/2607.22925#bib.bib15)),我们构建了一个合成数据集,每个问题包含5到7个嵌套算术运算。  

#### 代码中的变量计数  
我们向模型提供一个简短的代码片段,并要求其输出在片段中被赋值的不同变量的数量。  

稍后,我们将考虑稍微复杂的设置,其中模型在表面上解决上述任务之一的同时,还必须满足一个隐藏的数学目标。  

### 3.2 实验设置  

我们设计了一个评估框架,基于我们提出的三个标准来探测隐形推理的存在性。给定一个任务,我们提示模型立即回答,不产生思维链。我们包含 \(K\) 个少样本示例,每个示例包括一个问题、\(n\) 个在助手上下文中的填充词元以及真实答案。我们还在助手上下文中预填充 \(n\) 个填充词元,然后提示模型为每个问题生成答案。在整篇论文中,\(n\) 表示填充词元的数量,\(N\) 表示评估问题的数量。我们在相同的设置下测量基线性能,但不在少样本示例中或问题之后包含填充词元。我们在附录A.3 (https://arxiv.org/html/2607.22925#A1.SS3)中提供了额外的提示细节和消融实验。  
W

相似文章

点间解读:解码填充标记中的隐藏计算

arXiv cs.CL

本文表明,前沿LLM能够在无内容的填充标记上进行多步推理,并且残差流中的隐藏状态可以被解码以高精度恢复中间值,挑战了思维链监控是唯一审计工具这一假设。