思考与非思考:通过稀疏自编码器解读大型语言模型的推理机制
摘要
本文使用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的内部推理,对比思考(CoT)与非思考模式,发现不同的特征激活模式,并通过因果干预实验加以验证。
arXiv:2608.08168v1 公告类型:新
摘要:尽管采用思维链(CoT)的大型语言模型(LLM)展现出卓越的推理能力,但区分这种显式思考模式与直接答案生成(非思考模式)的神经机制仍鲜为人知。为解构这一认知过程,我们将Top-K稀疏自编码器(SAEs)应用于DeepSeek-R1-Distill-Qwen-7B的中间表示,并考察模型在三个不同难度级别的数学求解任务中的不同行为。在观察层面,我们发现了模型在两种推理模式下的明显差异:思考模式依赖于稀疏且高强度的特征激活,驱动与问题复杂度无关的言语演绎;而非思考模式则呈现出适应性的、分散的模式,优先进行符号操作。在因果层面,通过总激活量抑制三个最活跃的稀疏特征,揭示了三个原则:(i)推理与句法结构紧密耦合,因为干预持续降低\LaTeX{}和盒装解决方案的格式质量;(ii)思考以补偿性过度生成来应对干扰,表现为元认知线索增加以及重复、低信息的延续;(iii)连贯的CoT行为依赖于专门特征之间的脆弱协调,在扰动下产生不同的失败模式,但输出结构始终受损。
查看缓存全文
缓存时间: 2026/08/11 08:07
# 思考 vs. 无思考:通过稀疏自编码器解读大语言模型的推理机制
来源:https://arxiv.org/html/2608.08168
程博 吉林大学人工智能学院 chengbo9691@gmail\.com &陆巧琳 香港理工大学 qiaolin\.lu@connect\.polyu\.hk &张益 吉林大学人工智能学院 教育部知识驱动人机智能工程研究中心,中国 吉林大学未来科学国际中心 yichang@jlu\.edu\.cn &吴远 吉林大学人工智能学院 yuanwu@jlu\.edu\.cn
###### 摘要
虽然采用思维链(Chain\-of\-Thought, CoT)的大语言模型(LLMs)展现出卓越的推理能力,但区分这种显式“思考”模式与直接答案生成(“无思考”模式)的神经机制仍鲜为人知。为解构这一认知过程,我们将 Top\-K 稀疏自编码器(Sparse Autoencoders, SAEs)应用于 DeepSeek\-R1\-Distill\-Qwen\-7B 的中间表示,并考察模型在三种不同难度级别的数学求解任务中的差异化行为。从观察层面,我们发现了模型在两种推理模式下的运作方式存在明显区别:思考模式依赖于稀疏且高强度的特征激活,驱动与问题复杂度无关的语言演绎;而无思考模式则表现出自适应且弥散的模式,优先进行符号操作。从因果层面,按总激活量(Total Activation Volume)抑制最活跃的三个稀疏特征揭示了三个原则:(i)推理与句法结构紧密耦合,因为干预始终会降低 LaTeX 和 boxed 解答格式的质量;(ii)思考模式以补偿性过度生成来应对干扰,其特征是元认知线索增多以及重复、低信息的延续;(iii)连贯的 CoT 行为依赖于专门特征之间的脆弱协调,在扰动下产生不同的失败模式,但输出结构始终受损。
## 1 引言
近年来,大语言模型(LLMs)的进展表明,显式引出思维链(CoT)能显著提升复杂推理任务的性能。DeepSeek\-R1(Guo 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib11))等模型通过在生成最终答案前进行探索、回溯和自我纠正的扩展思考过程,体现了这一范式。虽然 CoT 的行为优势已被充分记录,但其底层神经机制仍不透明(Wei 等人,2022 (https://arxiv.org/html/2608.08168#bib.bib27);Turpin 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib28);Lightman 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib29))。具体而言,支配显式推理(思考模式)与直接答案生成(无思考模式)的内部状态之间的结构差异尚未被完全阐明(Chen 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib24);Theodorus 等人, (https://arxiv.org/html/2608.08168#bib.bib26);Nanda 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib31);Li 等人,2022 (https://arxiv.org/html/2608.08168#bib.bib32);Zou 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib33))。一个关键且尚未解决的问题是,这种思考过程是否构成一种独特的计算机制,抑或仅仅作为标准序列生成的延长扩展。
为解构这一黑箱,稀疏自编码器(SAEs)已成为一种强大的微观工具(Rajamanoharan 等人,2024 (https://arxiv.org/html/2608.08168#bib.bib30);Cunningham 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib18))。开创性工作已成功通过将密集激活分解为可解释且单语义的特征,解决了多语义性问题(Bricken 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib8);Cunningham 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib18);Li 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib25);Meng 等人,2022 (https://arxiv.org/html/2608.08168#bib.bib16))。随着近期架构创新,如 Top\-K 激活机制(Gao 等人,2024 (https://arxiv.org/html/2608.08168#bib.bib20))和 JumpReLU(Lieberum 等人,2024 (https://arxiv.org/html/2608.08168#bib.bib22)),SAEs 已扩展到分析 Gemma 2 等大规模开放权重模型。虽然现有研究在字典学习、安全审计(Gallifant 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib19))和模型引导(Arad 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib17))方面取得了重大进展,但这些研究主要集中于识别静态语义概念或操纵输出 logits。很少有研究利用 SAEs 动态解码推理过程的时间演化,或从因果上解开支配 CoT 启动和调节的神经回路。
为弥合这一空白,我们应用 Top\-K SAEs 分析 DeepSeek\-R1\-Distill\-Qwen\-7B 的中间表示。与以往孤立分析特征的工作不同,我们建立了一个比较框架,以对比处理相同数学问题时思考模式与无思考模式之间的特征动态。
我们对潜在特征空间的研究揭示了两种模式之间的根本机制分歧。我们观察到,思考模式通过稀疏但高强度的激活机制运作,其中一组专门的特征驱动语言演绎。关键在于,这一推理路径保持稳定,且不受问题复杂度影响。相比之下,无思考模式表现出弥散且自适应的模式,招募更广泛且多变的特征联盟来优先进行符号操作。这种策略绕过了显式推理,转而依赖难度相关的模式匹配和句法检索。
从因果层面,为了检验所发现的稀疏特征是否在功能上对思考模式不可或缺,我们按总激活量(TAV)对前 3 个特征进行了针对性抑制。这些干预揭示了三个支配原则。(i)推理与句法结构之间的耦合。抑制高影响力特征持续降低模型生成正式数学输出的能力,这表明逻辑计算和结构实现由重叠的表示支持,而非可分离的推理与格式化模块。(ii)干扰下的补偿性序列扩展。当核心特征 28634 被抑制时,模型倾向于避免终止,而是通过增加元认知线索来扩展生成,产生更长但信息量更少且更重复的延续。(iii)特征抑制下的脆弱协调。抑制不同组件会引发监控相关信号的相反方向变化,但结构退化保持一致,这意味着思考模式依赖于一小部分专门的、高强度的特征之间精细平衡的协调,且冗余度有限,容易产生诸如不受控制的冗长等不同失败模式。
## 2 相关工作
##### SAE 架构与扩展。
稀疏自编码器通过将密集的内部状态分解为稀疏、可解释的特征组合,解决了 LLM 激活的多语义性问题。虽然 Cunningham 等人(2023 (https://arxiv.org/html/2608.08168#bib.bib18))的早期工作成功地在小型语言模型中证明了这一能力,但扩展性历来受到训练不稳定性和死潜变量普遍存在的阻碍。为了克服这些挑战,近期研究已从 L1 正则化转向直接稀疏性强制。Gao 等人(2024 (https://arxiv.org/html/2608.08168#bib.bib20))引入了 Top\-k 激活机制,通过仅保留 k 个最大幅值特征,简化了超参数调整并显著减少了死潜变量。在此基础上,Lieberum 等人(2024 (https://arxiv.org/html/2608.08168#bib.bib22))提出了 JumpReLU,以动态阈值化低幅值噪声。这些创新使得 SAEs 能够训练于最先进的开放权重模型,例如覆盖高达 27B 参数的大规模 Gemma Scope 套件,为重建保真度建立了稳健的扩展法则。
##### 语义验证与可解释性。
在建立稳健的架构后,研究重点转向验证所学特征的语义对齐。主要方法涉及自动可解释性,即由强大的 LLMs 基于最大激活上下文为特征生成自然语言解释(Gallifant 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib19);Gao 等人,2024 (https://arxiv.org/html/2608.08168#bib.bib20))。除一般语义外,Jing 等人(2025 (https://arxiv.org/html/2608.08168#bib.bib21))引入了 LinguaLens 框架,以严格分析语言机制。通过利用“最小对”反事实,他们证明了 SAE 特征与形态学和句法中的特定理论范畴对齐,确认 LLMs 在可区分的稀疏方向上编码了精确的语言属性。
##### 机制分析与下游应用。
近期研究进一步利用 SAEs 探测模型行为,并通过因果干预增强下游任务。在模型引导的背景下,Arad 等人(2025 (https://arxiv.org/html/2608.08168#bib.bib17))区分了输入特征(模式检测)和输出特征(生成影响),表明当针对输出 logits 上因果得分较高的特征时,引导最为有效。在应用方面,Gallifant 等人(2025 (https://arxiv.org/html/2608.08168#bib.bib19))发现,二值化的 SAE 特征在毒性检测等安全关键任务中优于密集状态,原因是其迁移性更好。类似地,Park 等人(2025 (https://arxiv.org/html/2608.08168#bib.bib23))将 SAEs 应用于离散化密集检索器嵌入,实现了概念级稀疏检索(CL\-SR),结合了语义表达力与稀疏表示的效率。
## 3 预备知识
在本节中,我们提供稀疏自编码器的正式背景,并特别关注 Top\-K 稀疏自编码器。
### 3\.1 问题设定
设 x∈Rd\mathbf\{x\}\in\mathbb\{R\}^\{d\} 表示来自预训练语言模型特定层的输入向量。虽然它通常是密集且多语义的,但我们的目标是将 x\mathbf\{x\} 分解为来自过完备字典的可解释特征方向的稀疏线性组合。形式上,我们寻求学习一个字典矩阵 Wdec∈Rd×m\mathbf\{W\}\_\{\text\{dec\}\}\in\mathbb\{R\}^\{d\times m\} 和潜在激活 z∈Rm\mathbf\{z\}\in\mathbb\{R\}^\{m\},其中 m≫dm\gg d,使得输入向量近似为 x≈Wdecz\+bdec\mathbf\{x\}\approx\mathbf\{W\}\_\{\text\{dec\}\}\mathbf\{z\}\+\mathbf\{b\}\_\{\text\{dec\}\}。
### 3\.2 稀疏自编码器
稀疏自编码器使用编码器\-解码器架构实现上述分解。编码器通过仿射变换后接非线性激活函数 σ\(⋅\)\sigma\(\cdot\) 将输入向量 x\mathbf\{x\} 映射到潜在激活 z\mathbf\{z\}:
z=σ\(Wencx\+benc\)\mathbf\{z\}=\sigma\(\mathbf\{W\}\_\{\text\{enc\}\}\mathbf\{x\}\+\mathbf\{b\}\_\{\text\{enc\}\}\) (1)
其中 Wenc∈Rm×d\mathbf\{W\}\_\{\text\{enc\}\}\in\mathbb\{R\}^\{m\times d\} 和 benc∈Rm\mathbf\{b\}\_\{\text\{enc\}\}\in\mathbb\{R\}^\{m\} 表示编码器参数。通常采用 ReLU 作为 σ\(⋅\)\sigma\(\cdot\) 以强制非负性(Bricken 等人,2023 (https://arxiv.org/html/2608.08168#bib.bib8))。然后,解码器使用学习到的特征方向重建输入向量:
x^=Wdecz\+bdec\hat\{\mathbf\{x\}\}=\mathbf\{W\}\_\{\text\{dec\}\}\mathbf\{z\}\+\mathbf\{b\}\_\{\text\{dec\}\} (2)
其中 Wdec∈Rd×m\mathbf\{W\}\_\{\text\{dec\}\}\in\mathbb\{R\}^\{d\times m\} 和 bdec∈Rd\mathbf\{b\}\_\{\text\{dec\}\}\in\mathbb\{R\}^\{d\} 表示解码器参数。模型被训练以最小化以下复合目标:
L=\|x−x^\|22\+λ\|z\|1\mathcal\{L\}=\|\mathbf\{x\}\-\hat\{\mathbf\{x\}\}\|\_\{2\}^\{2\}\+\lambda\|\mathbf\{z\}\|\_\{1\} (3)
其中 \|x−x^\|22\|\mathbf\{x\}\-\hat\{\mathbf\{x\}\}\|\_\{2\}^\{2\} 量化重建误差,而 \|z\|1\|\mathbf\{z\}\|\_\{1\} 施加由超参数 λ\lambda 加权的 L1L\_\{1\} 惩罚以强制稀疏性。然而,L1L\_\{1\} 正则化会导致收缩偏差,即模型为了最小化总损失而抑制活跃特征的幅值,从而损害所恢复语义概念的保真度。
### 3\.3 Top\-K 稀疏自编码器
为缓解 L1L\_\{1\} 正则化引起的收缩偏差,本工作采用 kk\-稀疏自编码器(Makhzani and Frey, 2013 (https://arxiv.org/html/2608.08168#bib.bib9))。该架构通过激活机制直接强制执行稀疏性,而非在损失中加入软惩罚。
具体而言,模型通过仅保留 kk 个最重要的潜变量来施加硬约束。给定预激活 h=Wencx\+benc\mathbf\{h\}=\mathbf\{W\}\_\{\text\{enc\}\}\mathbf\{x\}\+\mathbf\{b\}\_\{\text\{enc\}\},潜在激活通过 TopK 算子计算:
z=TopK\(h\)\mathbf\{z\}=\text\{TopK\}\(\mathbf\{h\}\) (4)
其中第 ii 个元素 zi\mathbf\{z\}\_\{i\} 仅当 \|hi\|\|\mathbf\{h\}\_\{i\}\| 在 h\mathbf\{h\} 中按幅值排名前 kk 时,才保留 hi\mathbf\{h\}\_\{i\} 的值。否则,其被设为零。此外,可以隐式或显式地应用 ReLU 以确保特征激活为正。解码过程与标准 SAEs 相同。由于稀疏性由 kk 严格强制,损失函数简化为重建损失:
L=\|x−x^\|22\mathcal\{L\}=\|\mathbf\{x\}\-\hat\{\mathbf\{x\}\}\|\_\{2\}^\{2\} (5)
该架构有效地将稀疏性与激活幅值解耦,使模型能够学习精确的特征强度,而不会受到正则化惩罚带来的向下压力。
## 4 实验
为了研究现代推理模型在两种推理模式下解决三种不同难度级别数学问题时的行为,我们首先详细介绍实验设置,然后对所观察到的模式进行全面分析。
### 4\.1 实验设置
#### 4\.1\.1 模型
我们使用 DeepSeek\-R1\-Distill\-Qwen\-7B(Guo 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib11))作为主要分析对象。DeepSeek\-R1\-Distill\-Qwen\-7B 以 Qwen2\.5\-Math\-7B 初始化,并在 DeepSeek\-R1 生成的输出上进行微调,保留了强大的推理能力,同时为可解释性研究提供了计算上可控的规模。
#### 4\.1\.2 数据集
为了捕捉复杂推理机制背后的稀疏特征,我们使用 DeepMath\-103K(He 等人,2025 (https://arxiv.org/html/2608.08168#bib.bib12))作为稀疏自编码器的训练语料。该大规模数据集包含 103,000 个数学问题,主要来源于 Math StackExchange1,专门为提升推理能力而策划。
#### 4\.1\.3 训练细节
##### 推理模式。
现代推理架构(如 R1 和 R1\-Distill\-Qwen)通常使用特定分隔符(例如 `<|beginning_of_thought|>` 和 `<|end_of_thought|>`)将内部认知与最终输出分开。基于这一结构,相似文章
重新思考稠密顺序链:推理语言模型能够从稀疏、乱序的思维链中提取答案
来自联发科(MediaTek)和台湾国立大学的研究论文挑战了推理链必须稠密且按顺序排列的假设,展示了模型能够从稀疏、乱序且充满噪声的推理痕迹中提取答案。研究结果表明,答案提取具有鲁棒性且不依赖顺序,这可能为实现更高效、并行化的推理生成铺平道路。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。
推理模型并非只是思考更久,其运作轨迹也不同
本文通过分析代码、数学和SAT领域中的隐藏状态轨迹几何特征,探究经推理训练的语言模型是否仅仅分配更多计算资源(更长的思维链),还是遵循了性质不同的内部轨迹。在纠正生成长度的影响后,他们发现经推理训练的模型展现出独特的轨迹几何特征——在代码领域最为明显——这表明推理训练改变了计算展开的方式,而不仅仅是计算量的多少。
当进一步推理无益时停止:推理模型中的注意力状态自适应生成
本文提出ASAG,一种无需训练的方法,基于注意力分布自适应地停止大型推理模型的推理,在使用DeepSeek-R1-Distill和Qwen3模型的基准测试中,将token使用量减少约40%,同时准确率提升3.2%。
过度思考:放大推理权重以提取习得秘密
介绍“过度思考”技术,通过放大推理蒸馏模型中的推理权重,诱导语言模型泄露隐藏信息,在2B-32B参数规模的模型上展示了高达10倍的秘密泄露效果。