它思考得有多费力?分析LLM思维链轨迹中的步骤感知推理能量
摘要
提出了步骤感知推理能量(SARE),一种使用CKA的几何框架,用于量化LLM单个思维链步骤中的计算努力,揭示了非均匀的努力分配和改进的置信度预测。
arXiv:2607.28674v1 公告类型:新
摘要:理解计算努力如何在单个思维链(CoT)推理步骤间分配仍然是一个开放挑战:现有的可解释性方法依赖于输出级信号或将处理深度压缩为单个轨迹级标量,使得步骤级努力不透明。我们提出了步骤感知推理能量(SARE),一种几何框架,通过相邻Transformer层之间token隐藏状态的Gram矩阵之间的中心核对齐(CKA)来量化单个CoT步骤粒度上的努力,无需特征向量对齐或聚类对应即可捕获token间的关联结构。SARE进一步通过将CoT轨迹建模为潜在语义状态之间的转换,将此能量置于推理的语义进展背景中。在六个推理基准和三个开放权重LLM上,我们发现推理能量在不同步骤类型之间高度非均匀,表现出轨迹级指标无法观察到的类相位转换;不正确的轨迹在关键推理节点表现出系统性较低的能量;并且基于SARE的特征在大多数设置中匹配或优于基于输出的置信度基线,表明内部几何动态编码了超出表面级信号的预测信息。
查看缓存全文
缓存时间: 2026/08/03 07:29
它思考得有多费力?分析 LLM 思维链轨迹中的步骤感知推理能量
来源:https://arxiv.org/html/2607.28674
Hui Wei†, Junda Wu‡, Sheldon Yu‡, Sizhe Zhou§, Yizhu Jiao§, Ming Zhong§, Bowen Jin§, Tong Yu♢, Shijia Pan‡, Jiawei Han§, Julian McAuley‡ †UC Merced‡UC San Diego§UIUC♢Adobe Research huiwei2@ucmerced\.edu
###### 摘要
理解计算努力如何在思维链(CoT)推理的各个步骤之间分配,仍然是一个悬而未决的挑战:现有的可解释性方法要么依赖输出级信号,要么将处理深度压缩为单个轨迹级标量,导致逐步努力仍然不透明。我们提出步骤感知推理能量(Step-Aware Reasoning Energy, SARE),这是一种几何框架,通过相邻 Transformer 层之间 token 隐藏状态 Gram 矩阵的中心核对齐(Centered Kernel Alignment, CKA),在单个 CoT 步骤的粒度上量化努力,从而在不要求特征向量对齐或簇对应的情况下捕获 token 间的关系结构。SARE 进一步将这种能量置于推理的语义进展背景中,将 CoT 轨迹建模为潜在语义状态之间的转移。在六个推理基准和三个开放权重 LLM 上,我们发现推理能量在步骤类型之间高度非均匀,表现出轨迹级指标无法看到的类相位转变;错误的轨迹在关键推理节点处表现出系统性较低的能量;并且基于 SARE 的特征在大多数设置中匹配或优于基于输出的置信度基线,这表明内部几何动力学编码了超越表层信号的预测信息。
它思考得有多费力?分析 LLM 思维链轨迹中的步骤感知推理能量
Hui Wei†, Junda Wu‡, Sheldon Yu‡, Sizhe Zhou§, Yizhu Jiao§, Ming Zhong§,Bowen Jin§, Tong Yu♢, Shijia Pan‡, Jiawei Han§, Julian McAuley‡†UC Merced‡UC San Diego§UIUC♢Adobe Researchhuiwei2@ucmerced\.edu
## 1 引言
思维链(CoT)提示(Wei 等人,2022 (https://arxiv.org/html/2607.28674#bib.bib9))已成为激发大型语言模型(LLM)进行多步推理的最有效技术之一,显著提升了在数学、逻辑和常识基准上的表现。通过生成显式的中间推理步骤,CoT 为观察模型的推理过程提供了一扇窗口。然而,尽管有这种表面上的透明性,我们对于计算努力实际上如何在这些步骤之间分配仍然知之甚少(例如,哪些步骤需要深度内部处理,哪些步骤被轻松解决),这使得 LLM 推理的黑箱性质在很大程度上依然存在。
现有解释 CoT 推理的尝试主要停留在表层。基于输出的方法检查 token 对数概率(Hwang 等人,2026 (https://arxiv.org/html/2607.28674#bib.bib11))或在轨迹文本上训练分类器(Madaan 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib12)),但将 Transformer 的内部计算视为不透明的。可解释性研究已经开始探测 Transformer 内部结构(Belrose 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib13);Chuang 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib14)),但通常停留在单个 token 或聚合表示的层面,这过于粗糙,无法捕获整个推理步骤的计算动态。最近,Chen 等人(2026 (https://arxiv.org/html/2607.28674#bib.bib5))提出深度思维比(Deep Thinking Ratio, DTR),通过 token 级逐层预测稳定性来衡量推理努力,但 DTR 将深度聚合成单个轨迹级标量,并独立处理 token,丢弃了步骤内 token 之间的关系结构。这两条工作线都没有将模型的逐层计算与推理链的语义进展充分联系起来。
为了弥合这一差距,我们提出步骤感知推理能量(SARE),这是一种在单个 CoT 推理步骤粒度上量化计算努力的几何框架。对于每个步骤和每对相邻 Transformer 层,我们计算由 token 隐藏状态构建的 Gram 矩阵之间的中心核对齐(CKA)(Kornblith 等人,2019 (https://arxiv.org/html/2607.28674#bib.bib15)),从而衡量该步骤的内部 token 关系几何在前向传播过程中被重组的程度。一个在多层中持续重组的步骤反映了真正的计算努力;而一个很早就稳定下来的步骤则表明处理极少。与 token 级深度度量不同,CKA 基于成对 token 相似性结构,在不需要跨层特征向量对齐或簇对应的情况下保留 token 间关系信息。我们进一步通过将 CoT 步骤建模为通过无监督聚类识别的潜在语义状态之间的转移,将 SARE 置于推理的语义轨迹背景中,从而能够联合分析能量如何随语义角色变化以及如何在链上演变。
我们在涵盖数学、常识和多跳领域的六个推理基准(即 GSM8K(Cobbe 等人,2021 (https://arxiv.org/html/2607.28674#bib.bib18))、MATH(Hendrycks 等人,2021 (https://arxiv.org/html/2607.28674#bib.bib19))、CSQA(Talmor 等人,2019 (https://arxiv.org/html/2607.28674#bib.bib20))、StrategyQA(Geva 等人,2021 (https://arxiv.org/html/2607.28674#bib.bib21))、HotpotQA(Yang 等人,2018 (https://arxiv.org/html/2607.28674#bib.bib22))和 MuSiQue(Trivedi 等人,2022 (https://arxiv.org/html/2607.28674#bib.bib23)))上评估了 SARE,使用了三个开放权重 LLM:LLaMA-3.2-3B(Grattafiori 等人,2024 (https://arxiv.org/html/2607.28674#bib.bib24))、Phi-4-mini(Abouelenin 等人,2025 (https://arxiv.org/html/2607.28674#bib.bib25))和 Gemma-3-4B(Team 等人,2025 (https://arxiv.org/html/2607.28674#bib.bib26))。我们的分析围绕两个核心研究问题展开:
- •RQ1:不同的语义推理状态是否表现出不同的步骤级推理能量分布,这些分布在正确与错误的轨迹之间是否存在差异?
- •RQ2:步骤级能量动态能否在没有 ground-truth 标签的情况下预测推理失败?
我们的结果揭示了三个一致的发现。首先,推理能量在语义步骤类型之间高度非均匀:早期设定和最终综合步骤锚定了能量的两个极端,而轨迹中段的事实检索步骤则表现出稳定、适中的能量,暴露了一种结构化的类相位计算努力分配,而轨迹级指标无法看到这一点。其次,错误的轨迹在特定推理节点处与较低的推理能量相关,尤其是在最终验证和组合推理状态中。第三,SARE 结合 token 数量作为互补信号,在大多数评估的基准和模型上匹配或优于基于输出的置信度基线,包括 token 对数概率、熵和困惑度。
总之,我们的主要贡献是:
- •我们提出 SARE,这是一个基于几何的框架,通过对 token 隐藏状态 Gram 矩阵进行 CKA 来量化 CoT 轨迹中的步骤级推理努力,捕获 token 级度量所丢弃的 token 间关系动态。
- •我们确定了推理能量在语义步骤类型之间是结构化且非均匀的,并且错误轨迹始终与关键推理节点处的较低能量相关。
- •我们表明,在多样的基准、模型和推理领域上,基于 SARE 的特征在离线推理失败检测方面与基于输出的置信度基线相比具有竞争力或更优。
## 2 相关工作
### 2.1 理解与解释思维链推理
CoT 提示(Wei 等人,2022 (https://arxiv.org/html/2607.28674#bib.bib9))及其变体的出现引发了关于 LLM 如何解决复杂多步问题的广泛研究。虽然经验结果表明 CoT 显著增强了推理性能,但理解这种能力背后的内部机制仍是一个活跃的研究领域。现有工作的很大一部分完全集中在最终表示或生成的输出层上。例如,Self-Consistency(Wang 等人,2022 (https://arxiv.org/html/2607.28674#bib.bib10))等方法对多个推理路径进行采样,并在最终答案上聚合语义簇以提高可靠性。并行的努力通过检查 token 对数概率(Kauf 等人,2024 (https://arxiv.org/html/2607.28674#bib.bib32))或直接从文本输出轨迹中对推理类型进行分类(Madaan 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib12))来分析推理错误。尽管这些方法提供了评估推理路径一致性的实用途径,但它们完全在表层运行,未探索模型深层表示中逐步到逐步的计算努力。因此,表层方法在指出错误开始的确切内部位置方面存在不足。
### 2.2 Transformer 中的内部表示分析
对 Transformer 内部机制的分析传统上研究结构信息如何在层间逐步构建。诸如“调谐透镜”(tuned lenses)(Belrose 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib13))和早停策略(Schwartz 等人,2020 (https://arxiv.org/html/2607.28674#bib.bib16);Teerapittayanon 等人,2016 (https://arxiv.org/html/2607.28674#bib.bib17))等工具试图将隐藏状态映射到最终词汇预测,或确定计算何时可以终止。最近的研究,如 DoLa(Chuang 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib14)),专注于优化特定中间层之间信息差异的解码策略以缓解幻觉。然而,这些方法主要聚焦于轨迹级表示或逐 token 跨层表示追踪。token 级视角通常无法捕获连续推理步骤(例如,一个等式或一个逻辑演绎)的整体语义价值。
我们的工作弥合了文本级 CoT 分析与 token 级层探测之间的差距。通过定义步骤感知推理能量(SARE),我们聚合了与推理步骤对应的特定 token 跨度上的表示转变。此外,我们将最终表示聚类为不同的*推理状态*,超越了原始 token 概率。这种新方法量化了步骤转变的计算努力(通过逐层对齐衡量),并将其置于 CoT 推理的更广泛语义拓扑中(通过基于最终层的状态转变衡量)。因此,我们的框架提供了多个维度:逐步表示变化和语义状态演化,以解释和评估 CoT 推理能力。
## 3 预备知识:将推理建模为状态转移
我们首先将 CoT 轨迹形式化为一个随机过程,以分析内部推理逻辑的演化。
### 3.1 步骤感知形式化
一条 CoT 推理轨迹T\\mathcal\{T\}被分割为TT个离散的文本推理步骤:T=\[s1,...,sT\]\\mathcal\{T\}=\[s\_\{1\}, \\ldots, s\_\{T\}\],其中每个步骤sts\_\{t\}(t=1,...,Tt=1, \\dots, T)由ntn\_\{t\}个 token 组成。为了在给定深度捕获 token 之间的内部语义关系,我们定义 Gram 矩阵Gt\(l\)=Ht\(l\)\(Ht\(l\)\)⊤\\bm\{G\}\_\{t\}^\{(l)\}=\\bm\{H\}\_\{t\}^\{(l)\}(\\bm\{H\}\_\{t\}^\{(l)\})^\{\\top\},其中Ht\(l\)∈Rnt×d\\bm\{H\}\_\{t\}^\{(l)\}\\in\\mathbb\{R\}^\{n\_\{t\}\\times d\}表示步骤sts\_\{t\}在第ll层的 token 隐藏状态矩阵。
### 3.2 语义状态聚类
沿用 Yu 等人(2025 (https://arxiv.org/html/2607.28674#bib.bib2))的方法,我们将推理步骤的进展解释为潜在语义状态之间的转移。每个步骤sts\_\{t\}由一个谱嵌入表示,该嵌入来自其累积 token Gram 矩阵的特征值谱,使用 LLM 的最后一层隐藏状态计算。然后通过KK-均值聚类对这些嵌入进行分组,以推断推理簇(宏观状态)C∈\{C1,...,CK\}C\\in\\{C\_\{1\}, \\dots, C\_\{K\}\\},每个簇捕获一个不同的概念功能,如问题框架、中间验证或事实检索。每个步骤被分配一个硬簇标签,得到的簇序列定义了下游分析的轨迹状态序列。完整实现细节见附录 A.1 (https://arxiv.org/html/2607.28674#A1.SS1)。
### 3.3 马尔可夫转移框架
我们将推理簇序列建模为一阶马尔可夫链。推理过程的动态由转移概率矩阵PP控制,其中从簇CiC\_\{i\}转移到CjC\_\{j\}的概率定义为:
Pij=P\(st\+1=Cj∣st=Ci\)P\_\{ij\}=P\(s\_\{t+1\}=C\_\{j\}\\mid s\_\{t\}=C\_\{i\}\)(1)
这一公式使我们能够追踪跨步骤能量速度ΔE\(st→st\+1\)\\Delta E\(s\_\{t\}\\to s\_\{t+1\}\),并通过状态空间转移的视角分析推理轨迹的稳定性。在实践中,这些跨步骤能量动态在下游分析中通过轨迹级特征向量中的*波动性*、*峰值*和*谷值*统计量(第 5.3 节 (https://arxiv.org/html/2607.28674#S5.SS3.SSS0.Px1))来操作化,这些统计量共同捕获连续步骤之间能量变化的幅度和方向。
## 4 通过几何不相似性量化推理能量
在建立了推理轨迹的语义结构之后,我们现在转向衡量每个步骤内部所耗费的计算努力。
### 4.1 通过中心核对齐(CKA)衡量逐层不相似性
机械可解释性的一个关键见解是,Transformer 层并非均匀地处理所有 token:某些 token 需要在许多层中持续进行表示修订,其上下文角色才能被解决,而另一些 token 则很早就稳定下来,几乎不需要进一步计算(Chuang 等人,2023 (https://arxiv.org/html/2607.28674#bib.bib14);Chen 等人,2026 (https://arxiv.org/html/2607.28674#bib.bib5))。我们在步骤层面操作化这一观察:一个推理步骤如果在连续层之间经历其内部 token 关系几何的实质性重组,那么该步骤就是模型在积极“处理”的,反映了真正的计算努力。相反,一个几何结构迅速稳定的步骤表明模型以极少的处理解决了它。关键在于,这种几何视角作用于原始隐藏状态而非输出级信号,捕获了可能永远不会出现在模型 token 预测中的计算努力。
#### 公式化。
具体来说,我们将 CKA(Kornblith 等人,2019 (https://arxiv.org/html/2607.28674#bib.bib15))应用于中心化 Gram 矩阵G~t\(l\)=MntGt\(l\)Mnt\\tilde\{\\bm\{G\}\}\_\{t\}^\{(l)\}=\\bm\{M\}\_\{n\_\{t\}\}\\bm\{G\}\_\{t\}^\{(l)\}\\bm\{M\}\_\{n\_\{t\}\},其中Mnt=Int−1nt11⊤\\bm\{M\}\_\{n\_\{t\}\}=\\bm\{I\}\_\{n\_\{t\}\}-\\frac\{1\}\{n\_\{t\}\}\\mathbf\{1\}\\mathbf\{1\}^\{\\top\}是标准中心化矩阵,ntn\_\{t\}是步骤sts\_\{t\}中的 token 数量。Int∈Rnt×nt\\bm\{I\}\_\{n\_\{t\}\}\\in\\mathbb\{R\}^\{n\_\{t\}\\times n\_\{t\}\}表示单位矩阵,1∈Rnt\\mathbf\{1\}\\in\\mathbb\{R\}^\{n\_\{t\}\}是全一向量。步骤sts\_\{t\}在相邻层ll和l\+1l+1之间的逐层不相似性得分则为:
Dt\(l\)=1−CKA\(G~t\(l\),G~t\(l\+1\)\)相似文章
通过逐步置信归因诊断黑盒大语言模型中的多步推理失败
提出逐步置信归因(SCA),一个无需内部访问即可为黑盒大语言模型的推理轨迹分配逐步置信度的框架,利用信息瓶颈原理区分合法变异性与错误。实验表明,SCA能可靠地识别低置信度步骤,并将自纠正成功率相比答案级别反馈提升高达13.5%。
面向高效可控LLM推理的代理式思维链引导
ACTS(代理式思维链引导)将LLM推理控制形式化为马尔可夫决策过程,其中控制器代理在推理过程中使用推理策略和引导短语自适应地引导冻结的推理器。该方法在显著节省token的同时实现了与完全思考模型相当的准确率,支持可控的准确率-效率权衡。
@rao2z: \"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器推理...
亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
从推理中探寻真理:一种动态表示编辑框架用于引导LLM轨迹
本文研究了LLM推理链中真理的几何结构,并提出DynaSteer,一种动态表示编辑框架,通过模式聚类和Fisher-LDA引导轨迹趋向真理同时避免噪声。实验表明在MATH基准测试上有效,并能泛化到编码任务。