多少思考才算够?量化与理解LLM推理中的冗余
摘要
本文形式化了LLM中的推理冗余,将其定义为在不影响正确性的情况下可截断的尾部步骤比例,在多个前沿模型上量化出61%-93%的冗余,并证明冗余是长度无关结果奖励的结构性后果。
查看缓存全文
缓存时间: 2026/05/26 08:58
# 思考多少才算够?量化与理解 LLM 推理中的冗余性 代码:https://github.com/zhiyuanZhai20/how-much-thinking-is-enough 来源:https://arxiv.org/html/2605.23926 翟致远 复旦大学 [email protected] &游欣凯 复旦大学 [email protected] 闫文静 香港中文大学 [email protected] &汪鑫 复旦大学 [email protected] ###### 摘要 具备推理能力的大型语言模型通过生成长链思维来解决难题,为此付出了高昂的延迟、GPU 时间和能耗代价。对它们输出轨迹的粗略观察会发现大量的重述、验证和循环性自我反思,但迄今为止,从未有人大规模地测量过这种深思熟虑中有多少是真正必要的,也未能从第一性原理出发解释这种现象。本文填补了这两个空白。我们直接基于推理模型本身来形式化*推理冗余度*:正确轨迹的冗余度,是指其*末尾*分段的步骤可以被截断的最大比例,并且当 π 被迫终止思考并输出最终答案时,仍能产生正确答案。在四个前沿推理模型和两个数学基准测试上进行的大规模量化表明,在我们研究的八个(模型,基准测试)条件下,步骤级别的冗余度持续很高——介于 61% 到 93% 之间,且在八个条件中的六个条件下,中位关键前缀仅为一个分段步骤——这一发现对于评判模型家族的选择是稳健的;尽管在 MATH-500 上,ρ 随着问题难度的增加而降低,但即使在最困难的 Level-5 问题上,所有四个模型依然存在显著的冗余度(ρ ∈ [46%, 85%])。然后,我们证明这种冗余度是由与长度无关的结果奖励(而非模型特定的伪影)导致的结构性后果:在任何此类奖励下,*不存在*有限的最优期望停止时间。该结论不依赖于 RL 算法、基础模型、数据分布,或策略是通过 RL 还是蒸馏得到;因此,过度思考并非需要针对个别模型修补的 bug,而是当前推理模型训练方式的一种结构性属性。 ## 1 引言 具备推理能力的大型语言模型已经重塑了自动化问题求解。OpenAI 的 o 系列(OpenAI,2024;Jaech et al.,2024)、DeepSeek-R1(Guo et al.,2025)、Kimi k1.5(Kimi Team et al.,2025)、Qwen 的 QwQ(Qwen Team,2025)以及开源复现版本(Zeng et al.,2025;Liu et al.,2025;Yu et al.,2025;Rastogi et al.,2025)都会生成长且自我反思的思维链,从而在 MATH-500(Hendrycks et al.,2021)、GSM8K(Cobbe et al.,2021)、AIME 和 LiveCodeBench(Jain et al.,2025)上取得了显著提升。然而,这些提升伴随着高昂的每次查询代价:每个推理 token 都会消耗 GPU 时间、延迟和能量,如今与推理模型交互的用户常常要等待数十秒才能看到第一个答案 token。任何阅读过此类模型原始输出的人也会注意到,它们*思考得似乎比必要程度多得多*:一个三步问题会引出包含大量验证、重述和循环性自我反思的三十步轨迹。尽管“过度思考”现象已被广泛认知,但仍有三个基本问题悬而未决。*究竟应该如何定义什么是冗余推理?*先前的工作要么依赖推理模型自身的行为作为代理(Chen et al.,2024),要么依赖孤立的定性示例(Sprague et al.,2025),缺乏能够大规模应用的协议。*前沿推理轨迹中实际上存在多少冗余?*除了铁事之外,没有进行过多模型、多基准、多评判模型的量化。*为什么会出现这种情况?*过度思考是特定 RL 配方中的 bug、数据诱导的习惯,还是推理模型训练的结构性属性?由于缺乏第一性原理的解释,训练时的长度惩罚(Arora and Zanette,2025;Aggarwal and Welleck,2025;Han et al.,2024;Muennighoff et al.,2025)的运用缺乏预测其何时能成功的理论。本文为所有三个问题提供了答案。 我们的贡献: **C1(定义)**。我们直接基于模型自身来形式化*推理冗余度*:正确轨迹的冗余度,是指其*末尾*分段的步骤可以被截断的最大比例,并且当 π 被迫终止思考并输出最终答案时,仍能产生正确答案(定义 1)。该定义通过渐进式截断来测量,并使用外部非推理评判模型作为稳健性检查。 **C2(大规模实证量化)**。在四个前沿推理模型、两个数学基准测试(GSM8K、MATH-500)以及两个独立评判模型上,所有八个(模型,基准测试)条件下的步骤级别冗余度 ρ 均超过 60%,且在 QwQ-32B 和 Qwen3-30B-Thingking 上,两个基准测试的冗余度均超过 90%。在八个条件中的六个条件下,中位关键前缀仅为*一个*分段步骤。在 MATH-500 上,冗余度随着问题难度的增加而降低,但更难的问题会引发成比例更长的轨迹,因此即使在最困难的 Level-5 问题上,所有四个模型依然存在显著的冗余度(ρ ∈ [46%, 85%])。 **C3(理论解释)**。我们将推理建模为一个序列决策过程,并证明过度思考是由与长度无关的结果奖励(而非模型特定的伪影)导致的结构性后果(定理 1):在任何仅基于结果的奖励下,*不存在*有限的最优期望停止时间。该结论不依赖于 RL 算法、基础模型、数据分布,或策略是通过 RL、蒸馏还是监督微调训练得到。一个直接的推论是,任何修复都必须打破奖励的与长度无关性,这给出了一个简单的训练时配方:在奖励中添加显式的长度惩罚 −λT(或等效的难度感知 token 预算)。 ## 2 相关工作 #### 具备推理能力的 LLM。 思维链提示(Wei et al.,2022;Kojima et al.,2022)首先展示了引出中间步骤能提升推理能力。扩展工作包括自我一致性(Wang et al.,2023)、思维树(Yao et al.,2023)、自我优化(Madaan et al.,2023)、反思式反馈(Shinn et al.,2023)、潜在空间推理(Hao et al.,2024)、由易到难(Zhou et al.,2022)、基于复杂度的提示(Fu et al.,2022)以及过程奖励建模(Uesato et al.,2022;Lightman et al.,2024)。现代推理模型(OpenAI,2024;Guo et al.,2025;Kimi Team et al.,2025;Qwen Team,2025)将推理从提示问题转变为训练问题,通过结果验证的 RL(Shao et al.,2024;Yu et al.,2025;Zeng et al.,2025;Liu et al.,2025)、从长 CoT 教师模型蒸馏(Guo et al.,2025)或推理时计算扩展(Snell et al.,2025;Brown et al.,2024;Muennighoff et al.,2025)来实现。STaR(Zelikman et al.,2022)和 Quiet-STaR(Zelikman et al.,2024)探索了隐式推理解释的 CoT;ReST(Gulcehre et al.,2023)探索了自我训练。关键在于,每种情况下的奖励或监督信号都依赖于答案的正确性,但*不*依赖于轨迹长度。 #### 过度思考、高效推理与自适应计算。 Chen 等人(2024)使用小型算术示例将过度思考现象命名。Shah 等人(2025)和 Liu 等人(2025)认为反思行为继承自预训练,而非源自 RL;Zhao 等人(2025)报告 RL 后训练放大了预训练行为;Dang 等人(2025)研究了补充性的失败模式。并发方法引入了训练时长度惩罚(Arora and Zanette,2025;Aggarwal and Welleck,2025;Han et al.,2024)或测试时预算强制,用于小型蒸馏模型(Muennighoff et al.,2025)。我们的工作在三方面有所不同:(i) 我们提供了一种基于评判模型的、严格的*形式化*定义,使得冗余度能够大规模测量;(ii) 我们进行了*大规模多模型多基准量化*,并辅以多评判模型验证;(iii) 我们首次给出了*理论解释*,将过度思考解释为与长度无关的奖励的结构性后果。我们借鉴的经典先导工作包括自适应计算时间(Graves,2016)和置信自适应语言建模(Schuster et al.,2022)。 ## 3 定义推理冗余度 一个推理 LLM π 接受问题 x,生成由 N 个分段步骤组成的推理轨迹 r = (r₁, ..., r_N),紧接着是最终答案 a。验证器 V(x, a) ∈ {0, 1} 当且仅当 a 匹配标准答案 a⋆ 时返回 1。记 |r_i| 为步骤 r_i 的单词数,L(r) = Σ_i |r_i|。冗余度是*正确*推理的属性,因此以下所有测量均以 V(x, a) = 1 为条件。 判断前缀 r₁:ₖ 是否已包含足够信息来解决问题的最直接方式是询问 π 自身。给定问题 x 和前缀 r₁:ₖ,我们强制 π 终止其思考阶段(在前缀后插入模型自身的思考结束分隔符和答案提示),并读取其产生的最终答案。那么,关键点 k⋆(r) 是在此强制终止协议下,π 产生正确答案 a⋆ 的最小 k。这是我们能做出的最本质的冗余度测量:当且仅当 π 自身不再需要某一步骤来得到 a⋆ 时,该步骤才是冗余的。作为稳健性检查,我们对所有测量使用一个固定的外部非推理评判模型(gpt-4o-mini)重复实验;附录 B.9 报告了外部评判模型的数值,并表明我们的主要结论均不依赖于解码器的选择。 ###### 定义 1(推理冗余度) 对于由 π 在问题 x 上生成的正确轨迹 r = (r₁, ..., r_N),记 π(r₁:ₖ, x) 为 π 在给定前缀和问题时的强制答案输出(即 π 在 r_k 后立即终止思考阶段所输出的答案)。*关键点*为: k⋆(r) = min{ k ∈ {1, ..., N} : π(r₁:ₖ, x) = a⋆ }。 r 的*步骤级别冗余率*为: ρ(r) = 1 - k⋆(r) / N, *单词级别冗余率*为: ρ_L(r) = 1 - L(r₁:ₖ⋆) / L(r)。 等价地,ρ(r) 是 r 的*末尾*分段步骤可以移除的最大比例,同时 π 自身仍能产生正确答案:ρ 回答了问题“轨迹的末尾有多少部分是 π 自己不需要的?”该量无量纲,取值范围为 [0, 1],具有直接解释:ρ = 0.8 的轨迹可以被截断到其步骤的 20%,而不会改变 π 将产生的答案。超出 k⋆(r) 的所有步骤对于*模型自身*而言都是冗余的。 ## 4 测量协议 #### 渐进式前 k 截断。 对于每个正确轨迹 r,我们构造前 k 前缀 r₁:₁, ..., r₁:N,并计算每个对应的 π(r₁:ₖ, x):我们通过前缀后跟模型自身的思考结束分隔符(例如 <think>)和一个请求最终 `\boxed{}` 答案的简短答案提示来恢复 π 的生成。关键点 k⋆(r) 是强制答案正确的 k 的最小值。我们还使用一个固定的非推理外部评判模型(gpt-4o-mini-2024-07-18)完整复制该协议,并在整个过程中报告两种解码器下的冗余度。 #### 补充诊断协议。 另外两种协议探索同一潜在现象的不同方面。*留一步消除消融*构建 N 个单步删除的变体 r_{∖i},并询问每个变体是否仍能得出正确答案;如果一个步骤的移除会翻转答案,则该步骤是*关键的*。这是一个比截断更严格的测试——它询问特定的单个步骤是否必要,而非某个前缀是否足够——并且为真正不可或缺的步骤比例提供了上界。*前缀位置消融*构造四个相同相对长度的前缀——前 k、后 k、中间 k、随机 k——并比较强制答案准确率;只有前 k 测量 ρ,其他三个共同诊断冗余内容集中在轨迹的何处。 #### 模型与基准测试。 我们研究四个涵盖三种训练配方的前沿推理模型:DeepSeek-R1(Guo et al.,2025)(结果验证的 RL,671B 混合专家模型,每个 token 约 37B 活跃参数;下文简称为“MoE”)、QwQ-32B(Qwen Team,2025)(结果验证的 RL,32B 密集模型)、R1-Distill-Qwen-7B(Guo et al.,2025)(从 R1 蒸馏到 Qwen-7B)以及 Qwen3-30B-A3B-Thinking。
相似文章
Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning
This paper characterizes 'futile reasoning' in large language models, where models produce superficially valid but incorrect reasoning on tasks beyond their capability. They introduce CaRL, a capability-aligned reinforcement learning method that trains LLMs to abstain from futile reasoning while preserving performance.
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
大语言模型在最长简单链式推理任务上的表现如何:关于等价类问题的实证研究
本实证研究通过评估大语言模型在等价类问题上的表现,以考察其长链推理能力。研究发现,非推理模型在此类任务上表现失败,而推理模型虽表现更好,但仍难以完全解决特定结构性难题。
通过结构不确定性量化LLM逻辑推理的一致性
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
重新审视LLM推理中的均匀信息密度假设
本文重新审视了LLM推理背景下的均匀信息密度(UID)假设,引入了一个基于熵的框架来量化信息流的均匀性。在七个推理基准上的实验发现,高质量的推理在步骤过渡上表现出局部均匀性,但在轨迹结构上呈现全局非均匀性,这表明LLM推理与人类交流模式存在根本性差异。