LLM的快速、慢速与工具增强思维:综述
摘要
本文提出了一种LLM推理策略的分类法,沿着两个正交轴:快速与慢速思考、内部与外部知识,并综述了近期自适应推理方法。
arXiv:2508.12265v2 公告类型:替换
摘要:大型语言模型(LLMs)在跨领域推理方面取得了显著进展。然而,在现实任务中实现有效推理需要根据问题需求调整推理策略,从快速直观的响应到深思熟虑的逐步推理以及工具增强的思维。受认知心理学启发,我们提出了一种新颖的LLM推理策略分类法,该分类法基于两个知识边界:区分直观过程与深思过程的快速/慢速边界,以及区分基于模型参数的推理与借助外部工具增强的推理的内部/外部边界。我们系统地综述了近期关于LLM自适应推理的研究,并根据关键决策因素对方法进行分类。最后,我们指出了开放挑战和未来方向,以实现更具适应性、高效性和可靠性的LLM。
查看缓存全文
缓存时间: 2026/07/09 07:54
# 大语言模型的快思考、慢思考与工具增强思考:综述
来源:https://arxiv.org/html/2508.12265
Jinpeng LiZezhong WangJingjing LiXingshan ZengYasheng WangWeinan ZhangYong Yu上海交通大学机械与动力工程学院, 上海 200240, 中国上海交通大学计算机科学与工程学院, 上海 200240, 中国华为技术有限公司, 北京 100084, 中国香港中文大学系统工程与工程管理系, 香港 999077, 中国香港中文大学计算机科学与工程系, 香港 999077, 中国华为香港研究中心, 香港 999077, 中国
###### 摘要
大语言模型 (LLMs) 在跨不同领域的推理方面展现出了显著进展。然而,真实世界任务中的有效推理需要将计算深度和知识来源都适应于问题的需求,范围从快速、直觉式的响应到审慎、逐步的推理,以及从纯粹的内部推理到外部工具增强的过程。受认知心理学启发,我们沿着两个正交的知识边界提出了一种新颖的 LLM 推理策略分类法:(1) 一个快/慢边界,将直觉过程与审慎过程区分开来;(2) 一个内部/外部边界,将基于模型参数的推理与由外部工具增强的推理区分开来。我们系统地调研了 LLM 中自适应推理的近期工作,并根据关键决策因素对方法进行分类。最后,我们指出了实现更具适应性、高效性和可靠性的 LLM 所面临的开放挑战和未来方向。
###### 关键词:
自然语言处理, 人工智能, 机器学习
\[2\]Weiwen Liu\\fcssetupreceived = month dd, yyyy, accepted = month dd, yyyy, corr\-email = wwliu@sjtu\.edu\.cn,
参考图标题图 1:快思考、慢思考与工具增强思考的比较。左侧展示了定义推理策略的2×22\\times 2结构的两个知识边界:快/慢知识边界和内部/外部知识边界。右侧展示了每种推理策略的代表性任务。## 1引言
> 心灵不是一个单一的、无差别的实体,而是一系列由进化塑造的专门机制,用于解决不同类别的问题。
> — Steven Pinker,《心智探奇》(1997)
大语言模型 (LLMs) 正在快速发展,稳步推动着通往通用人工智能 (AGI) 的边界\[anthropic2025claude, guo2025deepseek\]。在 LLM 的推理能力方面,包括数学、编码和逻辑推理,已经取得了重大突破,例如 OpenAI o3\[openai2025o3\]、DeepSeek-R1\[guo2025deepseek\] 和 Grok 4\[xai2025grok4\] 等模型。推理——基于已有信息进行推断、做出决策和解决问题的能力——是人类智能的核心\[li2502system\]。最近的研究指出了 LLM 中几种不同的推理策略,这些策略与人类认知理论大致吻合\[kahneman2011thinking\]。
特别是,这些策略通常从快思考、慢思考和工具增强思考的角度进行讨论。从结构角度来看,这些推理策略可以通过两个正交维度来表征,而不是作为三种互斥的模式。快/慢知识边界反映了计算深度的差异,区分了直觉、快速的响应与审慎、逐步的推理。内部/外部知识边界捕捉了知识来源的差异,区分了完全基于模型内部参数的推理与由外部工具或信息来源增强的推理。由此看来,工具增强思考并非快思考或慢思考的独立替代品,而是一个可以与两者相交的外部知识维度。
• **快思考**:
类似于人类系统 1 的认知,快思考涉及模型直接生成的直觉式响应,无需明确的中间步骤\[pan2024dynathink\]。快思考具有低延迟和高吞吐量的特点,特别适合简单或常规任务,例如日常对话、情感分类、表面级摘要以及模型高置信度的事实性问题。然而,当输入模糊、不熟悉或需要多步推理时,它容易出错。
• **慢思考**:
类似于人类系统 2 的认知,慢思考进行逐步的、审慎的推理。诸如思维链 (CoT) 提示\[wei2022chain\] 及其扩展(如思维树 (ToT)\[yao2023tree\]),以及其他技术,包括自我反思\[ji2023towards\] 和中间验证\[liang2024improving\],使模型能够分解问题、探索替代推理路径并验证中间结果。这种模式对于复杂任务特别有效,例如数学问题求解、逻辑演绎、规划和科学解释,在这些任务中,中间推理步骤对于正确性至关重要,尽管代价是增加延迟和计算量。
• **工具增强思考**:
工具增强思考通过整合外部工具(例如,计算器、代码解释器、搜索引擎或知识数据库)超越了模型自身的能力。当任务需要精确的数值计算、访问最新或特定领域的知识,或与外部环境(如网页搜索、代码执行和检索增强生成 (RAG))交互时,这种模式特别有用。工具既可以支持快思考(通过快速提供相关信息),也可以支持慢思考(通过详细计算、中间验证和探索替代推理路径来增加深度)。这反映了人类依赖外部辅助工具来弥补记忆限制和知识缺口,能够根据手头任务实现更快的响应和更彻底的推理。
然而,现实世界应用的复杂性和多样性要求 LLM 能够灵活地调整其推理策略,以适应每个任务的准确性和延迟约束。因此,选择和转换 LLM 的适当推理策略成为一个活跃且不断发展的研究领域\[zhao2025let, kojima2022large\]。不同的任务需要不同的推理模式:快节奏、直觉式的响应可能足以应付日常对话或表面级摘要,而复杂问题求解、多步逻辑演绎或需要事实精确性的任务,则通常需要更慢、更审慎的推理或外部工具整合。任务需求与模型推理策略之间的不匹配可能导致效率低下或错误\[sun2025detection\]。
例如,当需要更深入的分析时(如数学问题求解、法律论证或科学解释),思考不足可能导致肤浅或不正确的响应\[wei2022chain\]。另一方面,过度思考也可能是有害的\[schuster2022confident\]。对简单任务应用复杂的推理策略可能会引入不必要的延迟和计算,并且中间痕迹可能包含误导最终答案的幻觉或虚假步骤\[sun2025detection\]。此外,仅依赖内部知识的语言模型容易产生幻觉,尤其是在处理事实性或长尾查询时\[roberts2020much\]。然而,盲目整合检索到的知识可能会破坏模型行为的稳定性并传播错误\[moskvoretskii2025adaptive\]。
更深入地理解 LLM 如何进行推理,以及这些推理过程如何被引导或改进,对于提升模型能力以及增强其在现实世界应用中的可靠性至关重要。为满足这一需求,我们提出了一种沿着两个知识边界组织的分类法,如图1 (https://arxiv.org/html/2508.12265#S0.F1) 所示。快/慢知识边界反映了推理深度的差异,区分了直觉、快速的响应与审慎、逐步的推理。内部/外部知识边界捕捉了知识来源的差异,区分了完全基于模型内部参数的推理与由外部工具或信息来源增强的推理。
基于这两个知识边界,我们进一步调研并分类了关于自适应推理策略选择的现有研究。据我们所知,这是第一篇系统性地审视在所有三种主要推理策略——快思考、慢思考和工具增强思考——之间进行自适应选择的综合综述。我们的主要贡献总结如下:
- • 我们提出了首个关于 LLM 推理策略的综合分类法,该分类法沿着两个知识边界组织:快/慢知识边界和内部/外部知识边界。
- • 我们对自适应推理策略选择的现有研究进行了系统分析,并根据关键决策因素(如模型置信度、任务复杂性和效用增益)对方法进行分类。
- • 我们识别并讨论了改善 LLM 推理策略选择所面临的开放挑战和有前景的未来方向。
## 2形式化定义
受自适应推理系统中广泛采用的决策原则启发,我们将 LLM 中的推理策略选择视为评估多个决策信号并跨越边界的过程。因此,我们引入了一个统一框架,将现有方法抽象为决策因素提取和基于分数的策略选择,而不假设特定的实现方式。
### 2.1决策因素提取
给定输入查询xx 和模型参数θ\\theta,LLM 的推理策略选择框架首先提取一些决策因素。
这些因素表示为:
g\(d\)\(x,θ,c\)=\[f1d,f2d,…,fndd\],\\displaystyle\\mathbf\{g\}^\{\(d\)\}\(x,\\theta,c\)=\[f\_\{1\}^\{d\},f\_\{2\}^\{d\},\\ldots,f\_\{n\_\{d\}\}^\{d\}\],\(1\)g\(s\)\(x,θ,c\)=\[f1s,f2s,…,fnss\],\\displaystyle\\mathbf\{g\}^\{\(s\)\}\(x,\\theta,c\)=\[f\_\{1\}^\{s\},f\_\{2\}^\{s\},\\ldots,f\_\{n\_\{s\}\}^\{s\}\],\(2\)这里,g\(d\)\\mathbf\{g\}^\{\(d\)\} 和 g\(s\)\\mathbf\{g\}^\{\(s\)\} 分别表示与推理深度和知识来源选择相关的特征列表。可选项控制信号 cc 捕获显式的指导或约束——例如用户提示、预定义规则、计算预算或外部路由指令。在某些场景中,cc 可能被省略或隐含地编码在模型架构或提示中。
提取的决策因素可以捕捉模型的一系列行为信号。这些可能包括内部信号,如模型置信度或不确定性,以及外部上下文线索,如任务类型或用户意图。例如,通过输出 logits 测量的模型置信度分布\[schuster2022confident\] 作为不确定性的代理,可以指导推理深度。Self-Route\[he2025self\] 将查询复杂度作为模型条件决策因素。通过在具有连续难度梯度的数据集上进行训练,其路由机制学会自适应地确定给定查询是可以通过浅层推理处理,还是需要更深入的处理。
### 2.2策略选择
基于提取的决策因素,系统应用一个选择过程来在一个或多个决策单元处计算决策分数:
Φd\(x,θ,c\)\\displaystyle\\boldsymbol\{\\Phi\}\_\{d\}\(x,\\theta,c\)=μd\(g\(d\)\(x,θ,c\)\),\\displaystyle=\\mu\_\{d\}\\left\(\\mathbf\{g\}^\{\(d\)\}\(x,\\theta,c\)\\right\)\\,,\(3\)Φs\(x,θ,c\)\\displaystyle\\boldsymbol\{\\Phi\}\_\{s\}\(x,\\theta,c\)=μs\(g\(s\)\(x,θ,c\)\),\\displaystyle=\\mu\_\{s\}\\left\(\\mathbf\{g\}^\{\(s\)\}\(x,\\theta,c\)\\right\)\\,,\(4\)其中 Φd\\boldsymbol\{\\Phi\}\_\{d\} 和 Φs\\boldsymbol\{\\Phi\}\_\{s\} 表示决策分数的向量。它们可能包含一个或多个条目,具体取决于策略选择过程 μd\\mu\_\{d\} 或 μs\\mu\_\{s\} 是全局执行一次\[lou2025adacot, liang2025thinkswitcher\],还是在生成过程中动态执行(例如在 token、句子或步骤级别)\[jiang2023active, yan2025mur\]。具体来说,g\(d\)\\mathbf\{g\}^\{\(d\)\} 或 g\(s\)\\mathbf\{g\}^\{\(s\)\} 可能包含源自 logits 的置信度或不确定性信号,相应的选择过程 μd\\mu\_\{d\} 或 μs\\mu\_\{s\} 可以按句子方式应用。在这种情况下,每个句子级别的决策单元产生一个决策分数,这些分数共同构成向量 Φd\\boldsymbol\{\\Phi\}\_\{d\} 或 Φs\\boldsymbol\{\\Phi\}\_\{s\}。例如,在 FLARE\[jiang2023active\] 中,g\(s\)\\mathbf\{g\}^\{\(s\)\} 由源自模型 logits 的 token 概率实例化,μs\\mu\_\{s\} 作为句子级别的选择过程运行。对于每个临时生成的句子,它记录每个 token 的生成概率,并根据最低 token 概率计算句子级别的选择分数。这些句子级别分数的集合形成向量 Φs\\boldsymbol\{\\Phi\}\_\{s\}。
重要的是,这些向量中的每个条目对应一个标量决策标准,记为 Φd,t\\Phi\_\{d,t\} 或 Φs,t\\Phi\_\{s,t\}。在某些方法中,这个分数是显式暴露的,并且可以采取各种形式,包括线性聚合、一组值的最小值、基于置信度的分数或其他基于规则的决策标准\[liang2025thinkswitcher\]。在其他方法中,特别是端到端学习方法,它可能不会直接报告,但可以被解释为由学习到的策略相对于替代推理动作所诱导的隐式偏好\[zhang2025adaptthink\]。
这种选择过程可以手动设计、通过启发式方式指定,或通过监督训练或强化学习来学习\[tu2025learning\]。例如,CGR 框架\[nogueira2025certainty\] 以逐步方式实例化了一个自适应推理深度选择框架。它使用源自模型 logits 的 token 概率作为置信度决策因素。选择过程通过探测当前的推理痕迹,在每个预定义的推理步骤评估这些因素,并产生一个标量不确定性分数,该分数源自所选答案 token 中的最低 token 概率,然后与预定义阈值进行比较,以确定是否应触发更深入的推理。
具体来说,Φd\\boldsymbol\{\\Phi\}\_\{d\} 和 Φs\\boldsymbol\{\\Phi\}\_\{s\} 是选择分数的向量,用作路由变量,代表分配额外推理或外部资源的预期收益。相应的阈值向量记为 δd\\boldsymbol\{\\delta\}\_\{d\} 和 δs\\boldsymbol\{\\delta\}\_\{s\},产生的选择结果记为向量 kd\\boldsymbol\{k\}\_\{d\} 和 ks\\boldsymbol\{k\}\_\{s\}。对于每个决策单元 tt,当相应的分数条目超过其关联的推理深度阈值条目 δd,t\\delta\_\{d,t\} 或知识来源阈值条目 δs,t\\delta\_\{s,t\} 时,相应的知识边界被跨越,产生以下决策函数:
kd,t\(x,θ,c\)=\{快思考,ifΦd,t<δd,t慢思考,ifΦd,t≥δd,tk\_\{d,t\}\(x,\\theta,c\)=\\begin\{cases\}\\textit\{快思考\},\\text\{if \}\\Phi\_\{d,t\}<\\delta\_\{d,t\}\\\\ \\textit\{慢思考\},\\text\{if \}\\Phi\_\{d,t\}\\geq\\delta\_\{d,t\}\\end\{cases\}\\\\\(5\)ks,t\(x,θ,c\)=\{内部知识,ifΦs,t<δs,t外部知识,ifΦs,t≥δs,tk\_{s,t}相似文章
@rasbt: LLM 如何切换低、中、高努力推理?以及 LLM 如何学习推理更多或更少?
一篇文章解释 LLM 如何在推理和训练中切换低、中、高努力推理。
@rao2z: \"当LLM输出逐步计划时,它会产生一种强烈的错觉,让你以为正在观看机器推理...
亚利桑那州立大学的Subbarao Kambhampati教授及研究人员在一篇立场论文中提出,LLM中的思维链推理制造了一种推理假象,业界需要超越昂贵的token生成,转向替代推理机制。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
大语言模型在最长简单链式推理任务上的表现如何:关于等价类问题的实证研究
本实证研究通过评估大语言模型在等价类问题上的表现,以考察其长链推理能力。研究发现,非推理模型在此类任务上表现失败,而推理模型虽表现更好,但仍难以完全解决特定结构性难题。
LLM推理的周期表:推理范式、方法与失败模式的系统综述
一项综合分析超过300篇关于LLM推理的论文,提出了推理范式的分类体系,包括Chain-of-Thought、Multi-Hop、Mathematical、Commonsense等,并总结了常见的失败模式和研究空白。