何时深度思考:面向LLM推理的抑制性深思
摘要
IDPR是一个用于响应条件抑制性深思的框架,它首先生成快速的直观答案,然后使用一个抑制控制器来决定是否调用慢速推理,在保持准确性的同时实现效率提升。
arXiv:2606.06745v1 公告类型:新
摘要:推理型大语言模型可以通过审慎推理提升问题解决性能,但对每个输入都调用慢速推理在计算上成本高昂且往往不必要。我们提出IDPR,一个用于响应条件抑制性深思的框架。IDPR首先生成简洁的直觉答案,然后使用抑制控制器决定该特定响应是应释放还是抑制,转而采用慢速推理。与仅依赖输入的router不同,抑制控制器以快速答案和快速侧证据为条件,包括置信度、logit边际、可解析性和生成成本。我们从成对的快慢结果中训练控制器,并在以精度为先的慢速调用预算下,于保留验证集上选择抑制阈值。在一个保留的5000样本数学推理测试集上,IDPR仅在8.20%的样本上调用慢速推理,并将准确率从47.90%提升至48.92%。在相同的慢速调用预算下,随机路由将准确率降至46.76%,而最强的基于置信度的基线达到48.22%。IDPR还取得了最高的纠正精确度,表明响应条件抑制能更好地识别那些有望从慢速推理中受益的快速答案。
查看缓存全文
缓存时间: 2026/06/08 09:20
# 何时深入思考:针对LLM推理的抑制性深思 来源:https://arxiv.org/html/2606.06745 Zhixuan He 和 Yue Feng [email protected], [email protected] 英国伯明翰大学 ###### 摘要 推理型大语言模型能通过深思性推理提升问题解决性能,但对每个输入都启用慢推理,计算成本高昂且往往不必要。本文提出IDPR,一个响应条件化抑制推理框架。IDPR首先生成简洁直观的答案,然后由抑制控制器决定该特定响应应被直接输出,还是被抑制以触发慢推理。不同于仅基于输入的路径选择器,抑制控制器的条件包括快速答案及快速侧证据,如置信度、logit边际、可解析性和生成成本。我们从成对的快-慢推理结果中训练控制器,并在保留验证集上以准确性优先的慢调用预算约束下选择抑制阈值。在保留的5000例数学推理测试集上,IDPR仅对8.20%的样本启用慢推理,准确率从47.90%提升至48.92%。在相同慢调用预算下,随机路由将准确率降至46.76%,而最强的基于置信度的基线达到48.22%。IDPR还取得了最高的修正精度,表明响应条件化抑制能更好地识别那些能从慢推理中获益的快速答案。 何时深入思考:针对LLM推理的抑制性深思 Zhixuan He, Yue Feng [email protected], [email protected] 英国伯明翰大学 ## 1 引言 近期在基础智能体方面的进展表明,未来的AI系统不应仅被视为单一的语言模型,而应是结合推理、记忆、感知、控制和行动的模块化认知系统。一个突出的方向是设计具有脑启发架构的智能体,借鉴认知科学和神经科学,其中不同模块支持推理、世界建模、奖励处理和控制等不同功能角色(Liu等人,2025(https://arxiv.org/html/2606.06745#bib.bib21))。同时,专用推理的语言模型已使深思性推理成为现代LLM系统的核心能力(DeepSeek-AI,2025(https://arxiv.org/html/2606.06745#bib.bib14)),这让慢推理变得更加强大,但计算成本也更高。这些进展引出一个重要问题:如果慢推理强大但昂贵,智能系统何时应启用它?一个自然的答案是,并非总是深思熟虑。在人类认知中,快速直觉反应往往先于慢速推理出现。当冲突、错误风险或任务需求显示需要额外控制时,执行控制可以抑制这种优势反应。然而,认知控制本身也有成本;控制期望值理论认为,只有当预期收益值得付出努力时,才应选择性招募控制资源(Botvinick等人,2001(https://arxiv.org/html/2606.06745#bib.bib17);Shenhav等人,2013(https://arxiv.org/html/2606.06745#bib.bib13))。这一视角对LLM推理尤为相关。快速模型可能经常以低成本产生简短正确答案,而推理模型可能花费数百或数千个token进行慢推理。因此,关键挑战不仅是如何进行慢推理,而是如何决定某一特定快速响应是否应被信任或抑制。 本文提出IDPR,一个抑制性深思问题推理框架。IDPR的核心区别在于路由是响应条件化的。IDPR首先从快速策略中生成简洁直觉响应,并将其视为优势候选答案。然后,抑制控制器观察问题、快速答案以及快速侧证据(如置信度、logit边际、可解析性和生成成本)。控制器估计启用慢推理策略是否能比快速响应带来足够收益。如果预期收益高,IDPR抑制快速答案并调用慢策略;否则直接输出快速答案。在本文中,我们在准确性优先的选择性深思设置中评估IDPR,目标是在有限的慢调用预算下提高正确性,同时透明报告推理成本。我们报告准确率、实际慢调用率、生成token成本和成本感知效用。为隔离路由决策的质量,我们与在相同样本数上调用慢推理的等预算基线进行比较,包括随机慢调用选择和基于快速模型对数概率及logit边际的置信度路由。在保留的数学推理测试集上,IDPR仅对8.20%的样本启用慢推理,准确率从47.90%提升至48.92%。在相同慢调用预算下,随机路由将准确率降至46.76%,而最强的基于置信度的基线仅达到48.22%。IDPR还取得最高修正精度:27.07%,表明学习到的抑制控制器能更好地识别那些能从慢推理中获益的快速响应。 我们的贡献如下: - • 我们提出IDPR,一个抑制框架,决定快速答案应被直接输出还是被抑制以进行慢推理。 - • 我们提出一个抑制控制器,从问题、快速答案和快速侧证据中估计慢推理相对于快速的质量提升和慢推理成本。 - • 我们在准确性优先的选择性慢推理协议下评估IDPR,明确报告成本,显示其能提升保留集推理准确率,并在相同预算下优于随机和基于置信度的路由基线。 ## 2 相关工作 #### 高效的LLM路由与级联。 近期工作探索了大语言模型的成本感知路由和级联系统,目标是在响应质量和推理成本之间权衡。FrugalGPT研究LLM级联,自适应选择不同LLM调用以在保持或提高准确率的同时降低成本(Chen等人,2023(https://arxiv.org/html/2606.06745#bib.bib3))。Hybrid LLM基于预测的查询难度和期望质量水平,将查询路由到小型或大型模型(Ding等人,2024(https://arxiv.org/html/2606.06745#bib.bib4)),而RouteLLM从偏好数据中学习路由器,动态在弱模型和强模型之间选择(Ong等人,2025(https://arxiv.org/html/2606.06745#bib.bib5))。这些系统在模型选择和成本-质量权衡方面有效,但通常在条件化于实际候选响应之前做出路由决策。这种响应前路由公式遗漏了推理任务的关键信号:快速答案本身。在数学推理中,快速答案的内容、格式、置信度和不确定性分布可以揭示它是否正确、格式错误或需要进一步深思。因此,IDPR采用不同公式:首先生成快速答案,然后决定该特定响应是否应被输出或抑制。这样,控制器不仅询问输入问题是否困难,而是询问该特定快速响应是否值得为了慢深思而被抑制。 #### 推理模型与测试时计算。 近期工作从提示工程转向构建明确为深思推理优化的模型。DeepSeek-R1展示了大规模强化学习、冷启动数据、多阶段训练和蒸馏可以引发强推理行为,并在多个规模上产生蒸馏推理模型(DeepSeek-AI,2025(https://arxiv.org/html/2606.06745#bib.bib14))。Kimi k1.5进一步证明大规模强化学习和长上下文缩放可以提升多模态和纯文本任务的推理性能(Kimi Team,2025(https://arxiv.org/html/2606.06745#bib.bib22))。Open-Reasoner-Zero和Skywork-OR1探索了推理模型的可扩展开源强化配方,显示基于规则的奖励和长格式推理优化能大幅提升数学和编码性能(Hu等人,2025(https://arxiv.org/html/2606.06745#bib.bib23);He等人,2025(https://arxiv.org/html/2606.06745#bib.bib24))。其他工作研究数据高效或精选的后训练推理,如LIMO和Phi-4-reasoning,表明精心挑选的示例或可教学提示能从有能力的基座模型中引发强推理行为(Ye等人,2025(https://arxiv.org/html/2606.06745#bib.bib25);Abdin等人,2025(https://arxiv.org/html/2606.06745#bib.bib26))。同时,测试时计算扩展研究表明,推理时计算可以通过预算强制、重复采样或计算最优分配等机制进行控制或扩展(Muennighoff等人,2025(https://arxiv.org/html/2606.06745#bib.bib28);Snell等人,2025(https://arxiv.org/html/2606.06745#bib.bib15);Brown等人,2025(https://arxiv.org/html/2606.06745#bib.bib16))。IDPR与这些工作互补:它不是提出新推理模型或耗费更多测试时计算的新方法,而是学习在观察到实际快速响应后何时应调用昂贵的深思推理器。 #### 响应条件化抑制与认知控制。 IDPR受到认知科学中快速直觉响应与昂贵深思控制相关观点的启发。双过程理论区分快速自动响应和更受控的推理过程(Evans和Stanovich,2013(https://arxiv.org/html/2606.06745#bib.bib10);Kahneman,2011(https://arxiv.org/html/2606.06745#bib.bib11))。在认知控制中,当任务需求显示初始激活的优势响应可能不恰当时,可以抑制或覆盖它。这一想法与反应抑制密切相关,控制机制阻止或抑制主导行动倾向(Logan和Cowan,1984(https://arxiv.org/html/2606.06745#bib.bib35);Aron等人,2014(https://arxiv.org/html/2606.06745#bib.bib18))。冲突监控理论进一步表明,冲突或预期错误风险可指示需要额外控制(Miller和Cohen,2001(https://arxiv.org/html/2606.06745#bib.bib12);Botvinick等人,2001(https://arxiv.org/html/2606.06745#bib.bib17))。重要的是,这样的控制并非免费:人们倾向于避免认知需求高的行动(Kool等人,2010(https://arxiv.org/html/2606.06745#bib.bib33)),认知努力具有主观成本(Westbrook等人,2013(https://arxiv.org/html/2606.06745#bib.bib34)),而控制期望值框架将控制分配形式化为预期收益与努力成本之间的权衡(Shenhav等人,2013(https://arxiv.org/html/2606.06745#bib.bib13))。IDPR在LLM推理中实现这一观点。快速答案被视为已形成的优势响应,抑制控制器决定是输出它还是为了慢推理而抑制它。与简单的置信度过滤不同,决策条件化于实际快速响应,并同时估计慢推理相对快速的质量提升和深思成本。 ## 3 方法 ### 3.1 问题设定 给定一个输入推理问题 \(x\),我们的目标是在效用感知的计算预算下产生最终答案 \(y\)。我们考虑两个具有互补性质的推理策略。快速策略 \(\pi_f\) 产生简洁的直觉响应: \[ y_f \sim \pi_f(\cdot \mid x), \] 而慢策略 \(\pi_s\) 执行更深入的推理过程并产生: \[ y_s \sim \pi_s(\cdot \mid x). \] 最终输出为: \[ y = \begin{cases} y_f, & r = \mathrm{fast},\\ y_s, & r = \mathrm{slow}. \end{cases} \] 与始终使用最昂贵推理路径以最大化正确概率的标准准确性导向推理系统不同,我们的目标并非如此。我们优化一个权衡答案质量和推理成本的效用函数。对于输出 \(y\),定义: \[ U(y,x) = \alpha \cdot A(y,x) - \lambda_{\mathrm{tok}} \cdot C(y) - \rho F(y), \] 其中 \(A(y,x)\) 衡量答案正确性,\(C(y)\) 表示生成的token或推理成本,\(F(y)\) 惩罚格式错误或不可解析的输出。系数 \(\alpha\)、\(\lambda_{\mathrm{tok}}\) 和 \(\rho\) 控制正确性、计算和答案格式的相对重要性。与仅从输入 \(x\) 中选择推理路径的预路由方法不同,我们的设置条件化于实际快速响应 \(y_f\) 及其关联的快速侧证据。这一公式允许系统在额外深思被预测能提供足够纠正收益时抑制快速直觉响应,而在快速响应看起来可靠或慢推理的预期收益不证明其成本合理时直接输出快速响应。 ### 3.2 整体框架 参见图1(https://arxiv.org/html/2606.06745#S3.F1)的说明。系统首先生成直觉快速响应,然后应用条件化于问题、快速答案和快速侧证据的抑制控制器。如果切换分数 \(S_\lambda \geq \tau\),则快速响应被抑制,调用慢推理分支;否则直接输出快速响应。 图1提供了所提出的IDPR框架的概览。IDPR遵循抑制性推理范式。给定一个问题 \(x\),系统首先使用快速策略 \(\pi_f\) 生成简洁直觉答案 \(y_f\)。此快速响应被视为优势候选答案:默认情况下可直接输出为最终结果,但当控制器预测更深推理有益时,也可被抑制。路由决策由响应条件化的抑制控制器做出,该控制器条件化于实际快速响应。具体来说,获得 \(y_f\) 后,我们提取一组快速侧证据特征 \(c_f\),包括置信度、logit边际、生成长度、答案形式、可解析性、延迟和重复统计量。然后控制器接收: \[ e_f = (x, y_f, c_f), \] 控制器估计慢推理的预期质量提升及其成本,并计算切换分数: \[ S_\lambda = \widehat{\Delta Q} - \lambda_{\mathrm{inf}} \cdot \widehat{C_s}, \] 其中 \(\lambda_{\mathrm{inf}}\) 控制推理时对计算成本的敏感度。\(S_\lambda\) 越大表明慢推理预期提供更大净收益。因此抑制门定义为: \[ r = \begin{cases} \mathrm{slow}, & S_\lambda \geq \tau,\\ \mathrm{fast}, & S_\lambda < \tau, \end{cases} \] 其中 \(\tau\) 是校准阈值。如果 \(S_\lambda < \tau\),快速响应作为最终答案输出。如果 \(S_\lambda \geq \tau\),控制器抑制快速响应并调用慢策略 \(\pi_s\) 产生更深推理答案。如第2节(https://arxiv.org/html/2606.06745#S2)所述,先前的LLM路由和级联方法通常在条件化于实际候选响应之前决定使用哪个模型或路径。
相似文章
何时思考,何时表达:学习大型语言模型推理中的披露策略
本文提出了“并行交错推理(Side-by-Side Interleaved Reasoning)”方法,通过控制自回归模型中的信息揭示时机,以提高准确性和效率。实验表明,在使用 Qwen3 模型的基准测试中,通过将私密推理与部分信息披露相结合,模型性能得到了提升。
LLM的快速、慢速与工具增强思维:综述
本文提出了一种LLM推理策略的分类法,沿着两个正交轴:快速与慢速思考、内部与外部知识,并综述了近期自适应推理方法。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
@mdeng34: 前沿LLM正汇聚于高效、自适应推理。Opus 4.7让模型自行决定推理深度。GPT…
新研究引入了SR²AM,这是一种自调节何时使用模拟推理的配置器,提升了LLM的效率和性能。
@rasbt: LLM 如何切换低、中、高努力推理?以及 LLM 如何学习推理更多或更少?
一篇文章解释 LLM 如何在推理和训练中切换低、中、高努力推理。