避免过度思考,避免思考不足:迈向智能体AI中的自适应推理

arXiv cs.AI 论文

摘要

该论文提出在智能体AI系统中采用自适应推理,根据任务需求动态分配计算资源,通过在MATH-500和GAIA基准测试中的评估来避免过度推理和思考不足。

arXiv:2608.26442v1 公告类型:新 摘要:近年来,大型语言模型(LLMs)的进展表明,增加推理时的推理可以提高复杂任务的性能。然而,许多现有方法依赖于固定或预先分配的推理控制,如固定的令牌预算、预执行难度估计或激活空间干预,并且通常在独立的推理基准上进行评估,而不是完整的工作流程。这些假设在智能体AI系统中可能不成立,因为在智能体AI系统中,推理需求通过规划、工具使用、记忆检索和代理间交互动态演变。因此,推理可能变得过度或不足,导致不必要的计算、延迟增加、规划漂移、过度工具使用或不完整的解决方案。我们认为,下一代智能体AI的一个主要挑战不仅仅是语言模型应该执行多少推理,而是如何根据不断变化的任务需求分配推理。我们将过度推理和思考不足表征为推理分配不当的常见失败模式,并在MATH-500和GAIA公共验证基准上进行评估。使用工具决策延迟、令牌消耗、令牌限制耗尽和答案正确性,我们的结果表明,被分类为过度推理的案例与较高的计算成本相关,而没有相应的准确性提高,而被分类为思考不足的案例则与不正确或不完整的解决方案一致相关。这些发现为未来在智能体AI自适应推理机制的研究提供了动力。
查看原文
查看缓存全文

缓存时间: 2026/08/28 09:35

# 面向智能体AI的自适应推理研究
来源:https://arxiv.org/html/2608.26442

## 避免过度思考与思考不足:面向智能体AI的自适应推理
Md Jueal Mia 与 M. Hadi Amini  
邮箱:[\{mmia001, moamini\}@fiu\.edu](mailto:{mmia001,%20moamini}@fiu.edu)  
所属机构:Knight基金会计算与信息科学学院,相互依存网络的安全、优化与学习实验室(SOLID实验室),佛罗里达国际大学,美国佛罗里达州迈阿密

### 摘要
大型语言模型(LLMs)的最新进展表明,增加推理时间内的推理能力可提升复杂任务的性能。然而,现有许多方法依赖固定或预分配的推理控制机制,如固定令牌预算、执行前难度估计或激活空间干预,且通常在独立的推理基准而非完整的智能体工作流中进行评估。这些假设在智能体AI系统中可能不成立,因为推理需求会通过规划、工具使用、记忆检索和智能体间交互动态演变。因此,推理可能变得过度或不足,导致不必要的计算、延迟增加、规划漂移、过度工具使用或解决方案不完整。我们认为,下一代智能体AI的主要挑战不仅是语言模型应执行多少推理,而是如何根据不断变化的任务需求分配推理能力。我们将过度推理和推理不足表征为推理分配不当的典型故障模式,并在MATH-500和GAIA公开验证基准上进行评估。通过工具决策延迟、令牌消耗、令牌限额用尽和答案正确性等指标,我们的结果表明:被归类为过度推理的情况通常伴随更高的计算成本,但准确性未相应提升;而被归类为推理不足的情况则普遍与错误或不完整的解决方案相关。这些发现为未来研究智能体AI的自适应推理机制提供了动力。

### 关键词
智能体AI、自适应推理、过度推理、推理不足、推理效率

## 1. 引言
LLMs的最新进展显著增强了其推理能力,使其能够通过逐步推理解决复杂问题。这一进步催生了一类称为大型推理模型(LRMs)的模型,通常通过监督微调(SFT)和基于人类反馈的强化学习(RLHF)开发。通过生成思维链(CoT)推理轨迹,LRMs能够执行涉及逻辑推断、数学推理、规划和决策的复杂任务(Sui等,2025)。因此,这些模型在一系列具有挑战性的基准测试中表现出色。这些进展建立在一系列基础研究之上,包括用于显式推理的思维链提示(Wei等,2022)、推理与行动框架如ReAct(Yao等,2022)以及专用推理模型的出现,包括OpenAI o1(OpenAI,2024)和Phi-4-reasoning(Abdin等,2025)。

尽管有这些改进,显式推理在推理期间会引入显著的计算开销,增加延迟和令牌消耗,导致更高的推理成本。近期研究综述将高效推理识别为下一代语言模型的关键挑战,强调需要在推理期间更好地分配计算资源的机制(Amini等,2025)。虽然广泛推理通常对复杂任务有益,但对简单查询而言常常不必要,而现有LRMs常常通过在简单问题上过度计算、在更困难问题上推理不足来低效分配推理能力,这造成了推理质量与计算效率之间的权衡(Aggarwal等,2025)。

这一挑战在智能体AI系统中变得更加突出,其中一个或多个LLMs协调规划、工具使用、记忆检索、环境交互和多步决策(Sapkota等,2025)。在此类系统中,专门组件(例如规划器和响应生成器)可能独立调用LLM并执行各自的推理过程,导致单个组件的不必要推理在流水线中累积,显著增加整体延迟、令牌使用量和计算成本。

**图1. 智能体AI中过度推理与推理不足概述。** 智能体循环中标注了四种故障模式:冗余推理、弱推理、重复工具使用和无工具使用(跳过工具调用)。

随着推理时计算成为现代AI系统部署中的重要因素,理解如何动态调整推理努力以适应给定任务的复杂性已成为一项重要研究挑战。开发更高效分配推理资源的机制可以在保持甚至提高整体任务性能的同时减少不必要的计算成本。这一挑战对智能体AI系统尤为重要,因为推理效率直接影响可扩展性、响应性和实际可用性。图1展示了由于推理分配不当引起的主要挑战,这些挑战促使了本研究。

本文的主要贡献如下:
- 我们研究了智能体AI中过度推理和推理不足的影响,展示了相对于任务要求而言过度或不足的推理努力如何与更高的推理成本或任务性能下降相关。
- 我们在基于LangGraph的智能体AI框架中,使用代表性的推理模型对MATH-500和GAIA进行了推理分配的定量分析。我们的结果揭示,当前的推理模型经常表现出过度推理或推理不足,导致智能体AI的推理分配效率低下。
- 基于我们的发现,我们识别了关键的研究挑战,并概述了自适应推理机制的候选评估维度和未来方向,这些机制能动态决定何时推理、何时行动以及何时停止。

## 2. 相关工作
近期研究探讨了推理在智能体AI系统中日益增长的作用。Wu等(Wu等,2025)证明,集成搜索、编码和记忆代理可以增强复杂推理能力。随着智能体推理变得越来越复杂,研究人员开始审视其效率影响。Kim等(Kim等,2026)表明,更深层次的推理和测试时扩展带来了显著的计算和基础设施成本。类似地,Tran等(Tran和Kiela,2026)发现,增加推理和协调并不总能提高性能,在相同计算预算下,单智能体系统通常优于多智能体架构。Wang等(Wang等,2025)表明,增加推理预算、添加更多规划步骤以及采用复杂的记忆机制通常只能带来边际性能提升,却显著增加了计算成本,而Becker等(Becker等,2026)揭示,延长的智能体交互可能导致讨论偏离任务目标,导致性能下降。

总的来说,这些发现表明,增加推理努力、智能体交互和测试时计算并不一定能转化为更好的智能体性能,反而可能引入低效性,如过度思考、规划漂移和协调开销。尽管取得了这些进展,但许多现有方法仍然依赖固定的推理预算,或在完整智能体工作流之外评估自适应推理。这些假设在智能体AI中可能不成立,因为推理需求会通过与工具、记忆和外部环境的交互动态演变。因此,智能体必须决定何时继续推理、何时调用工具或何时行动,而额外的推理可能会放大噪声观测而非改进决策。此外,先前的研究表明,延长的推理和重新规划可能导致规划漂移,即智能体逐渐偏离用户目标,尽管本研究未直接测量规划漂移。这些观察提出了一个关键问题:何时额外推理能提高智能体性能,何时适得其反?回答这个问题对于开发高效分配推理同时保持与任务目标一致的智能体AI系统至关重要。

## 3. 预备知识
### 3.1. 智能体AI系统
智能体AI代表了从传统AI系统向能够在动态环境中以最少人类干预自主运行的、目标导向系统的转变(Acharya等,2025)。与通常针对预定义任务设计的传统AI不同,智能体AI能够适应不断变化的条件,根据上下文信息做出决策,并在较长时间内追求复杂目标(Hosseini和Seilani,2025)。近期的研究进一步将智能体AI描述为超越单智能体架构的演进,强调跨多种应用领域实现复杂目标的多智能体协作、动态任务分解、持久记忆和协调自主性(Sapkota等,2025)。这些能力使智能体系统能够超越简单自动化,实现现实环境中的自主问题解决、自适应决策和协作任务执行。

### 3.2. 推理不足、充分推理与过度推理
推理模型的最新进展表明,增加推理努力并不总能提高性能。模型可能低效分配推理,对简单问题产生不必要的长推理轨迹,同时未能为更具挑战性的问题分配足够的推理,且答案正确性与推理长度通常呈非线性关系(Su等,2025)。在智能体场景中,更强的推理能改善面向规划的任务,但会带来显著更高的计算成本和推理开销(Zhou等,2025)。此外,过多的测试时推理会产生收益递减,甚至可能导致模型放弃先前正确的答案,突显了推理过程中过度思考的风险(Zhou等,2026)。这些发现表明,智能体系统应根据任务复杂性调整推理努力,而非依赖统一长度的推理过程。

从概念上,我们区分三种推理模式:
- *推理不足*:当智能体为任务分配的推理、证据收集或验证不足时发生,例如省略中间推理步骤、未能收集足够证据或过早终止。
- *过度推理*:当智能体继续进行超出必要范围的推理时发生,表现为冗余的深思熟虑、重复验证或不必要的推理,增加了计算成本。
- *充分推理*:介于上述两个极端之间,推理努力足以完成任务,既不表现出推理不足也不表现出过度推理。

## 4. 初步研究:推理分配不当的证据
### 4.1. 实验设置
实验在一台配备两块NVIDIA RTX A6000 GPU(每块48GB显存)的服务器上进行。我们的基于LangGraph的智能体AI框架通过vLLM兼容API提供服务,使用Qwen3.5-4B作为路由器[1],最终响应模型为Qwen3.5-4B、Llama-3.1-8B-Instruct[2]和Phi-4-reasoning[3]。Qwen3.5-4B配置对路由器和最终响应使用相同模型。每个模型均在所有500个MATH-500测试问题(Team,2024)和165个GAIA验证任务(Mialon等,2024)上使用确定性解码(温度=0.0)进行评估,最大生成长度为4,096个令牌。我们记录了工具使用情况、延迟、令牌消耗、令牌限额命中情况和完整的交互轨迹。对于推理模型,推理令牌从<reasoning>和</reasoning>标签之间的令牌计算得出;由于Llama-3.1-8B-Instruct不公开推理轨迹,该指标报告为N/A。最后,GPT-4.1独立将每个轨迹分类为*过度推理*、*推理不足*或*充分推理*,并将最终答案标记为*正确*、*错误*或*不完整*,推理标签的分配独立于答案正确性。

[1] Hugging Face标识符:Qwen/Qwen3.5-4B
[2] Hugging Face标识符:meta-llama/Llama-3.1-8B-Instruct
[3] Hugging Face标识符:microsoft/Phi-4-reasoning

## 5. 研究发现
**表1. 智能体AI在MATH-500和GAIA上的平均运行时和推理统计。** 工具智能体模型:Qwen3.5-4B。
**表2. 智能体AI在MATH-500和GAIA上的推理效率与答案质量。** 工具智能体模型:Qwen3.5-4B。评判模型:GPT-4.1。命中准确率指最终模型达到最大输出令牌限制的样本的准确率,未命中准确率指未达到最大输出令牌限制的样本的准确率。

对表1和表2的分析表明,在评估的基于LangGraph的智能体中,过度推理和推理不足在推理密集型(MATH-500)和现实世界多步(GAIA)任务中都表现为反复出现的故障模式。评估的智能体并非始终根据任务要求分配推理努力,而是经常分配过度或不足的推理,导致计算成本增加或任务性能下降。

第一个主要问题是**过度推理**。在MATH-500上,Phi-4-reasoning表现出最高的过度推理率(89.40%),其次是Qwen3.5-4B(68.00%)和Llama-3.1-8B-Instruct(19.80%)。它还生成最多的推理令牌(2220.12)、最长的输出(4046.59个令牌)和最高的最终推理时间(180.80秒),相比之下Qwen3.5-4B(1732.39个推理令牌,2461.67个输出令牌,70.21秒)和Llama-3.1-8B-Instruct(904.48个输出令牌,21.42秒)。尽管Phi-4-reasoning达到了最高的准确率(92.40%),但它在500个样本中有482个达到了最大令牌限制,而Qwen3.5-4B和Llama-3.1-8B-Instruct分别只有190个和71个。在GAIA上观察到类似趋势,Phi-4-reasoning再次产生了最长的推理轨迹(2897.95个推理令牌,4091.12个输出令牌,182.94秒)。由于

相似文章

递归代理推理

arXiv cs.AI

本文将测试时推理方法重新诠释为递归算子——Grow、Prune 和 Branch——并对其进行评估,发现 Branch 通过从预算耗尽的输出中恢复,持续提高准确性,同时建议在比较研究中使用配对评分。

自适应潜在智能体推理

arXiv cs.CL

本文介绍了自适应潜在智能体推理(ALAR),一种针对LLM智能体的双模式框架,它使用紧凑的潜在推理处理常规轮次,并选择性地升级为显式思维链以应对更困难的决策,实现了高达84.6%的令牌减少,同时保持任务准确性。