通过结构化元认知在通用智能体中实现深度推理

arXiv cs.CL 论文

摘要

本文介绍了深度推理(Deep Reasoning),这是一种在推理阶段利用结构化元推理为通用智能体构建特定任务脚手架的方法。提出的智能体 Dolores 通过将认知分配到低负载的推理线程中,减少了幻觉并提升了在多个基准测试上的表现,优于现有方法。

arXiv:2605.11388v1 公告类型:新论文 摘要:人类通过灵活地在各种推理模式之间切换来直观地解决复杂问题:他们进行规划、执行、修订中间目标、通过联想判断解决歧义,并将形式化程序应用于明确定义的子问题。当前的 LLM 智能体缺乏这种灵活性,因为它们的脚手架预先硬编码了这些推理决策。当规定的结构与任务相匹配时,这些脚手架非常有效,但在解决需要调整推理结构本身的任务时则显得脆弱。我们提出了深度推理(Deep Reasoning)——一种在推理阶段通过结构化元推理构建特定任务脚手架的方法。深度推理使用一种形式化语言,将元推理表示为对联想推理、形式化计算和递归子问题求解的可执行分解,使得分解原则可以编码为上下文示例,以指导测试时的脚手架构建。我们在一个通用智能体(DOLORES)中实现了这种方法,该智能体将复杂任务分配到更可控的推理线程中。我们在四个高难度基准上对其进行了评估:多跳推理、长链问答、长上下文聚合以及深度研究风格的信息检索。在三种模型规模和两个模型家族中,DOLORES 优于所有已评估的脚手架方法,平均比最强的评估脚手架基线提高了 24.8%。DOLORES 将认知分布在结构化的、低负载的推理线程中,从而减少了过早终止和幻觉。这一优势甚至可以弥合扩展差距,其 8B 版本在超过一半的设置中超越了来自同一家族的所有已评估的 32B 基线。这些结果表明,未来的智能体系统将把脚手架视为适应性推理,即时构建每个任务所需的结构。
查看原文
查看缓存全文

缓存时间: 2026/05/13 06:11

# 通过结构化元认知实现通用代理的深度推理
来源: https://arxiv.org/html/2605.11388

Dean Light¹ Michael Theologitis¹¹¹脚注标记:1 Kshitish Ghate¹¹¹脚注标记:1 Shuyue Stella Li¹ Benjamin Newman¹ Chirag Shah¹ Aylin Caliskan¹ Pang Wei Koh¹ Dan Suciu¹ Yulia Tsvetkov¹ ¹美国华盛顿大学西雅图分校 \{deanlcs, mthe, kghate\}@cs\.washington\.edu

dolores (https://github.com/DeanLight/dolores)

###### 摘要

人类通过灵活地在不同推理模式之间切换来解决复杂问题,且往往无需显式的深思熟虑:他们会规划、执行、修订中间目标、通过联想判断解决歧义,并将形式化程序应用于定义明确的子问题。当前的 LLM 智能体缺乏这种灵活性,因为其辅助框架(scaffolds)通过固定的推理模式预先硬编码了这些推理决策。当预设结构与任务匹配时,这些框架行之有效;但在解决需要适应推理结构本身的任务时,则显得脆弱。我们引入了**深度推理(Deep Reasoning)**——一种通过结构化元推理在推理时构建任务特定辅助框架的方法。深度推理使用一种形式化语言,将元推理表示为对联想推理、形式化计算和递归子问题求解的可执行分解,使得分解原则可以被编码为上下文示例,以指导测试时的框架构建。我们将这种方法实例化为一个通用智能体(**Dolores**),该智能体将复杂任务分布到更小、更受控的推理线程中,同时保持子问题之间的依赖关系。我们在四项高难度基准测试中评估了 Dolores 与最先进框架方法的表现:基于实地的多跳推理、合成长链问答、长上下文聚合以及深度研究风格的信息检索。在四项基准、三种模型规模和两个模型家族中,Dolores 的表现优于所有评估过的框架,平均比最强的基线框架高出 24.8%,包括那些针对特定基准家族量身定制的方法。追踪和 Token 分析表明,虽然基线框架因过度加载单个 LLM 调用而失败,但 Dolores 通过将认知分布在结构化的低负载推理线程上,从而减少了过早终止和幻觉。这种优势甚至能够弥合缩放差距,在超过一半的设置中,8B 版本的表现超过了同系列所有经过评估的 32B 基线模型。这些结果指向未来的智能系统,将框架视为适应性推理,即时构建每个任务所需的结构。

## 1 引言

人类通过元推理(meta-reasoning)直观地解决复杂问题,这是一种认知过程,在此过程中我们建模任务和环境,选择合适的解决问题策略,将问题分解为可管理的步骤,规划如何解决它们,并在执行这些计划的同时跟踪中间推理和目标(Newell et al., 1959; Flavell, 1979)。关键在于,元推理允许我们整合多种认知模式,包括基于显式规则和逻辑运算的形式推理,以及利用先前经验和直觉模式的联想推理(Bellini-Leite, 2022)。这两种模式之间的相互作用是动态且依赖任务的,使我们能够在包括数学、信息综合、编程和创意写作在内的广泛领域中成为有效的解决问题者(Stanovich, 2011)。

**图 1 说明**:深度推理利用人类元推理轨迹构建“即时”框架。(a):将任务交给人类。(b):人类直觉性地对如何解决进行元推理。(c):这些口头化的轨迹随后直接映射到深度推理的语言中。(d):像 Dolores 这样的深度推理智能体(§4)将它们作为上下文示例来引导其自身的元推理能力。示例改编自 DeepSearchQA 基准(Gupta et al., 2026)。

试图模仿人类推理,LLM 在各种创意(如写作)和形式化(如编程和数学)领域中取得了令人印象深刻的成果。然而,越来越多的证据表明这是“浅层推理”,即对人类口头化推理的表面模仿,并不可靠地追踪底层思维过程(Kargupta et al., 2025)。特别是,LLM 难以以稳健的方式进行形式化推理,这与显示 LLM 不忠实于其自身推理轨迹的研究一致(Lanham et al., 2023; Yee et al., 2024; Lyu et al., 2023; Arcuschin et al., 2025),并且在长或认知要求高的推理任务上表现下降(Jaech et al., 2024; Chen et al., 2025; Hassid et al., 2025)。

为了解决这些局限性,基于 LLM 的系统进展越来越依赖于精心设计的智能体辅助框架(Lanham et al., 2023; Yee et al., 2024; Chen et al., 2025)。这些框架是协调 LLM 之间以及 LLM 与外部工具之间通信的程序(Rosser and Foerster, 2026)。然而,它们通常**预先定义**任务应如何分解以及推理应如何进行。例如,ReAct(Yao et al., 2022)将任务分解为带有工具调用的联想推理步骤序列。CodeAct(Wang et al., 2024)用代码的形式化推理替换了这些工具调用。Deep Research(Roucher et al., 2025b)规定了两层分解,其中管理代理将子问题委托给专门的搜索代理。最后,RLMs(Zhang et al., 2025)通过程序环境中的递归自调用递归地分块长输入任务。这些框架的共同模式是硬编码如何分解推理。本质上,它们在未实际查看任务的情况下固定了对任务的元推理方式,因此当需要其他推理行为时会失败(Fue et al., 2025a)。

在这项工作中,我们利用人类元推理的见解来构建“即时”元推理框架。虽然人类能够直觉地进行元推理,但没有正式的方法来捕捉这些过程并将其转化为智能体系统。为此,我们将方法扎根于认知科学文献(§2),并引入深度推理的语言(§3),这是一种通过结构化元推理结合联想推理和形式化推理的形式化语言。深度推理提供了一种原则性的方法,可以获取人类元推理轨迹,对其进行形式化,并将其转换为智能体系统可在上下文中使用的原子分解。它允许我们将人类如何分解和推理任务的知识即时植入智能体中(图1)。

我们将这种方法实例化在一个我们称为 **Dolores**(Deep Layered Reasoning Scaffold,§4)的智能体中,该智能体使用上下文元推理示例来指导其推理,并在测试时动态调整其框架。它优于所有评估过的最先进框架方法,在四项推理任务、三种模型规模和两个模型家族中,相比最佳基线平均提升了 24.8%。值得注意的是,我们发现配备 8B 模型的 Dolores 在超过一半的评估设置中,表现优于同一模型家族中下一缩放层级(32B)的所有基线模型。通过分析推理轨迹,我们还表明,所有其他框架倾向于产生幻觉并过早终止,因为它们将过多的负载委托给单个 LLM 上下文线程。相比之下,Dolores 通过更细粒度地结构化推理,将其分解为可以由单个 LLM 内存线程可靠处理的**原子**联想、形式化或元推理步骤,从而避免了这些问题。

我们的贡献有两点:1. **深度推理的语言**,一种形式化语言,用于捕捉人类元推理轨迹,以便智能体系统使用;2. **Dolores**,一个实现我们方法的智能体,并展示了比最先进方法更好的性能。我们的代码可在 https://github.com/DeanLight/dolores 获取。

## 2 背景

我们基于认知科学先前工作中的概念构建深度推理语言,这是一种捕捉人类元推理的形式化语言,如下所述。

### 2.1 推理维度

先前工作沿两个正交维度表征推理:**推理如何**进行,以及推理**关于**什么。为了使这些区别具体化,我们在全文中引用图1中引入的关于排球场的运行示例。

**图 2 说明**:非形式化和形式化推理描述推理*如何*进行,而元级别和对象级别描述推理*关于*什么。

#### 联想 vs. 形式化(如何)

在解决任务时,某些步骤依赖于直觉和联想,而其他步骤则遵循显式规则。联想推理通常通过由记忆和上下文塑造的直觉邻近性来操作(Mednick, 1962; Sloman, 1996)。例如,将“海湾之城”解释为旧金山可以通过联想完成,利用经验和概念之间的抽象联系。相比之下,形式化推理通过对结构良好、定义明确的表示顺序应用逻辑规则进行(Wason, 1968; Rips, 1983; Johnson-Laird and Byrne, 1991)。例如,计算进入抢七的排球比赛数量并选择最大值遵循清晰、基于规则的程序,因此是形式化推理。

#### 对象 vs. 元级别(关于什么)

同时,某些推理步骤作用于问题本身,而其他步骤组织如何解决它。对象级推理作用于任务中的对象。例如,解释“海湾之城”和计算抢七次数是对象级推理,因为它们直接作用于任务。相比之下,元级推理作用于推理过程:选择策略、分解问题,并通过构建和更新任务、状态和目标的内部模型来指导推理(Newell et al., 1959; Flavell, 1979; Ackerman and Thompson, 2017)。决定将任务分解为步骤(例如,“首先识别城市,然后列出排球场,然后计算...”),而不实际执行这些步骤,是元级推理。

这两个维度是正交的(图2)。例如,我们可以有联想的元推理或形式化的对象级推理。

### 2.2 人类推理

人类在解决超出其认知能力(工作记忆中可用的总处理资源)的任务时,紧密交织元级和对象级推理。在处理问题时,我们寻找结构,将其分解为可管理的子问题,解决它们,并根据该结构集成结果(Griffiths et al., 2019; Sweller et al., 2019)。这种对结构的寻找是一种元推理形式,通常称为“建模”或“心理建模”。我们强大的推理和泛化能力往往归功于这些元推理和建模能力(Kargupta et al., 2025)。这些灵活的推理能力也深深植根于我们对自然语言的使用。语言在人类推理中发挥双重作用:我们有时形式化地使用它(例如,“篮子里有多少个苹果?”),而其他时候联想地使用它(例如,“这个苹果熟了吗?”)。此外,在解决复杂问题时,我们在对象和元级别都使用自然语言来交织联想推理和形式化推理(Broadbent, 1958; Treisman, 1964; Rosch, 1978)。正是这种灵活的、依赖结构的交织使我们能够有效地跨任务泛化(Stanovich, 2011; Bellini-Leite, 2022)。

## 3 深度推理——元推理的形式化语言

### 3.1 动机

尽管拥有巨大的上下文窗口,LLM 的认知能力是有限的(Zhang et al., 2024; Chen et al., 2024; Fue et al., 2025b)。然而,它们的认知能力与人类有显著不同。例如,它们能够轻松地记忆和检索大量文本和代码,但在基本的推理任务中仍然挣扎(Malek et al., 2025)。

为了在智能体系统中灌输强大的推理和元推理能力,我们需要根据 LLM 的认知能力和能力来查看推理过程。我们需要将我们的直觉推理能力精确形式化,并沿三个维度分离:

1. **D1: 联想 vs. 形式化**——将我们可以做的委托给形式化代码。
2. **D2: 对象 vs. 元**——使用元推理分解对象级任务,直到每个联想对象级任务适合 LLM 的能力。
3. **D3: 原子 vs. 单体**——将本身认知需求高的元推理分解为可组合的原子单元,可以委托给不同的上下文线程。

### 3.2 形式化符号

为了沿 §3.1 中提到的三个维度(D1, D2, D3)精确形式化推理能力,我们现在引入深度推理的形式化语言。

| 符号 | 描述 | 示例 |
| :--- | :--- | :--- |
| $I$ | 真解释器 | $I$(“x = ‘an’;‘S\{x\} Fr\{x\}cisco’”)=

相似文章

DuMate-DeepResearch:一个可审计的多智能体系统,具备递归搜索与基于评分标准的推理

arXiv cs.AI

本技术报告介绍了DuMate-DeepResearch,一个用于深度研究任务的多智能体框架。该框架将智能体核心与工具生态系统解耦,并集成了基于图的动态规划、递归双层执行以及基于评分标准的测试时优化。该系统在两个深度研究基准测试中取得了最先进的结果,展示了可审计智能体基础设施的价值。

从智能体轨迹中诱导推理原语

arXiv cs.AI

介绍推理原语诱导(Reasoning Primitive Induction)方法,该方法从成功的ReAct轨迹中挖掘,将重复出现的推理动作聚类为类型化的伪工具,在基准测试上比原始智能体高出数十个百分点。

基础模型中的集体智能

arXiv cs.CL

本文提出了一种多智能体推理框架,其中多个基础模型通过结构化批评和聚合进行协作,表明模型异构性显著提高了逐步推理的准确性并减少了跨领域的方差。