DeAR:通过能力锚定与协作思维导航的分散式代理推理

arXiv cs.AI 论文

摘要

DeAR是一个分散式代理推理框架,通过能力锚定与协作思维导航,在知识密集型推理任务中提升准确性,在多模态基准测试上优于集中式方法。

arXiv:2608.17282v1 公告类型:新 摘要:现有的代理推理系统通常依赖于集中式协议。这种设计引入了路由瓶颈和静态角色分配,处理复杂多模态查询时往往失败。我们提出DeAR(分散式代理推理),一个从中心控制转向自主点对点协作的框架。DeAR基于三个机制:(1)基于查询的代理专业化的分散式能力锚定,(2)用于定向点对点交互的思维图导航,(3)用于自适应错误纠正的拓扑更新。在9个多样化的多模态推理和基于文本的QA基准测试上的评估表明,DeAR持续优于近期的基线方法,验证了代理之间的分散式和自适应协作提升了知识密集型推理任务的准确性。源代码将可在https://open_upon_acceptance获取。
查看原文
查看缓存全文

缓存时间: 2026/08/19 09:57

# DeAR:基于能力锚定与协作思维导航的去中心化智能体推理
来源:https://arxiv.org/html/2608.17282
###### 摘要

现有的智能体推理系统通常依赖集中式协议。这种设计引入了路由瓶颈和静态角色分配,在处理复杂的多模态查询时常常失效。我们提出了DeAR(去中心化智能体推理)框架,该框架将控制模式从集中式转向自主点对点协作。DeAR建立在三个机制之上:(1)基于查询的智能体专业化去中心化能力锚定,(2)用于定向点对点交互的思维图导航,以及(3)用于自适应错误纠正的拓扑更新。在9个多样的多模态推理和基于文本的问答基准测试中的评估表明,DeAR持续优于近期的基线方法,验证了智能体间的去中心化自适应协作能够增强知识密集型推理任务的准确性。源代码将在https://open_upon_access提供。

## 引言

复杂推理代表着大语言模型(LLM)应用的前沿,其所需能力远超简单的模式匹配。为此,智能体推理已成为一个成熟且有效的范式(49 (https://arxiv.org/html/2608.17282#bib.bib41))。通过将复杂问题分解为由专门化智能体处理的可管理子任务,智能体工作流在多步问题解决方面取得了显著成效(50 (https://arxiv.org/html/2608.17282#bib.bib4))。

尽管取得了这些成功,当前的智能体推理系统(51 (https://arxiv.org/html/2608.17282#bib.bib23))在处理复杂的多模态查询时,仍经常遇到重大障碍。考虑图1(https://arxiv.org/html/2608.17282#Sx1.F1)中的任务,该任务询问特定图像中有多少人出生于第二次世界大战之后。标准的单个智能体通常在此失败,因为它无法同时处理细粒度的视觉识别和历史知识检索。此外,在集中式多智能体框架中,规划器将视觉提取任务僵化地分配给一个智能体,将事实查询任务分配给另一个智能体。如果一个智能体错误识别人物或虚构了出生年份,中心“评判者”节点就会成为严重的瓶颈。它盲目地聚合这些有缺陷的中间结果,而没有进行点对点验证,从而导致最终答案错误。

参见标题图1:针对多模态查询(“图像中有多少人出生于第二次世界大战之后?”)的框架对比。(a)由于知识领域受限,单智能体失败。(b)由于评判者瓶颈传播了错误输入,集中式框架失败。(c)DeAR(我们的方法)通过能力锚定和自适应思维图导航,协作验证事实并得出正确答案,从而取得成功。我们认为,这些失败源于集中协作协议的结构缺陷,而非模型能力不足。在这些拓扑结构中,中央协调器垄断了路由和聚合(38 (https://arxiv.org/html/2608.17282#bib.bib24)),导致严重的信息丢失和严格的单点瓶颈(33 (https://arxiv.org/html/2608.17282#bib.bib49))。因此,这种僵化的角色分配(14 (https://arxiv.org/html/2608.17282#bib.bib45))无法适应动态的、依赖查询的推理,迫使动态问题进入静态工作流,从而错误路由任务并向下游传播未经验证的错误。

在现实世界中,复杂的问题解决遵循不同的拓扑结构。它本质上是去中心化的。跨学科专家不会等待一个全知的管理者来规定每一次微交互;他们进行点对点对话,协商边界,并自组织以弥合知识鸿沟。

然而,这种去中心化范式在智能体推理领域基本上尚未被探索。为弥合这一差距,我们提出了DeAR(去中心化智能体推理),一个旨在通过使智能体自主推理和协作来绕过集中式瓶颈的框架。不断演进的推理上下文并非由隐藏的系统层维护,而是作为动态消息负载通过点对点令牌流直接传递。实现稳健的去中心化推理需要应对三个挑战,我们通过重构角色分配、协作机制和推理路径来解决这些问题:

- •动态能力 vs. 静态角色:集中式系统通常依赖预定义的角色(8 (https://arxiv.org/html/2608.17282#bib.bib25)),允许协调器通过标签路由请求。但角色标签是真实能力的弱代理,并且恰恰是导致协调器在开放场景中产生能力幻觉的原因。我们通过用*动态能力锚定*机制取代静态标签来解决这个问题。智能体基于可验证的语言基准主动评估自己对特定查询片段的适合度,确保角色分配是依赖查询的,并由实际能力而非僵化头衔驱动。
- •局部图导航 vs. 中央路由:在集中式管道(39 (https://arxiv.org/html/2608.17282#bib.bib26))中,协调器充当全局路由器,规定线性的执行路径。为了在保持选择性协作的同时消除这一中心瓶颈,我们提出了*协作倾向矩阵*,它直观地作为一个动态邻接矩阵,定义了我们推理图的边。类似于社会语言学对齐,该矩阵建立了一个决策边界。当前活跃的智能体不依赖中心评判者计算全局顺序路线,而是执行*局部图遍历*,基于当前上下文独立选择其最优的下游协作对象。
- •渐进式推理 vs. 重新开始:在集中式系统中,如果推理链断裂,“评判者”通常不得不丢弃整个轨迹并重新开始,效率极低。我们提出,去中心化推理应被视为在智能体思维图上的协作导航。与脆弱的线性链不同,我们的智能体维护一个共享的推理空间拓扑图。这允许*渐进式推理*:如果一条路径被证明无效,智能体不会退回起点。相反,他们从当前节点高效地转向,利用思维图探索替代的有效推理链,而不会丢失迄今取得的进展。

更多细节在DeAR框架(https://arxiv.org/html/2608.17282#Sx3)部分提供。

## 相关工作

近期研究表明,多智能体系统通过协调具有互补能力的智能体,提高了大语言模型(LLM)和多模态大语言模型(MLLM)的鲁棒性和可解释性。这些框架促进了复杂任务分解、中间状态共享和动态工作流管理(11 (https://arxiv.org/html/2608.17282#bib.bib1))。因此,多智能体协作已成功应用于包括数学推理(42 (https://arxiv.org/html/2608.17282#bib.bib2))和视觉问答在内的多个领域,在这些领域中,迭代规划和可逆推理提升了整体性能(43 (https://arxiv.org/html/2608.17282#bib.bib3))。

为应对复杂的多步推理任务,近期框架探索将认知负荷分配给专门化智能体(15 (https://arxiv.org/html/2608.17282#bib.bib42);27 (https://arxiv.org/html/2608.17282#bib.bib6))。虽然基于辩论的方法(50 (https://arxiv.org/html/2608.17282#bib.bib4);23 (https://arxiv.org/html/2608.17282#bib.bib50);21 (https://arxiv.org/html/2608.17282#bib.bib51))和线性推理路径允许细化中间状态(12 (https://arxiv.org/html/2608.17282#bib.bib5)),但它们严重依赖僵化的集中式协调协议。例如,AutoGen(41 (https://arxiv.org/html/2608.17282#bib.bib46))依赖由中央管理器控制的静态拓扑结构,AgentVerse(2 (https://arxiv.org/html/2608.17282#bib.bib47))在中央评估器下规定同步管道,而DyLAN(28 (https://arxiv.org/html/2608.17282#bib.bib48))需要全局排序器进行逐层过滤。即使是像AgentNet(45 (https://arxiv.org/html/2608.17282#bib.bib22))这样的动态路由框架,也缺乏依赖查询的能力锚定和自适应错误纠正。这种持续的集中式瓶颈限制了适应性,带来了冗余的计算开销,并使系统容易受到能力幻觉和复合推理错误的影响,凸显了对去中心化协作架构的迫切需求。

## DeAR框架

参见标题图2:去中心化智能体推理框架概览。在本节中,我们介绍DeAR框架,在该框架中,智能体在问答过程中自主决定何时以及与谁协作。DeAR的执行分为三个阶段,对应于引言中确定的三个挑战。

### 概览

DeAR的核心是导航一个智能体思维图,其中节点代表推理状态,边代表协作概率。这种导航由一个动态协作倾向矩阵C∈RN×N控制,该矩阵根据智能体锚定的能力,编码智能体对之间有益交互的可能性。随着智能体遍历该图,他们生成一个知识状态序列K。如果一条路径导致死胡同(即,未能生成有效答案y),系统会采用渐进式细化策略,更新矩阵C以剪枝无效边并将导航引导向有效的推理链。系统S定义为:
S=(Q,A,C,K)。(1)
如图2(https://arxiv.org/html/2608.17282#Sx3.F2)所示,该算法由三部分组成。

### 去中心化能力锚定

为了解决静态角色预定义的局限性,DeAR实现了去中心化能力锚定。在初始化时,智能体不被分配僵化的标签(例如,“数学智能体”)。相反,每个智能体ai根据其底层官方技术报告或模型卡中得出的可验证语言基准Pi来锚定其身份。

我们不依赖外部赋予的任务标签或无根据的自我评估,而是根据问答中通常需要的一组基本认知维度来描述每个智能体的能力。具体来说,每个智能体维护一个内在能力配置:
τi=[τicr,τiea,τinc,τifr,τicm],(2)
其中τicr, τiea, τinc, τicm和τifr分别表示智能体在常识推理、解释能力、数值计算、自然语言理解和事实可靠性方面的熟练程度。用于此校准机制的详细提示模板和对齐协议在附录中提供。

至关重要的是,这些连续值并非来自任意的文本解读。它们基于从Pi提取的定量基准数据的明确映射。令sid表示智能体ai在标准数据集d上的原始准确率分数。例如,sinc来自GSM8K基准,sicr来自MMLU,sifr来自TruthfulQA。为了解决不同基础模型间报告标准不一致的问题,我们在系统初始化阶段应用校准机制。原始分数被投影到[0,1]区间,并使用Softmax操作在所有N个智能体间进行归一化:
τid=exp⁡(sid)∑k=1Nexp⁡(skd),d∈{cr,ea,nc,fr,cm}。(3)
这种映射机制确保所有智能体的能力值τi被严格量化,并在同一尺度上严格可比。

当接收到查询q时,智能体ai根据查询要求和其技术报告Pi动态地将其配置上下文化,产生一个查询依赖的能力状态:
τi(q)=Φi(q,Pi,τi),(4)
其中Φi(⋅)表示智能体的内部推理操作符,通过提示实现,它根据智能体校准的基准配置评估任务上下文。

最后,智能体ai生成的知识或中间推理依赖于查询和此能力状态:
Ki=Θi(q∣τi(q))。(5)
这里,Θi(⋅)表示由其参数知识驱动的LLM的生成推理过程,产生中间结果Ki。通过评估同行基准报告,智能体ai定量估计其优势,形成计算协作倾向ci,j并构建去中心化思维图的基础。

### 自组织协作

图3:智能体间的思维图导航构建
为了用局部共识取代集中路由,我们引入了自组织协作机制。每个智能体ai在当前查询上下文中自主评估与每个其他智能体aj协作的潜在效用。为了启动去中心化推理轨迹,第一个活跃的智能体是从智能体池中均匀随机选择的。此评估形成一个协作倾向向量ci:
ci=[ci,1,ci,2,...,ci,N],(6)
其中ci,j∈[0,1]表示对智能体aj的协作偏好。给定一个查询映射到认知维度d,ci,j通过公式3中定义的校准熟练度τjd的温度缩放Softmax计算:
ci,j=exp⁡(τjd/T)∑k=1,k≠iNexp⁡(τkd/T),∀j≠i(7)
其中T>0控制路由的尖锐程度。由于τjd∈[0,1]是有界的,此公式固有地防止了指数溢出,保证了绝对的数值稳定性。根据定义,不允许自我协作:
ci,i=0,∀i∈{1,2,...,N}。(8)
聚合所有智能体的协作偏好向量得到协作矩阵C:
C=\[0c1,2⋯c1,Nc2,10⋯c2,N⋮⋮⋱⋮cN,1cN,2⋯0\] (9)
此矩阵编码了成对的、有向的协作偏好。

相似文章

DAR:基于智能体框架的道义推理

Hugging Face Daily Papers

本文介绍了DAR(Deontic Agentic Reasoning),一个智能体框架,使LLM能够交互式地查询法律法规和政策,用于法律/监管推理任务。在DeonticBench上评估的结果表明,智能体引导可以提升前沿模型,但可能会导致较弱模型在数值任务上表现下降,同时消耗更多令牌。

通过结构化元认知在通用智能体中实现深度推理

arXiv cs.CL

本文介绍了深度推理(Deep Reasoning),这是一种在推理阶段利用结构化元推理为通用智能体构建特定任务脚手架的方法。提出的智能体 Dolores 通过将认知分配到低负载的推理线程中,减少了幻觉并提升了在多个基准测试上的表现,优于现有方法。