Routed Graph Handoff: 多智能体LLM委托中的自适应格式选择

arXiv cs.CL 论文

摘要

Routed Graph Handoff 提出一个轻量级路由器,在多智能体LLM系统的智能体间通信中自适应地选择结构化图或自然语言,从而在降低标记成本的同时提高基准性能。

arXiv:2608.25277v1 公告类型:新 摘要:多智能体LLM系统通过自然语言消息进行协调,这些消息消耗了其标记预算的40%至60%。用结构化图替换这些消息可以降低成本,但在需要自适应推理的任务上表现不佳。我们提出\textbf{Routed Graph Handoff},其中轻量级LLM路由器(155个标记,0.15%开销)为每次委托在类型化依赖图和自然语言之间进行选择。在四个基准测试(1,050+轨迹)中,路由系统在每个任务上都匹配或超过纯自然语言:\textbf{+12.7\,pp} 在 $\tau$-retail 上,压缩比为3.2$\times$ ($p{<}0.01$),\textbf{+8.7\,pp} 在 BrowseComp 上,压缩比为2.2$\times$ ($p{<}0.05$),并在 BFCL 和 AppWorld 上持平。没有路由器时,纯图委托在AppWorld上退化14.6\,pp;路由器以接近零的成本消除了这一问题。需要图感知的执行器提示:相同的架构在没有解释指导的情况下不会带来增益。一项预言机分析显示还有8.6\,pp的额外提升空间,这激励了将执行时自适应路由作为未来工作。
查看原文
查看缓存全文

缓存时间: 2026/08/27 09:17

# 面向多智能体LLM委托的自适应格式选择
来源:https://arxiv.org/html/2608.25277
## 路由图交接:面向多智能体LLM委托的自适应格式选择

Ankit Chadha https://orcid.org/0000-0002-5029-0136  
所属机构:pratyay, [email protected]

###### 摘要

多智能体LLM系统通过自然语言消息进行协调,这消耗了其40–60%的令牌预算。用结构化图替换这些消息可以降低成本,但在需要自适应推理的任务上会失效。我们提出了**路由图交接**,其中轻量级LLM路由器(155个令牌,0.15%开销)为每次委托选择使用类型化依赖图或自然语言。在四个基准测试(超过1,050条轨迹)上,路由系统在每项任务上都达到或超过了仅使用自然语言的性能:在τ-retail上性能提升+12.7个百分点,压缩比为3.2倍(\(p<0.01\));在BrowseComp上提升+8.7个百分点,压缩比为2.2倍(\(p<0.05\));在BFCL和AppWorld上达到同等水平。没有路由器时,仅使用图的委托在AppWorld上性能下降了14.6个百分点;路由器以近乎零的成本消除了这一下降。图感知执行器提示是必需的:相同的模式(schema)若没有解释指导则无法带来收益。一项预言机分析揭示了额外8.6个百分点的提升空间,这为未来通过执行时自适应路由进行改进提供了动力。

## 1 引言

当LLM智能体在多智能体系统中协作时,智能体间消息的**格式**被视为事后才考虑的事项:默认使用散文。这令人惊讶:在分布式系统中,协议选择(二进制与文本,RPC与REST,同步与异步)是一个首要的设计决策,具有众所周知的权衡(Tanenbaum and van Steen, 2007 (https://arxiv.org/html/2608.25277#bib.bib2))。然而,诸如AutoGen(Wu et al., 2024 (https://arxiv.org/html/2608.25277#bib.bib1))、CAMEL(Li et al., 2023 (https://arxiv.org/html/2608.25277#bib.bib4))和AgentVerse(Chen et al., 2024 (https://arxiv.org/html/2608.25277#bib.bib5))等多智能体LLM框架定义了拓扑结构(谁与谁对话),却将格式(如何通信)留给了非结构化的自然语言。

我们提出,交接格式应受到与模型选择或提示工程同等的关注。对345条多智能体轨迹的错误分析表明,76%的失败源于**智能体间对齐错误**:执行器误解排序约束、遗漏前提条件,或因模糊指令而陷入循环。[1]单智能体系统显示0%的智能体间对齐失败;其失败完全属于任务验证错误。这表明,**交接格式**而非模型能力,是多智能体协调的关键制约因素。

使依赖关系显式化的类型化图模式(如 `depends_on` 边、前提条件节点、工具调用序列)通过消除执行排序的歧义直接解决了对齐问题。我们设计了这样一个模式(8种节点类型,7种边关系),通过约束解码生成,每次委托约产生350个令牌(比自然语言压缩2倍)。在依赖链任务(BrowseComp;Wei et al., 2025 (https://arxiv.org/html/2608.25277#bib.bib7))上,图的结构保证在任务成功率上带来了+8.7个百分点的提升(\(p<0.05\),Holm-Bonferroni校正)。

但结构也带来了刚性。在AppWorld(Trivedi et al., 2024 (https://arxiv.org/html/2608.25277#bib.bib10))上,任务需要自适应迭代和条件分支,仅使用图的委托性能**下降了**14.6个百分点。当步骤意外失败时,执行器无法偏离编码好的计划,而这恰恰是散文提供的灵活性。

这共同定义了一个**结构-灵活性权衡**:显式依赖关系防止排序错误,但禁止自适应回溯。没有哪种格式占据主导地位。这一发现与单智能体推理中的观察相似:思维链结构有助于算术(Wei et al., 2022 (https://arxiv.org/html/2608.25277#bib.bib3)),但会过度约束创造性生成,从而催生了自适应提示。

我们通过**路由图交接**(图1 (https://arxiv.org/html/2608.25277#S2.F1))解决了这一权衡:一个轻量级LLM路由器(约155个令牌,0.15%开销)根据任务的计算模式为每次委托选择图或自然语言。路由器是保守的:它默认使用自然语言,仅在依赖链任务时路由到图,以近乎零的成本消除了所有性能下降。在BrowseComp上,该系统实现了帕累托改进:同时**提升**了8.7个百分点的准确度并**降低**了22%的成本。

我们的贡献如下:

1.  一个用于多智能体交接的类型化图模式,将委托压缩2-3倍,同时提升了依赖链基准测试的任务成功率(在τ-retail上提升+12.7个百分点,\(p<0.01\);在BrowseComp上提升+8.7个百分点,\(p<0.05\))。
2.  通过四个基准测试实证识别了结构-灵活性权衡,表明图和自然语言都没有绝对优势,并且图感知执行器提示对于模式的有效性是必要的。
3.  一种近乎零成本的路由机制,在质量和成本上实现了帕累托改进,预言机分析量化了8.6个百分点的剩余提升空间,可通过执行时信号实现。

## 2 方法

任务路由器图357令牌自然语言576令牌执行结果图自然语言155令牌0.15%

图1:系统概述。路由器(一次LLM调用)为每个任务选择**图**(类型化DAG,2倍压缩)或**自然语言**(散文回退)。
### 2.1 原生图交接模式

每次委托被编码为一个类型化DAG,包含8种节点类型(`goal`目标、`constraint`约束、`entity`实体、`action`动作、`precondition`前提条件、`postcondition`后置条件、`tool_call`工具调用、`tool_arg`工具参数)和7种边关系(`requires`需要、`targets`目标、`blocks`阻塞、`enables`启用、`depends_on`依赖于、`contradicts`矛盾、`follows`跟随)。

该模式是在47条τ-bench轨迹上迭代设计的。我们从4种核心类型(`goal`、`entity`、`action`、`constraint`)开始。错误分析揭示了两种失败模式:(1)子智能体跳过了前提条件检查,通过添加使前置要求显式的前提条件/后置条件节点解决;(2)多步API序列被错误排序调用,通过添加带有 `depends_on` 边以强制执行顺序的 `tool_call`/`tool_arg` 节点解决。

编排LLM(Claude Sonnet 4.5)通过Bedrock约束解码生成图:模式作为 `tool_use` 输入模式提供,因此输出保证是符合DAG结构的有效JSON。无需微调或辅助编码器;这是一种零样本、仅在推理时使用的方法。

#### 图感知执行是接口的一部分。

模式只是交接的一半:接收智能体需要一个**图感知执行器提示**,该提示命名节点类型,定义边的语义(例如,`depends_on` = 必须在...之前完成),并指定拓扑遍历。这种接收端的指令至关重要:将相同的JSON传递给标准执行器提示不会带来收益,在τ-retail上恢复它使NGH从低于NL提升到+12.7个百分点(附录E (https://arxiv.org/html/2608.25277#A5))。因此,我们将类型化图*及其解释指导*视为一个单一机制,而非仅指图本身。

### 2.2 LLM路由器

在每次委托之前,一次分类调用(总计约155个令牌,0.0005美元)决定使用图还是自然语言。路由器提示编码了一个抽象模式,没有基准特定示例:

*选择GRAPH,如果任务需要依赖于有序子任务(聚合、多步查找、顺序API调用)的确定性答案。选择NL,如果任务需要迭代、条件判断、自由文本解释或自适应推理。*

三个设计选择使路由器具有鲁棒性:

- • 保守默认:除非检测到依赖链模式,否则使用自然语言。这确保了所有自然语言的优势都得以保留。
- • 确定性:温度=0,在3次独立运行中验证结果相同。
- • 领域无关:相同的提示在BrowseComp(网络搜索)、τ-bench(客户服务)、BFCL(函数调用)和AppWorld(多应用编码)上均能泛化。

路由器是一个*单一、领域无关的分类器*:一个提示,没有基准特定示例,应用于每个任务,并且对基准标识无感知,因此仅根据任务内容进行决策。因此,我们报告的每个基准比率是这些盲目的、按任务决策的事后汇总:BrowseComp/τ-retail/BFCL上100%使用图;AppWorld上11%使用图/89%使用自然语言;τ-airline上2%使用图。同一个分类器将AppWorld内部划分为11%/89%(固定的每基准规则无法做到这一点),证实决策是按任务而非按领域做出的;按基准聚集是因为这些基准中的几乎每个任务都共享相同的更优格式。

## 3 实验

#### 基准测试。

我们在四个多样化的多智能体任务上进行评估:BrowseComp(Wei et al., 2025 (https://arxiv.org/html/2608.25277#bib.bib7))(150次试验,需要多步证据收集的长时间网络搜索)、BFCL v3(Patil et al., 2025 (https://arxiv.org/html/2608.25277#bib.bib8))(600次试验,伯克利函数调用排行榜,包含复杂API序列)、τ-bench零售(Yao et al., 2025 (https://arxiv.org/html/2608.25277#bib.bib9))(150次配对试验:50个任务×3个种子,带工具调用的多步客户服务)以及AppWorld(Trivedi et al., 2024 (https://arxiv.org/html/2608.25277#bib.bib10))(152次配对试验,带条件逻辑的多应用工具使用)。总计:1,052条轨迹。

#### 交接测试环境。

每个基准测试都被设定为共同的编排器-执行器交接:编排器发出委托(图或自然语言),另一个独立的执行器执行它,从而将**格式**隔离为唯一变量。一些基准测试并非原生支持多智能体(例如,BFCL是函数调用),但这样设定可以测试图是否能在不造成损害的情况下保留复杂API序列结构;我们观察到的同等表现(75.4 vs. 75.3)正是对于没有需要显式化的跨步依赖结构的任务所预期的结果。

#### 系统。

(1)**仅自然语言**:标准散文委托(基线);(2)**仅NGH**:所有委托编码为类型化图;(3)**路由系统**:路由器 + NGH + 自然语言回退(我们的系统);(4)**预言机**:每个任务的最佳格式(上界)。编排器全程使用通过AWS Bedrock的Claude Sonnet 4.5。

#### 指标。

Pass@1准确率(BrowseComp)、AST匹配准确率(BFCL)、任务成功率(TSR;τ-bench,AppWorld)。所有置信区间均为10K次重抽样、α=0.05的配对bootstrap 95%置信区间。

### 3.1 主要结果

表1:主要结果(任务成功率/准确率%)。路由系统在所有四个基准测试上达到或超过仅使用自然语言的表现。τ-retail:+12.7个百分点(150次配对试验,\(p<0.01\))。BrowseComp:+8.7个百分点,置信区间[+2.7, +14.7],\(p<0.05\)。AppWorld仅NGH下降-14.6个百分点;路由器恢复了同等水平。
路由器的主要功能是**防止性能下降**(表1 (https://arxiv.org/html/2608.25277#S3.T1))。NGH在依赖链任务上带来了显著增益:在τ-retail上提升+12.7个百分点(150次配对试验;\(p<0.01\)),在BrowseComp上提升+8.7个百分点(置信区间[+2.7, +14.7];\(p<0.05\))。两者在Holm-Bonferroni校正后都具有统计显著性。然而,NGH在AppWorld上急剧下降:-14.6个百分点(置信区间[-22.8, -6.4])。

路由器解决了这种不对称性。通过在89%的AppWorld任务(涉及迭代、条件判断或自由文本解释的任务)上默认使用自然语言,它恢复了完全的同等水平(51.7% vs. 51.7%)。在BrowseComp和τ-retail上,路由器100%路由到图,因为所有任务都符合依赖链模式。因此,路由系统在两个基准测试上取得了显著增益,在另外两个基准测试上则没有出现性能下降。

#### 第二种编排器骨干网络。

为了验证这些增益并非特定于Claude Sonnet 4.5,我们使用GPT-5 mini作为编排器重新运行了交接测试。路由系统在我们运行的每一个任务族上都优于自然语言交接(BrowseComp 65→68%,BFCL 82→85%,AppWorld 50→52%),这与我们的主要结果方向一致(附录G (https://arxiv.org/html/2608.25277#A7))。这在之前仅验证了格式可移植性的跨供应商检查(Claude×Nova Pro:0%无效JSON,保持3.1–3.6倍压缩比)之上,增加了准确性的可移植性。

### 3.2 效率

在所有试验中加权计算,路由系统实现了**平均2.1倍**的交接压缩(BrowseComp 2.2倍,τ-retail 3.2倍,BFCL 2.0倍,AppWorld 1.04倍)。压缩比和0.15%的路由器开销是基于*交接*令牌测量的;若计入完整的每次委托预算(155个令牌的路由器调用和约80个令牌的图感知执行器前缀),图路径的总令牌数仍然少于自然语言(在τ-retail上为461 vs. 730,1.6倍;附录H (https://arxiv.org/html/2608.25277#A8))。在BrowseComp和τ-retail上,NGH都提供了帕累托改进:更高的准确率和每个正确答案更低的成本。图的依赖边防止了执行器的循环(在依赖链失败中消除了15-27个重试步骤)。在AppWorld上,路由器保留了自然语言行为,避免了仅使用NGH因失败的图执行而产生的18%开销。

### 3.3 消融研究:路由器的必要性

从系统中移除路由器对不同任务类型产生了不对称的影响:

- • BrowseComp/τ-retail/BFCL:无变化;路由器在这些基准测试上本来就100%路由到图,因此路由系统 = 仅NGH。
- • AppWorld:下降-14.6个百分点(图过度约束了自适应迭代任务,迫使执行器进入它无法摆脱的刚性计划)。
- • τ-airline(额外150次试验):仅NGH下降-4.0个百分点;路由器通过使用相同提示将98%路由到自然语言来恢复同等水平。

路由器以155个令牌(0.15%开销)的成本防止了在两个基准测试上的性能下降。同一个路由器提示无需修改即可泛化到所有五个基准测试领域。一个更简单的非LLM路由器(将基准标签映射到格式)可以重现这种按基准的汇总,但它需要我们的路由器所从未见过的基准标识,并且无法产生AppWorld内部的11%/89%分割;LLM路由器的价值恰恰在于这种从任务内容出发的、无标签的泛化。

### 3.4 协议比较(τ-bench)

| 协议 | TSR | Δ | 95% 置信区间 | 压缩比 |
| :--- | :--- | :--- | :--- | :--- |
| 自然语言基线 | 12.0 | — | | 1.0× |
| **路由 NGH** | **24.7** | **+12.7** | **[+6.0, +19.3]** | **3.2×** |
| RL Qwen 1.5B | 20.7 | +8.7 | [2.0, 15.3] | 10.7× |
| T5 自编码器 | 20.0 | +8.0 | [1.3, 14.7] | 7.7× |
| 混合方法 | 19.3 | +7.3 | [0.7, 14.0] | 6.2× |
| LLMLingua-2 | 18.7 | +6.7 | [0.7, 13.3] | 5.2× |
| 无预测 Δ | 17.3 | +5.3 | [-0.7, 11.3] | 0.7× |
| TF-IDF | 16.7 | +4.7 | [-2.0, 11.3] | 0.9× |

表2:τ-retail协议比较(50个任务×3个种子 = 每种150次试验)。**粗体**置信区间不包含零。所有感知模式的方法都优于所有不感知模式的方法。路由NGH是前五名中唯一零训练的协议。
我们在相同的50个固定的τ-retail任务上比较了8种交接协议(表2 (https://arxiv.org/html/2608.25277#S3.T2))。**感知模式**协议使用NGH图作为直接输出(路由NGH)或作为训练压缩器的监督:RL Qwen使用GRPO在图标注的轨迹上微调了一个1.5B参数的模型;T5自编码器训练了一个60M参数的编码器-解码器来重构图;混合方法提取结构化字段然后对剩余部分使用LLMLingua;LLMLingua-2(Pan et al., 2024 (https://arxiv.org/html/2608.25277#bib.bib14))是应用于自然语言规划的现成提示压缩器。**不感知模式**协议在没有图结构的情况下压缩:TF-IDF从自然语言规划中提取高权重关键词;预测Δ(Predictive Delta)

相似文章

从早期经验中学习智能体路由

arXiv cs.CL

本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。

面向LLM代理中功能等价工具的延迟-质量路由

arXiv cs.LG

本文介绍了 LQM-ContextRoute,一种上下文赌博机路由器,用于在 LLM 代理中选择功能等效的工具提供商,平衡延迟和答案质量。它在网络搜索和检索器基准测试上优于基线。

基于SLM条件的分层关系路由用于标记属性图学习

arXiv cs.LG

本文提出了一种基于SLM条件的分层关系路由架构,该架构将小型语言模型集成到图神经网络中,以实现标记属性图中的自适应消息选择,通过利用上下文语义信息来提高预测准确性。