从早期经验中学习智能体路由
摘要
本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。
arXiv:2605.07180v1 公告类型:新论文
摘要:大型语言模型(LLM)智能体在复杂推理任务中表现出色,但会产生高昂的延迟和计算成本。在实际应用中,许多查询处于前沿 LLM 的能力边界之内,无需进行完整的智能体执行,这使得在 LLM 和智能体之间进行有效路由成为一个关键挑战。我们研究了在现实冷启动设置下,在轻量级 LLM 推理与完整智能体执行之间路由查询的问题。为此,我们提出了 BoundaryRouter,这是一种无需训练的路由框架,它利用早期行为经验和规则引导的推理,来决定是直接通过 LLM 推理回答查询,还是升级交由智能体处理。BoundaryRouter 通过在共享种子集上执行两个系统来构建紧凑的经验记忆,并在推理时检索相似案例以指导路由决策。为了评估该方法,我们引入了 RouteBench,这是一个涵盖域内、改写和域外路由设置的基准。实验表明,与智能体相比,BoundaryRouter 将推理时间减少了 60.6%,同时与直接 LLM 推理相比,性能提升了 28.6%,平均优于基于提示的路由 37.9%,优于仅基于检索的路由 8.2%。
查看缓存全文
缓存时间: 2026/05/11 06:53
# 从早期经验中学习代理路由
来源: https://arxiv.org/html/2605.07180
††footnotetext:∗同等贡献\.††footnotetext:†通讯作者\.Yimin Wang∗2,4Jiahao Qiu∗1Xuan Qi3Xinzhe Juan2,4Jingzhe Shi3 Zelin Zhao6Hongru Wang5Shilong Liu†1Mengdi Wang†1 1普林斯顿大学 AI 实验室2密歇根大学 3清华大学信息科学交叉研究所 \(IIIS\)4上海交通大学5爱丁堡大学6伦敦国王学院
###### 摘要
大型语言模型(LLM)智能体在复杂推理任务中表现出色,但带来了高延迟和高计算成本。在实践中,许多查询处于前沿 LLM 的能力边界之内,无需完整的代理执行,因此在 LLM 和代理之间进行有效路由成为一个关键挑战。我们研究了在现实冷启动设置下,轻量级 LLM 推理与完整代理执行之间的查询路由问题。为此,我们提出了 BoundaryRouter,这是一种无需训练的路由框架,它利用早期行为经验和基于评判标准的推理来决定是直接通过 LLM 推理回答查询,还是升级为代理执行。BoundaryRouter 通过在共享种子集上执行两个系统来构建紧凑的经验记忆,并在推理时检索相似案例以指导路由决策。为了评估该方法,我们引入了 RouteBench,这是一个涵盖域内、改述和域外路由设置的基准。实验表明,与代理相比,BoundaryRouter 将推理时间减少了 60.6%,同时性能比直接 LLM 推理提高了 28.6%,优于基于提示的路由和仅检索的路由,平均提升分别为 37.9% 和 8.2%。
参见图注 图1:路由的动机与概览。直接 LLM 推理速度快、成本低,但在较难的查询上可能不可靠,而完整的代理执行较慢且更昂贵。路由器将每个查询分派到适当的系统,对简单情况使用 LLM,在需要时升级为代理,以实现更好的准确性-延迟权衡。## 1 引言
大型语言模型智能体最近已成为解决需要推理、规划以及与外部环境交互的任务的强大范式(Zhou 等人,2025;Hu 等人,2025;Zhang 等人,2025b;Qiu 等人,2025c;H2O.ai,2025;Team,2025;Qiu 等人,2025b)。通过结合语言理解、工具使用、检索和长期记忆,这些智能体在从代码生成到专业科学和学术领域的广泛领域中表现出强大的适应性(Yang 等人,2024;Qiu 等人,2025a;Li 等人,2025;Wang 等人,2025;Qiu 等人,2025d;Ding 等人,2025b)。然而,并非每个任务都需要智能体的复杂能力,例如多步推理或长上下文管理(见图1)。当代 LLM 在 web 规模语料库上训练,并在许多情况下与 web 搜索工具耦合(例如,生产 API 中带有在线搜索的 GPT),已经可以通过单次前向推理解决各种事实和结构良好的查询,其计算和延迟成本远低于多步代理。
因此,当前的核心挑战在于表征 LLM 的智能边界,在边界内启用直接 LLM 推理,仅在任务超出边界时升级为代理。LLM 查询路由提供了一种实用的方法来探测这一边界,通过将查询动态分派到具有不同质量和成本模型的系统中。然而,现有研究主要集中在 LLM 之间或代理之间的路由,而 LLM 与代理之间的混合路由问题在很大程度上仍未被探索。
参见图注 图2:路由器比较。左:直接路由使用 LLM 路由器在直接 LLM 推理和完整代理执行之间进行选择,但未利用经验。右:基于训练的路由从标记的训练数据中学习路由器,启用经验使用但需要监督。中:BoundaryRouter(我们的方法)无需训练但由经验驱动:它首先通过在小型共享种子集上运行 LLM 和代理来建立早期经验记忆,然后在测试时检索相似经验以指导路由决策。为了解决这一问题,我们提出了 BoundaryRouter,一种无需训练的查询路由方法,通过早期经验和结构化推理高效地结合直接 LLM 推理与代理执行。现实世界路由中的一个关键约束是冷启动问题:我们通常缺乏传入查询的先验性能数据(真实值),因此无法训练监督式路由器。BoundaryRouter 通过利用早期经验来解决这一问题,这是一种通过在共享种子集上执行 LLM 和代理而无需知晓真实值所构建的紧凑记忆,如图2所示。这种早期经验不作为监督或校准数据,而是作为一种轻量级的行为参考,揭示两个系统之间的系统性差异。
为了系统地研究这一路由问题,我们构建了 RouteBench,一个专门用于评估在 LLM 和代理之间进行路由时 LLM 决策边界的基准。与假设静态分布的传统评估套件不同,RouteBench 在三个逐步具有挑战性的维度上评估路由泛化能力:标准域内任务、用于鲁棒性的语言扰动查询以及域外场景。这种设计使得能够严格评估路由器在面对熟悉和新型任务分布时如何平衡性能和成本。
最后,我们在 Routebench 上评估了 BoundaryRouter,与代理相比,平均推理时间减少了 60.6%,性能比直接 LLM 推理提高了 28.6%,证明了明显更好的成本-性能权衡。使用 BoundaryRouter,我们进一步在 RouteBench 上评估了 14 个当代模型。在前沿模型中,GPT-5、Gemini-3-Pro-Preview 和 Gemini-2.5-Pro 实现了最强的整体路由性能。与简单的提示路由或检索增强生成(RAG)路由相比,BoundaryRouter 的路由质量分别提高了 37.9% 和 8.2%,证实了早期经验和基于评判标准的推理的有效性。我们的研究结果强调,在没有路由标签或真实值的冷启动设置中,早期行为信号与基于评判标准的推理相结合,可以实现 LLM 和代理之间的可靠路由,为异构推理系统中的可扩展协调提供了一条实用路径。
参见图注 \(a\) 跨模型的 RouteBench 平均得分。
参见图注 \(b\) BoundaryRouter 的整体路由有效性。
图3:RouteBench 上的整体路由性能和成本权衡。(a)不同模型在所有评估集上的平均 RouteBench 得分,按降序排列;(b)不同路由策略的路由有效性比较。柱状图报告了三种基础模型下基本提示路由、检索增强(RAG)路由以及我们的路由方法在 RouteBench 上的平均路由得分。我们的方法始终比两种基线实现更高的路由性能,证明了其作为通用路由策略的有效性。
## 2 相关工作
LLM、LLM 智能体和多模型系统中的路由。任务路由在扩展语言模型系统方面变得越来越重要,特别是随着工作负载多样性和成本敏感性的增加。早期工作通过评估跨多样基准数据集的路由性能奠定了基础。一系列近期工作探讨了如何通过通用路由框架动态地将查询分派到多个模型、代理或工具,以优化效用。一些方法,如 Router-R1,将路由集成到多步推理中,模型根据中间推理信号迭代决定咨询哪个组件,通常使用强化学习来平衡准确性和成本。其他方法在多智能体设置中运行,通过分层规划、基于图的分派或角色感知的上下文过滤来协调具有不同角色或专长的代理。资源约束下的路由也受到了关注,方法根据效用-成本权衡自适应地选择模型、前瞻机制或测试时计算优化。此外,提出了奖励引导的集成系统将查询路由到最有能力的专家模型。与此同时,检索增强推理系统将路由视为对知识库或工具的逐步选择。虽然这些方向反映了对自适应协调的日益兴趣,但它们通常专注于同质空间内的路由,跨越模型、代理或工具,而非跨越它们。我们的工作填补了这一空白,通过研究 LLM 和代理之间的路由,启用利用其互补优势的任务级决策。
从早期经验学习和自进化智能体。为了构建更具适应性和自主性的系统,近期工作探讨了智能体如何从其早期历史中学习。Reflexion 和 Voyager 证明了智能体可以通过基于语言的反馈和探索来反思失败、巩固长期记忆并发展可重用的技能。除了回顾性改进外,一些方法通过在测试时检测错误或不确定性并相应更新内部组件来适应智能体,而其他方法则利用早期交互数据通过未来一致的行为建模来引导策略。这些想法也重塑了智能体的架构方式。智能体不再依赖静态流水线,而是可以通过随时间 refine 其内部逻辑、记忆和提示策略来动态进化。最近的调查将这些方向整合到自进化智能体的新兴框架中,强调从静态模型向持续适应、自我 refine 系统的转变。我们将基于经验的学习从任务执行扩展到路由,使智能体能够改善 LLM 和代理之间的委托决策,这是以往工作中很少涉及的维度。
推理增强的决策制定。Wei 等人引入的思维链(CoT)提示使大型语言模型能够在产生最终答案之前通过中间步骤进行推理。除了准确性增益外,CoT 还支持模型和智能体内部的决策制定。在 ReAct 中,推理轨迹指导工具使用和子程序选择,而其他工作则利用 CoT 进行任务分解和选项评估。最近的进展结合了基于评判标准的 CoT,其中推理由显式评估标准而非隐式偏好塑造。这种方法通过确保推理尊重特定领域的约束,提高了文本生成、代码评估和地理空间规划等任务的一致性和对齐性。基于这一方向,我们将 CoT 应用于代理路由,帮助模型在评判标准指导下明确推理,以确定哪个代理或子模型最适合给定任务。这将 CoT 重构为一种结构化协调机制,增强了路由的透明度和可靠性。
参见图注 图4:我们路由流程的概览。来自 RouteBench 的查询使用早期经验检索增强(RAG)和基于 CoT 的路由模块进行路由,该模块将任务委托给 LLM 或 Agent。通过在 RouteBench 上进行路由准确性和每个求解器 F1 的评估来评估性能,聚合为 RouteBenchScore。
## 3 从早期经验中学习代理路由
### 3.1 路由模块概览
路由模块是一个基于 LLM 的决策系统,将每个传入查询路由到轻量级 LLM(低延迟和标记成本)或完整代理(较高成本但具有更强的工具增强推理)。具体而言,路由器是一个*可插拔*的路由 LLM,其条件为 \(i\) 输入查询和 \(ii\) 包含求解器输出和运行时的检索早期经验案例。给定这些信号,路由器遵循基于评判标准的推理以权衡预期答案质量与延迟,然后输出路由决策。形式上,给定输入查询 \(x\),路由器产生 \(\text{Route}(x) \in \{\text{LLM}, \text{Agent}\}\)。重要的是,路由模块*无需训练*:它不使用梯度更新,也不需要路由标签的监督。这种设计使得路由器易于部署,并可以通过仅更新早期经验记忆和检索组件来适应新任务或新的代理实现。
### 3.2 从早期经验学习
LLM–代理路由的一个核心难点是*冷启动*:当路由器部署时,我们通常没有传入查询的真实值,因此无法获得可靠的路由标签。这使得标准的监督式路由器训练不切实际。为了解决这一问题,我们引入了*从早期经验学习*,为路由器提供可观察求解器行为的紧凑记忆,流程概览如图4所示。
构建早期经验记忆。我们首先采样相似文章
一次预训练,随处路由:迈向LLM路由的基础模型
论文提出了RouteFM,一个面向LLM路由的基础模型,通过跨异构环境的情景化预训练学习可复用的路由能力,使一个冻结的路由器仅凭行为上下文即可适应新的领域、模态和候选模型池。在MMR-Bench上,RouteFM仅凭每个候选8条观测就以2.23个质量点领先最强基线,支持'一次预训练、随处路由'的范式。
SLMs 作为多智能体路由器:一种渐进式 SFT 与强化学习方法
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
跨四个LLM层级的代理工作路由:编排器、顾问、深度推理、Premier
作者分享了一个实用的四层LLM路由栈,用于代理工作。其中,快速的编排器处理大部分请求,仅在需要深度推理时才会升级到昂贵的模型,显著降低了成本并提升了交互体验。
面向LLM代理中功能等价工具的延迟-质量路由
本文介绍了 LQM-ContextRoute,一种上下文赌博机路由器,用于在 LLM 代理中选择功能等效的工具提供商,平衡延迟和答案质量。它在网络搜索和检索器基准测试上优于基线。
路由应当自养其身:面向经济高效LLM路由的稀疏监督
论文提出了SaveRouter,一个稀疏监督的LLM路由框架,它有选择性地获取查询-模型反馈,并在相关查询之间共享能力信息,在保持具有竞争力的路由质量的同时降低监督成本,并将盈亏平衡部署量减少1.9-9.5倍。