任务与会话级模型路由:基于通用接口的混合评估——对四种开源路由器在四个基准测试中的评估

arXiv cs.AI 论文

摘要

本文使用通用协议在四个基准测试中评估了四种开源LLM路由器,发现性能提升更紧密地与模型层级构成相关,而非针对特定任务的目标设定。

arXiv:2608.14641v1 公告类型:新 摘要:智能体系统日益将模型选择委托给路由器,然而开源路由器通常使用不同的任务、候选池和执行协议进行评估,限制了直接比较。我们提出了一种通用测量协议,并对四种路由器实现进行了混合评估,涵盖RouterBench、BFCL v4、tau2-bench和WebArena。我们针对2,610个候选结果的锁定矩阵评估了290个冻结任务。三个路由器发出恒定或近乎恒定的层级分配;只有vLLM Semantic Router随提示内容实质性变化,且其在四个基准测试中均未观察到最高成功率。Always-Mid在三个基准测试中与Aurelio完全匹配,在第四个中误差在0.003以内。对于vLLM,任务级优越性测试未检测到相对于份额匹配的内容盲分配有任何任务特定优势;仅在WebArena上以协议声明的五个百分点边际建立了等效性。结果表明,在这些配置和控制下,观察到的收益更紧密地追踪选定层级的构成,而非证明的任务特定目标。因此,在路由器评估中,固定层级基线和选定层级分布是必要的控制因素;研究结果限于这些配置、候选池和冻结基准样本,而非一般的路由范式。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:55

# 任务级与会话级模型路由:基于通用接口的四种开源路由器在四个基准测试中的混合评估
来源:https://arxiv.org/html/2608.14641  
圣托什·库马尔·萨米纳桑  
独立研究者  
s13\.santhosh@gmail\.com

###### 摘要
智能体系统越来越多地将模型选择委托给路由器,但开源路由器通常使用不同的任务、候选池和执行协议进行评估,这限制了直接比较。我们提出了一种通用的测量协议,并对四个路由器实现在 RouterBench、BFCL v4、tau2\-bench 和 WebArena 四个基准测试上进行了混合评估。我们对290个冻结任务相对于一个包含2,610个候选结果的锁定矩阵进行了评估。三个路由器产生恒定或近乎恒定的层级分配;只有 vLLM 语义路由器随提示内容有实质性变化,并且在四个基准测试中均未观察到最高的成功率。Always\-Mid 在三个基准测试上与 Aurelio 完全匹配,在第四个基准测试上的差异在0\.003以内。对于 vLLM,任务级优势测试未检测到其相对于匹配份额的无内容分配有任何任务特定优势;等效性仅在 WebArena 上,在协议规定的五个百分点的幅度内被确立。结果表明,在这些配置和控制下,观测到的增益更紧密地跟踪所选层级的构成,而非演示出的任务特定定位。因此,固定层级基线和所选层级分布是路由器评估中必要的控制因素;研究结果仅限于这些配置、候选池和冻结的基准测试样本,而非普遍意义上的路由范式。
关键词:智能体系统、基准测试评估、成本\-质量权衡、跨基准测试一致性、LLM 路由、帕累托前沿、工具调用

## 1 引言
模型路由是现代 LLM 智能体中的一个关键设计选择。每个请求,以及在支持该功能的系统中多步轨迹的每一步,都可以被分派到几个候选模型、工具或策略\[1 (https://arxiv.org/html/2608.14641#bib.bib1)\]之一,需要在任务质量、美元成本、延迟,以及在智能体场景中的工具调用正确性和多步策略遵守情况之间进行权衡。所评估的路由器在更粗的粒度上运行:它们为每个任务或会话(表2 (https://arxiv.org/html/2608.14641#S5.T2))选择一个模型。因此,我们不评估轨迹中的逐步路由。当任务难度变化时,路由可以通过将合适的任务分配给更便宜的模型,同时保留更强大的模型给那些模型选择对成功有实质影响的任务,从而降低成本。一个开源路由器的生态系统已经形成以自动化这一选择:基于人类偏好数据训练的研究系统\[1 (https://arxiv.org/html/2608.14641#bib.bib1)\]、具有回退和预算控制的生产级 API 网关\[2 (https://arxiv.org/html/2608.14641#bib.bib2)\],以及基于嵌入的语义分派器\[21 (https://arxiv.org/html/2608.14641#bib.bib21)、3 (https://arxiv.org/html/2608.14641#bib.bib3)\],以及其他系统\[4 (https://arxiv.org/html/2608.14641#bib.bib4)、22 (https://arxiv.org/html/2608.14641#bib.bib22)\]。每种系统都针对成本、质量、延迟和可靠性空间中的不同点,并且这些系统通常使用不同的任务、候选池、指标和执行协议进行评估,这限制了直接比较。这些异构评估使得在指定的工作点(质量、成本、延迟、工具可靠性、任务领域)选择路由器变得困难,或者难以判断该选择对任务领域的敏感度如何。单一基准测试的评估无法估计这种跨领域的敏感性。同时回答这两个部分需要四点同时满足:(a) 一个任何路由器都可以接入的通用接口,(b) 一个涵盖从单轮问答到长期智能体任务的基准测试套件,(c) 一个报告帕累托前沿和跨基准测试一致性而非单一排行榜数值的指标协议,以及 (d) 对每个路由器和基准测试模式的忠实执行,因为模型近似下的行为可能无法转移到生产执行。以这种方式并排运行,使用通过我们指定的适配器连接的软件包默认值,并在固定的候选池上,路由器更复杂的选择机制在评判器的裁决中几乎不产生差异。这些软件包留下的几个配置选择是我们的,而非供应商的:Aurelio 每个层级的三句参考话语、其简单/中等/困难框架,以及其中等通用回退默认值,是我们提供的适配器选择;RouteLLM 的软件包默认升级阈值应用于一个未经校准的弱/强候选对(附录,路由器配置)。因此,Aurelio 下面的高回退率部分源于该稀疏的话语集,不应被解读为打包路由器本身的属性。该声明仅限于在此池上的这些配置,而非抽象意义上的路由范式。本文提供六项成果,与配套软件工件 router\_benchmark/ 的交付物相对应:
1.  一种用于路由器评估的测量协议,涵盖排名聚合和任务归因。命题1 (https://arxiv.org/html/2608.14641#Thmproposition1) 解决了*聚合*部分:一旦两个路由器的基准测试排名反转,就没有一个与基准测试无关的标量能保持每个基准测试特定的排序,因此,当读者需要这些单独的排序时,每个基准测试的报告是必要的,任何标量排名只有在相对于预先声明的流量权重或部署效用时才是定义明确的。*归因*部分是一个独立的方法论要求,该命题既不蕴含也不支持:声称路由器将正确的任务分配到正确的层级,必须相对于匹配份额的无内容分配进行测试,因为路由器的聚合层级混合及其逐任务定位是其表现出的任何优势的两个不同来源(第3节 (https://arxiv.org/html/2608.14641#S3) 和第6节 (https://arxiv.org/html/2608.14641#S6))。
2.  一个路由器/基准测试适配器接口和一个评估测试平台,可成对评估任何路由器列表与任何基准测试列表(第4节 (https://arxiv.org/html/2608.14641#S4))。
3.  一套面向部署的指标组合,每个统计量映射到其支持的决策,以及路由器的帕累托前沿计算(第4节 (https://arxiv.org/html/2608.14641#S4))。
4.  四个开源路由器在来自精选研究短名单的四个基准测试上的混合评估:RouterBench 重放记录的结果,而 BFCL v4、tau2\-bench 和 WebArena 通过一个测试平台、指标协议和绘图管道执行实时模型调用(第5节 (https://arxiv.org/html/2608.14641#S5) 和第6节 (https://arxiv.org/html/2608.14641#S6))。
5.  一项主要的实证结果。在评估的候选池、适配器、默认设置和冻结任务样本下,单一的无内容固定层级策略 Always\-Mid 在每个基准测试上重现了整体领先的路由器 Aurelio 语义路由器的观测成功率,在 RouterBench、BFCL 和 WebArena 上完全匹配,并在 tau2\-bench 上落后0\.003。更广泛的固定层级启发式方法(Always\-Strongest、Always\-Cheapest 和恒定层级路由器本身)在四个基准测试中的三个上匹配或超过观测到的最高路由器成功率(第6节 (https://arxiv.org/html/2608.14641#S6))。结合匹配份额的置换检验,得出了数据支持的更狭窄的主张:我们未在任何基准测试上检测到统计显著的任务特定成功优势,并且仅在 WebArena 上,在协议规定的±0\.05幅度内建立了与具有相同层级份额的无内容分配的等效性;RouterBench、BFCL 和 tau2\-bench 仍然不确定。正式的匹配份额检验是针对 vLLM 语义路由器运行的,这是唯一一个分配发生实质性变化的路由器;近乎恒定的路由器则通过与其重现的固定层级的直接成对等效性检验来覆盖,只要其选择是恒定的,这种检验就是精确的。这并不是说没有任何路由器能增加固定层级无法提供的东西。vLLM 语义路由器的 WebArena 混合比例产生了一个没有单一固定层级能重现的中间成本\-质量工作点,并且在该点上它是非占优的;我们的测试未能检测到的是*哪个*任务获得哪个层级所带来的益处,这与混合比例本身不同。由于四个路由器中有三个在此池上是恒定或近乎恒定的,原始成功率比较在很大程度上是一个固定层级与另一个固定层级的比较,并且它与这些配置相关,而非与任务自适应路由这一范式相关。
6.  一项跨基准测试一致性分析。相对排名在基准测试之间发生反转,这是命题1 (https://arxiv.org/html/2608.14641#Thmproposition1) 的一个实例,在 RouterBench 上已解决,在 BFCL 上有方向性但统计上未确定。在此套件中,排名方差不具信息性:每个路由器恰好在一个轴上发生排名反转,因此所有四个路由器具有相同的方差(0\.00 合并,0\.75 严格)。这留下了平均排名作为唯一的区分维度,并且即使领导者的身份不变,其显示的优势强度也依赖于分组方式(第6节 (https://arxiv.org/html/2608.14641#S6))。第2节 (https://arxiv.org/html/2608.14641#S2) 回顾相关工作。第3节 (https://arxiv.org/html/2608.14641#S3) 形式化评估问题。第4节 (https://arxiv.org/html/2608.14641#S4) 描述接口和指标。第5节 (https://arxiv.org/html/2608.14641#S5) 描述混合执行方法。第6节 (https://arxiv.org/html/2608.14641#S6) 报告结果,按基准测试和跨基准测试进行。第7节 (https://arxiv.org/html/2608.14641#S7) 讨论影响和威胁。第8节 (https://arxiv.org/html/2608.14641#S8) 总结。

## 2 相关工作
先前的路由工作涵盖了几个部分重叠的主线,每条线都解决问题的不同部分,通常在不同的基准测试上进行评估。我们据此进行分组。
查询级模型路由。RouteLLM\[1 (https://arxiv.org/html/2608.14641#bib.bib1)\]将路由视为二元的弱/强模型选择,基于人类偏好数据训练,并在 MMLU 和 GSM8K 上进行评估;它报告的成本\-质量权衡曲线被本文采用为主轴。我们将 RouteLLM 作为查询级代表和四个评估路由器中唯一的训练偏好模型。我们引用但未评估的其他查询级系统包括 LLMRouter\[4 (https://arxiv.org/html/2608.14641#bib.bib4)\] 和 Anyscale 教程系列,它们在较小的模型中追求相同的查询级选择。FrugalGPT\[18 (https://arxiv.org/html/2608.14641#bib.bib18)\] 研究预算受限的 LLM 级联,我们将其用作除路由器之外的成本感知基线概念。
生产级路由和网关。LiteLLM 的路由器\[2 (https://arxiv.org/html/2608.14641#bib.bib2)\]将路由视为基础设施:OpenAI 兼容的代理、负载均衡、预算执行和回退链,加上基于使用量和自适应策略。LiteLLM 路由器在我们的评估中代表了开源生产级网关范式。我们引用 NVIDIA AI Blueprint LLM Router\[22 (https://arxiv.org/html/2608.14641#bib.bib22)\]以表明该范式不限于开源工具。两者都强调网关功能,如可靠性、可观察性、负载均衡和回退,而非学习任务难度估计;我们每个基准测试的结果(第6节 (https://arxiv.org/html/2608.14641#S6))衡量了该设计范围对本文报告的路由行为分析的后果。
语义和意图路由。vLLM 语义路由器\[3 (https://arxiv.org/html/2608.14641#bib.bib3)\] 和 Aurelio 语义路由器\[21 (https://arxiv.org/html/2608.14641#bib.bib21)\]通过嵌入相似性进行路由,在生成*之前*将提示与信号(隐私、成本、延迟、安全)或意图匹配。这与 LLM\-Blender\[19 (https://arxiv.org/html/2608.14641#bib.bib19)\]的事后集成形成对比,后者在生成*之后*对候选*输出*进行排名;我们的短名单特意将执行前的路由与执行后的输出选择分开。
自演化和理论路由。EvoRoute\[6 (https://arxiv.org/html/2608.14641#bib.bib6)\]在智能体轨迹*内部*进行路由,通过重复的任务暴露来完善其自身策略,并报告帕累托最优的成本/准确性/延迟权衡。EvoRoute 是在智能体轨迹内运行的算法,而我们的工作是一项基础设施和评估贡献:一个对现有第三方路由器的通用接口,在一个重放基准测试和三个实时执行基准测试上进行评估。Mahmood\[7 (https://arxiv.org/html/2608.14641#bib.bib7)\]将提供者的路由策略和用户的重新提示行为建模为 Stackelberg 博弈。我们并未检验该预测。我们包含了两个特意设计的有限级联控制,但都不是响应感知的级联(在检查第一个响应后升级);其结果在第6节 (https://arxiv.org/html/2608.14641#S6) 中报告。
路由基准测试。RouterBench\[5 (https://arxiv.org/html/2608.14641#bib.bib5)\]是最接近路由器专用基准测试的类似物,记录了超过405,000个模型结果,并支持在固定成本下离线评估质量曲线,无需实时推理。然而,RouterBench 是单轮的,不测试工具使用或长期智能体行为。RouterEval\[9 (https://arxiv.org/html/2608.14641#bib.bib9)\] 和 LLMRouterBench\[10 (https://arxiv.org/html/2608.14641#bib.bib10)\]同样为路由研究提供大规模离线记录;LLMRouterBench 报告称,几个路由器在统一评估下未能可靠地击败简单基线。Shnitzer 等人\[8 (https://arxiv.org/html/2608.14641#bib.bib8)\]重新利用现有数据集来训练路由器,将其作为单轮文本的二元分类器;RouterBench 遵循同样的策略,即重新利用现有基准测试。我们则在真实的运行时负载上评估路由器:可执行的工具调用、多轮会话和浏览器轨迹,而非预先收集的文本。
智能体和工具使用基准测试。BFCL\[12 (https://arxiv.org/html/2608.14641#bib.bib12)、13 (https://arxiv.org/html/2608.14641#bib.bib13)\]作为标准的功能调用正确性基准测试,是检验路由器在降级到更便宜模型时是否保持工具调用正确性的天然测试。tau\-bench/tau2\-bench 系列\[14 (https://arxiv.org/html/2608.14641#bib.bib14)、15 (https://arxiv.org/html/2608.14641#bib.bib15)\]测试多轮、受策略约束的客服智能体,探究任务跨轮次的*一致性*。WebArena\[16 (https://arxiv.org/html/2608.14641#bib.bib16)\]在自托管网站上评估网络导航智能体,其中一个糟糕的路由决策可能在长浏览器轨迹中产生连锁反应。SWE\-bench Verified\[11 (https://arxiv.org/html/2608.14641#bib.bib11)\] 和 Terminal\-Bench 2\.0\[17 (https://arxiv.org/html/2608.14641#bib.bib17)\]探究了一个更难的长期场景,超出了我们的基准测试范围。评估背景也可能改变显在的智能体性能:Mahmood 等人\[20 (https://arxiv.org/html/2608.14641#bib.bib20)\]将 Agent\-as\-a\-Judge 提示栈本地化到五种语言,并发现领先的评判骨干随语言而变化。他们控制的变异不同于我们对跨基准测试路由器的比较,但它同样使评估背景成为结论的明确部分。统一的并排路由器比较本身并非新事物:LLMRouterBench\[10 (https://arxiv.org/html/2608.14641#bib.bib10)\]

相似文章

LLMRouter 开源 16+ 路由器库及 xRouteBench

Reddit r/ArtificialInteligence

arXiv 上一篇新论文介绍了名为 LLMRouter 的开源库,包含超过 16 种路由器实现和基准测试 xRouteBench,表明学习型路由器可比固定模型基线提升 14.6%。

最佳模型路由因任务而异(6分钟阅读)

TLDR AI

模型路由是降低推理成本的热门趋势,但最佳路由高度依赖具体任务。Harvey和Factory等团队通过专注于单一工作流而非通用路由器,实现了显著的成本节约。