MetaRoute-Bench:评估智能体工作流路由的元决策策略
摘要
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
arXiv:2608.00107v1 公告类型:新
摘要:智能体系统必须反复决定是直接回答、分解任务、调用工具、执行代码、委派给专家、验证中间结果,还是从失败中恢复。这些元决策不仅影响任务成功率,还影响运营成本和延迟,但它们通常嵌入在编排框架中,仅通过聚合任务准确度进行评估。我们提出了MetaRoute-Bench,一个开放、可检查的框架,用于在共享执行模型下比较元决策策略。初始基准包含180个合成任务档案,涵盖数据分析、研究和文档处理,八种路由策略,以及30对配对随机种子。在43,200条轨迹中,一种任务感知的组合策略实现了79.4%的成功率,而强工作负载特定的静态策略为76.7%,单次任务路由为67.4%,直接回答为52.9%。相对于静态策略,这是2.7个百分点的改进,配对95%置信区间为±2.0个百分点,平均成本增加4.7%,延迟增加6.4%。消融实验显示,当路由组合被限制为单一操作以及移除验证时,损失最大。这些结果由带种子的离线执行模型生成,而非实时部署;因此,主要贡献是一种可复现的评估方法和路由策略权衡分析,而非生产有效性的证据。我们发布了任务生成、策略、轨迹、测试和分析工件,以支持实时系统验证。
查看缓存全文
缓存时间: 2026/08/04 07:36
# MetaRoute-Bench:评估智能体工作流中的元决策策略 来源: https://arxiv.org/html/2608.00107 \(2026\) ###### 摘要。 智能体系统必须反复决定是直接回答、分解任务、调用工具、执行代码、委派给专家、验证中间结果,还是从失败中恢复。这些元决策不仅影响任务成功率,还影响运行成本和延迟,但它们通常被嵌入到编排框架中,并且仅通过总体的任务准确率来评估。我们提出了 MetaRoute-Bench,这是一个开放、可检查的框架,用于在共享执行模型下比较元决策策略。初始基准包含 180 个合成任务配置文件,涵盖数据分析、研究和文档处理,8 种路由策略,以及 30 个配对随机种子。在 43,200 条轨迹中,一种任务感知的组合策略达到了 79.4% 的成功率,而强有力的工作负载特定静态策略为 76.7%,单
相似文章
学习智能体工作流的组合式元路由:一项可执行基准
本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。
DecisionBench:面向长周期智能体工作流中涌现式委托的基准测试
DecisionBench 提出了一个标准化基准,用于评估长周期多智能体工作流中的涌现式委托,提供了包含任务套件、同行模型和多维度指标的底层架构,以隔离编排能力。
AgentRouter:用于成本最优多步骤代理工作流的异构模型路由
AgentRouter 是一个轻量级分类器,用于在代理工作流中将步骤路由到不同的模型层级,与仅使用前沿模型相比,实现了72%的成本降低且质量退化最小。
@tomas_hk: 今天我们发布了一种使用交互式基准测试评估模型路由的方法论,该方法更准确地代表了代理成本的累积……
发布一种通过交互式基准测试评估模型路由的方法论,该方法在领先基准测试中实现了帕累托优势,以更低成本提供更高质量。
任务与会话级模型路由:基于通用接口的混合评估——对四种开源路由器在四个基准测试中的评估
本文使用通用协议在四个基准测试中评估了四种开源LLM路由器,发现性能提升更紧密地与模型层级构成相关,而非针对特定任务的目标设定。