MetaRoute-Bench:评估智能体工作流路由的元决策策略
摘要
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
arXiv:2608.00107v1 公告类型:新
摘要:智能体系统必须反复决定是直接回答、分解任务、调用工具、执行代码、委派给专家、验证中间结果,还是从失败中恢复。这些元决策不仅影响任务成功率,还影响运营成本和延迟,但它们通常嵌入在编排框架中,仅通过聚合任务准确度进行评估。我们提出了MetaRoute-Bench,一个开放、可检查的框架,用于在共享执行模型下比较元决策策略。初始基准包含180个合成任务档案,涵盖数据分析、研究和文档处理,八种路由策略,以及30对配对随机种子。在43,200条轨迹中,一种任务感知的组合策略实现了79.4%的成功率,而强工作负载特定的静态策略为76.7%,单次任务路由为67.4%,直接回答为52.9%。相对于静态策略,这是2.7个百分点的改进,配对95%置信区间为±2.0个百分点,平均成本增加4.7%,延迟增加6.4%。消融实验显示,当路由组合被限制为单一操作以及移除验证时,损失最大。这些结果由带种子的离线执行模型生成,而非实时部署;因此,主要贡献是一种可复现的评估方法和路由策略权衡分析,而非生产有效性的证据。我们发布了任务生成、策略、轨迹、测试和分析工件,以支持实时系统验证。
查看缓存全文
缓存时间: 2026/08/04 07:36
# MetaRoute-Bench:评估智能体工作流中的元决策策略 来源: https://arxiv.org/html/2608.00107 \(2026\) ###### 摘要。 智能体系统必须反复决定是直接回答、分解任务、调用工具、执行代码、委派给专家、验证中间结果,还是从失败中恢复。这些元决策不仅影响任务成功率,还影响运行成本和延迟,但它们通常被嵌入到编排框架中,并且仅通过总体的任务准确率来评估。我们提出了 MetaRoute-Bench,这是一个开放、可检查的框架,用于在共享执行模型下比较元决策策略。初始基准包含 180 个合成任务配置文件,涵盖数据分析、研究和文档处理,8 种路由策略,以及 30 个配对随机种子。在 43,200 条轨迹中,一种任务感知的组合策略达到了 79.4% 的成功率,而强有力的工作负载特定静态策略为 76.7%,单
相似文章
学习智能体工作流的组合式元路由:一项可执行基准
本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。
DecisionBench:面向长周期智能体工作流中涌现式委托的基准测试
DecisionBench 提出了一个标准化基准,用于评估长周期多智能体工作流中的涌现式委托,提供了包含任务套件、同行模型和多维度指标的底层架构,以隔离编排能力。
奖励驱动的大语言模型代理工作流:融合POMDP路由与自我修正的自主决策
本文提出了一种奖励驱动的大语言模型代理工作流,融合了POMDP路由与自我修正奖励模型,在ALFWorld和WebShop等基准测试中任务成功率提升了24.5%。
MapSatisfyBench: 通过基于行为的隐式决策因素评估满意度感知的地图代理
MapSatisfyBench是一个基准,用于评估基于LLM的地图代理从表述不明确的用户查询中恢复隐式决策因素的能力,将评估从任务完成转向满意度感知的空间决策。
多智能体路由作为集合值预测:一个基于WildChat的基准测试与成本感知评估
本文将从自然语言提示出发的智能体路由形式化为集合值预测问题,引入了一个源自WildChat的基准测试,包含3000个提示,覆盖12个智能体的固定目录,并评估了包括有监督分类器和成本感知路由在内的多种方法,以研究精度与成本之间的权衡。