MetaRoute-Bench:评估智能体工作流路由的元决策策略

arXiv cs.LG 论文

摘要

本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。

arXiv:2608.00107v1 公告类型:新 摘要:智能体系统必须反复决定是直接回答、分解任务、调用工具、执行代码、委派给专家、验证中间结果,还是从失败中恢复。这些元决策不仅影响任务成功率,还影响运营成本和延迟,但它们通常嵌入在编排框架中,仅通过聚合任务准确度进行评估。我们提出了MetaRoute-Bench,一个开放、可检查的框架,用于在共享执行模型下比较元决策策略。初始基准包含180个合成任务档案,涵盖数据分析、研究和文档处理,八种路由策略,以及30对配对随机种子。在43,200条轨迹中,一种任务感知的组合策略实现了79.4%的成功率,而强工作负载特定的静态策略为76.7%,单次任务路由为67.4%,直接回答为52.9%。相对于静态策略,这是2.7个百分点的改进,配对95%置信区间为±2.0个百分点,平均成本增加4.7%,延迟增加6.4%。消融实验显示,当路由组合被限制为单一操作以及移除验证时,损失最大。这些结果由带种子的离线执行模型生成,而非实时部署;因此,主要贡献是一种可复现的评估方法和路由策略权衡分析,而非生产有效性的证据。我们发布了任务生成、策略、轨迹、测试和分析工件,以支持实时系统验证。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# MetaRoute-Bench:评估智能体工作流中的元决策策略
来源: https://arxiv.org/html/2608.00107
\(2026\)

###### 摘要。

智能体系统必须反复决定是直接回答、分解任务、调用工具、执行代码、委派给专家、验证中间结果,还是从失败中恢复。这些元决策不仅影响任务成功率,还影响运行成本和延迟,但它们通常被嵌入到编排框架中,并且仅通过总体的任务准确率来评估。我们提出了 MetaRoute-Bench,这是一个开放、可检查的框架,用于在共享执行模型下比较元决策策略。初始基准包含 180 个合成任务配置文件,涵盖数据分析、研究和文档处理,8 种路由策略,以及 30 个配对随机种子。在 43,200 条轨迹中,一种任务感知的组合策略达到了 79.4% 的成功率,而强有力的工作负载特定静态策略为 76.7%,单

相似文章

学习智能体工作流的组合式元路由:一项可执行基准

arXiv cs.LG

本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。