学习智能体工作流的组合式元路由:一项可执行基准
摘要
本文介绍了一个用于学习智能体工作流中组合式元路由的可执行基准,其中预算感知控制器组合检索、代码执行和验证等操作。学习到的策略在保留测试中优于静态工作流,但在挑战集上表现出较低的词汇泛化能力。
arXiv:2608.00106v1 公告类型:新
摘要:智能体系统不仅必须决定产生什么答案,还必须决定在答案之前应该进行哪些推理和执行操作。控制器可以直接回答、分解请求、检索证据、执行代码、委派给专家,或验证中间结果。现有的路由工作大多孤立地选择模型端点、检索深度或工具。我们引入了一个可执行基准和一个预算感知的元路由器,它从原始任务文本中组合异构操作。该基准包含216个训练任务、72个开发任务、108个保留测试任务和108个锁定词汇转移挑战任务,涵盖数据分析、冻结语料库研究和文档处理。操作执行后,结果由机器检查。独立的正则化逻辑回归头从单词和字符特征预测操作概率,在开发数据上进行温度缩放,并在路由成本和操作次数预算下进行贪心组合。在保留测试中,学习到的策略实现了100%的成功率,而强静态和固定工作流为93.5%,成本比静态策略低43%;匹配的学习型单次路由器的成功率为56.5%。在未触及的挑战集上,学习到的策略成功率降至75.9%,落后于静态路由的93.5%,同时成本降低49%,并超过单次路由34.3个百分点。这一差距表明主要限制是词汇泛化,而非路由执行。这些结果建立了一个可复现的测试平台和一个有界的概念验证,而非实时LLM性能的证据。
查看缓存全文
缓存时间: 2026/08/04 07:36
# 面向智能体工作流的学习组合式元路由:一个可执行基准 来源:https://arxiv.org/html/2608.00106 ###### 摘要 智能体系统不仅要决定产生什么答案,还要决定在其之前应执行哪些推理和执行操作。控制器可以直接回答、分解请求、检索证据、执行代码、委托给专家,或验证中间结果。现有路由工作大多孤立地选择模型端点、检索深度或工具。我们引入了一个可执行基准和一个预算感知的元路由器,它从原始任务文本组合异构操作。该基准包含 216 个训练、72 个开发、108 个留出测试和 108 个锁定词汇偏移挑战任务,覆盖数据分析、冻结语料库研究和文档处理。操作执行后,结果由机器检查。独立的正则化逻辑回归头根据词和字符特征预测操作概率,在开发数据上进行温度缩放,并在路由成本和动作数量预算下进行贪心组合。在留出测试上,学习策略实现 100% 的成功率,而强静态/固定工作流为 93.5%,成本比静态策略低 43%;匹配的学习型一次性路由器达到 56.5%。在未接触过的挑战划分上,学习策略的成功率降至 75.9%,落后于静态路由的 93.5%,但仍便宜 49%,并超出一次性路由 34.3 个百分点。这一差距表明主要局限是词汇泛化,而非路由执行。这些结果建立了一个可复现的测试平台和有界限的概念验证,而非实时 LLM 性能的证据。 ## 1 引言 现代智能体应用将语言模型与检索、代码执行、外部 API、专家智能体、验证和恢复逻辑相结合。在任何组件发挥作用之前,控制器必须选择是否调用它。这一元决策影响准确性、成本、延迟以及组件故障风险。直接回答效率高,但可能缺乏证据或计算;不加区分的工具使用会增加开销;固定工作流在某个组件不可用时可能失败。 已有研究展示了自适应检索([Jeong et al. 2024](https://arxiv.org/html/2608.00106#bib.bib11))、成本感知模型路由([Chen et al. 2024](https://arxiv.org/html/2608.00106#bib.bib7);[Ong et al. 2025](https://arxiv.org/html/2608.00106#bib.bib8))、优化函数调用计划([Kim et al. 2024](https://arxiv.org/html/2608.00106#bib.bib6))和反思式规划([Yao et al. 2023](https://arxiv.org/html/2608.00106#bib.bib1);[Zhang et al. 2026](https://arxiv.org/html/2608.00106#bib.bib18))的价值。智能体基准评估规划和工具执行([Liu et al. 2024](https://arxiv.org/html/2608.00106#bib.bib4);[Yao et al. 2024](https://arxiv.org/html/2608.00106#bib.bib10)),但很少有研究单独考察在不同类别的认知和执行操作之间进行选择的策略。这使两个问题纠缠在一起:控制器是否能识别相关能力,以及组合多个能力是否优于只选择一个。 我们通过一个可执行基准来研究这一层。每个任务仅以原始文本形式呈现给策略。一条路由在回答之前可能包含分解、检索、代码执行、委托和验证。与我们的初步离线模拟器不同,成功不是从标注的需求中采样得到的:操作会转换任务状态、产生候选答案并遭遇确定性失败条件;随后由精确评估器检查结果。标签仅用于训练操作预测器和分析路由质量。 我们的贡献如下: - 一个可执行元路由基准,包含机器检查的数据分析、研究和文档处理任务、留出模板、锁定词汇偏移挑战划分以及组件中断案例; - 一个经过校准的原始文本路由器,可预测多种操作类型,并在明确的动作数量和成本预算下组合它们; - 与直接、随机、关键词、静态工作负载、固定智能体、一次性学习和神谕策略在成功率、成本、本地延迟、预算合规性和路由质量上的比较;以及 - 配对统计分析和消融实验,分别考察组合、字符级泛化、校准和预算执行。 核心结果是有意限定范围的。学习路由器解决了全部 108
相似文章
MetaRoute-Bench:评估智能体工作流路由的元决策策略
本文介绍了MetaRoute-Bench,一个用于评估智能体工作流中元决策策略的开放基准,在共享执行模型下比较路由策略的成功率、成本和延迟。
奖励驱动的大语言模型代理工作流:融合POMDP路由与自我修正的自主决策
本文提出了一种奖励驱动的大语言模型代理工作流,融合了POMDP路由与自我修正奖励模型,在ALFWorld和WebShop等基准测试中任务成功率提升了24.5%。
面向LLM智能体的组合式技能路由:分解、检索与组合
介绍了SkillWeaver,一个用于将多个技能路由到LLM智能体的分解-检索-组合框架,以及CompSkillBench,一个包含300个组合查询的基准测试,涵盖2,209个真实MCP服务器技能。
[R] 将代理工作流编译到LLM权重中:以两个数量级的成本降低实现接近前沿质量
本文证明,将代理工作流程序编译到小型微调模型的权重中,与上下文基线相比,实现了接近前沿的质量,成本降低128至462倍,解决了质量、成本和灵活性的感知障碍。
DecisionBench:面向长周期智能体工作流中涌现式委托的基准测试
DecisionBench 提出了一个标准化基准,用于评估长周期多智能体工作流中的涌现式委托,提供了包含任务套件、同行模型和多维度指标的底层架构,以隔离编排能力。