FlowScout:从执行反馈到可靠的工具使用智能体工作流
摘要
FlowScout 是一个框架,能够从历史任务解决记录中自动生成集成工具智能体工作流,利用由执行反馈引导的蒙特卡洛树搜索。实验表明,与基线方法相比,它提高了工具调用正确性和执行分数。
arXiv:2608.10039v1 公告类型:新
摘要:智能体工作流已成为构建基于LLM的可靠自动化系统的重要抽象,通过将大型语言模型(LLM)、工具和控制逻辑组织成显式的执行结构。然而,构建高质量的智能体工作流在很大程度上仍然依赖手动操作,并且需要大量的领域专业知识。近期研究探索了从历史任务解决记录中自动生成智能体工作流,但这些研究主要生成以LLM为中心的工作流,其中真实的工具执行被抽象并由LLM节点模拟,限制了所生成工作流的可用性和稳定性。为解决这些局限性,我们提出了FlowScout,一种执行引导的框架,用于从历史任务解决记录中生成集成工具智能体工作流。具体而言,FlowScout将智能体工作流表示为由LLM节点、工具调用节点和依赖边组成的有向图。它首先从历史记录中挖掘一个常见的工具协调骨架以构建初始工作流,然后通过由执行反馈引导的蒙特卡洛树搜索来优化工作流拓扑。我们在四个代表性任务域上评估了FlowScout,并将其与三个基线方法(即PM4Py、ReAct和AFlow)进行比较。实验结果表明,与基线方法相比,FlowScout生成的智能体工作流将工具调用正确性提高了至少92.69%,执行质量提高了至少17.66%,同时在重复运行中实现了更低的性能变异。
查看缓存全文
缓存时间: 2026/08/12 08:27
# FlowScout:从执行反馈到可靠的工具使用智能体工作流
来源:https://arxiv.org/html/2608.10039
###### 摘要
智能体工作流已成为构建基于LLM的可靠自动化系统的重要抽象,其通过将大语言模型(LLMs)、工具和控制逻辑组织为显式的执行结构。然而,构建高质量的智能体工作流在很大程度上仍依赖人工操作,且需要大量的领域专业知识。近期研究探索了从历史任务求解记录中自动生成智能体工作流,但这类方法主要生成以LLM为中心的工作流,其中真实的工具执行被抽象并由LLM节点模拟,从而限制了生成工作流的可用性和稳定性。为解决这些局限,我们提出了FlowScout,一个面向从历史任务求解记录生成工具集成智能体工作流的执行引导框架。具体而言,FlowScout将智能体工作流表示为由LLM节点、工具调用节点和依赖边组成的有向图。它首先从历史记录中挖掘常见的工具协调骨架,以构建初始工作流,然后通过执行反馈引导的蒙特卡洛树搜索来细化工作流拓扑。我们在四个代表性任务域上评估了FlowScout,并将其与三个基线(即PM4Py、ReAct和AFlow)进行比较。实验结果表明,FlowScout生成的智能体工作流在工具调用正确性上较基线至少提升92.69%,在执行分数上至少提升17.66%,同时在重复运行中实现了更低的性能波动。
## I 引言
大语言模型(LLMs)的快速发展\[24](https://arxiv.org/html/2608.10039#bib.bib2),9 (https://arxiv.org/html/2608.10039#bib.bib3)\]引入了LLM智能体,作为处理复杂任务的新型自动化范式。通过将LLM推理与外部工具相结合,LLM智能体能够解释用户查询、分解任务、调用工具,并根据中间结果调整后续行动\[42](https://arxiv.org/html/2608.10039#bib.bib19),32 (https://arxiv.org/html/2608.10039#bib.bib20),41 (https://arxiv.org/html/2608.10039#bib.bib21),46 (https://arxiv.org/html/2608.10039#bib.bib22),3 (https://arxiv.org/html/2608.10039#bib.bib23),37 (https://arxiv.org/html/2608.10039#bib.bib24),13 (https://arxiv.org/html/2608.10039#bib.bib25),30 (https://arxiv.org/html/2608.10039#bib.bib26),28 (https://arxiv.org/html/2608.10039#bib.bib27),14 (https://arxiv.org/html/2608.10039#bib.bib29)\]。然而,LLM推理的灵活性和黑盒特性使得智能体执行不够稳定且难以检查。对于相似的用户查询,LLM智能体可能做出不一致的决策,遵循不同的行动顺序,并选择不同的工具,从而导致不可预测的执行结果\[1](https://arxiv.org/html/2608.10039#bib.bib40)\]。
为提高智能体执行的可用性和稳定性,智能体工作流提供了一种有前景的方式,将传统工作流与LLM的优势结合起来\[43](https://arxiv.org/html/2608.10039#bib.bib7)\]。智能体工作流不是让LLM智能体在运行时自由决定每个动作,而是将LLM、工具和控制逻辑组织为显式的执行结构\[19](https://arxiv.org/html/2608.10039#bib.bib39)\]。此类智能体工作流保留了LLM的语义推理能力,同时通过可复用、可观察的结构约束其执行。因此,智能体工作流已成为构建可靠的基于LLM自动化系统的重要抽象\[45](https://arxiv.org/html/2608.10039#bib.bib4),10 (https://arxiv.org/html/2608.10039#bib.bib5),27 (https://arxiv.org/html/2608.10039#bib.bib6),48 (https://arxiv.org/html/2608.10039#bib.bib9),34 (https://arxiv.org/html/2608.10039#bib.bib8)\]。
先前研究已探索了工作流生成,包括从形式化服务规范合成Web服务工作流\[33](https://arxiv.org/html/2608.10039#bib.bib11),2 (https://arxiv.org/html/2608.10039#bib.bib12)\]、从执行日志中提取过程模型\[7](https://arxiv.org/html/2608.10039#bib.bib13),35 (https://arxiv.org/html/2608.10039#bib.bib17)\],以及从自然语言描述生成软件工作流\[23](https://arxiv.org/html/2608.10039#bib.bib14),39 (https://arxiv.org/html/2608.10039#bib.bib15)\]。这些研究为从规范或观测到的任务执行中推导工作流提供了重要基础。然而,它们主要面向任务活动具有显式语义、稳定执行模式和明确定义接口的场景。因此,它们难以直接应用于需要语义理解、动态决策以及外部工具间灵活协调的开放式任务。目前,高质量智能体工作流的构建仍主要依靠人工。现有智能体框架,如LangChain\[15](https://arxiv.org/html/2608.10039#bib.bib41)\]、LangGraph\[16](https://arxiv.org/html/2608.10039#bib.bib42)\]和AutoGen\[36](https://arxiv.org/html/2608.10039#bib.bib43)\],以及低代码平台,如Dify\[17](https://arxiv.org/html/2608.10039#bib.bib44)\]和Coze\[6](https://arxiv.org/html/2608.10039#bib.bib45)\],为实施智能体工作流提供了有用的抽象,但开发者仍需决定如何针对目标任务域构建智能体工作流,这需要大量的领域专业知识和迭代式调试工作。
近期,一些研究\[44](https://arxiv.org/html/2608.10039#bib.bib50),47 (https://arxiv.org/html/2608.10039#bib.bib51)\]开始探索智能体工作流的自动生成。这些方法利用历史任务求解记录(例如,从人类演示中收集的工具编排日志,或LLM智能体轨迹,其中工具调用顺序已通过任务成功完成得到验证)来生成特定领域的智能体工作流。然而,它们只能生成以LLM为中心的工作流,其中节点都是LLM操作,如规划、编程、格式化、修订和上下文生成,无法显式保留历史任务求解记录中嵌入的真实工具调用。因此,生成的智能体工作流仍严重依赖LLM来模拟工具执行,这可能导致行为不稳定、输出幻觉,以及领域特定工具协调的可解释性受限。
为解决这些局限,我们提出了FlowScout,一个从历史任务求解记录自动生成工具集成智能体工作流的执行引导框架。具体而言,我们将智能体工作流建模为由LLM节点、工具调用节点以及编码数据流和控制流的依赖边组成的有向图,并将其生成表述为候选工作流图上的搜索问题。在给定可用工具和一组历史任务求解记录(包括领域特定的用户查询、参考执行结果和经过验证的工具编排日志)的情况下,FlowScout首先从历史记录中挖掘最常见的工具协调骨架,并通过为骨架补充必要的LLM节点来构建初始智能体工作流。然后,FlowScout执行引导图搜索,其中候选工作流在历史用户查询上执行,其输出与参考结果进行比较。该反馈引导蒙特卡洛树搜索\[4](https://arxiv.org/html/2608.10039#bib.bib30)\]通过添加、删除或细化LLM节点和工具调用节点,以及修改依赖边来优化工作流图。最后,FlowScout生成一个可复用且稳定的智能体工作流,显式协调真实工具来求解目标领域中的新用户查询。
我们进行了大量实验来评估FlowScout的有效性和效率。首先,我们在ToolBench\[28](https://arxiv.org/html/2608.10039#bib.bib27)\]的四个代表性任务域(即金融、体育、旅行和天气)上评估FlowScout,并将其与三个基线(即PM4Py\[35](https://arxiv.org/html/2608.10039#bib.bib17)\]、ReAct\[42](https://arxiv.org/html/2608.10039#bib.bib19)\]和AFlow\[44](https://arxiv.org/html/2608.10039#bib.bib50)\])进行比较。结果表明,FlowScout生成的智能体工作流在工具调用正确性上较基线至少提升92.69%,在执行分数上至少提升17.66%,同时与ReAct和AFlow相比,重复运行之间的变异系数分别降低62.09%和27.90%。其次,FlowScout生成的工作流会产生比ReAct和AFlow至少高24.12%的运行成本,以换取更高的有效性。此外,消融研究显示了FlowScout中工作流挖掘器和蒙特卡洛树搜索的贡献。最后,我们通过使用与工作流生成阶段不同的工具和LLM在运行时部署FlowScout生成的智能体工作流,展示了其泛化能力。
本工作的主要贡献如下:
- •我们将智能体工作流表示为由LLM节点、工具调用节点以及编码数据依赖或控制依赖的边组成的结构化图,并将智能体工作流的生成转化为图搜索问题。
- •我们提出了FlowScout,一个执行引导的生成框架,基于历史任务求解记录自动搜索工具集成的智能体工作流,提高了生成工作流的可用性和稳定性。
- •我们实现了FlowScout的原型,并进行了实验以证明其有效性和效率。
## II 问题定义
给定可用工具和历史任务求解记录(包括用户查询、参考执行结果和经过验证的工具编排日志),我们旨在自动生成工具集成的智能体工作流,以实现自主任务完成。我们首先定义此类工作流,然后将其生成表述为有效工作流图上的搜索问题。
### II-A 工作流定义
给定具有一组可用工具 \(\mathcal{T}\) 的任务域,我们将工具集成智能体工作流定义为有向图。
###### 定义1(工具集成智能体工作流)。
工具集成智能体工作流是一个有向图 \(\mathcal{G}=(\mathcal{V},\mathcal{E})\),其中 \(\mathcal{V}\) 是由LLM节点和工具调用节点组成的工作流节点集合,\(\mathcal{E}\) 是定义节点间控制流和数据流的有向依赖边集合。
###### 定义2(LLM节点)。
LLM节点 \(v_l\in\mathcal{V}\),在文本上下文上执行语义推理,是一个元组 \(v_l=\langle\delta_{v_l},\rho_{v_l}\rangle\),其中 \(\delta_{v_l}\) 是一个LLM,\(\rho_{v_l}\) 是其提示词。
###### 定义3(工具调用节点)。
工具调用节点 \(v_t\in\mathcal{V}\),调用真实工具,是一个元组 \(\langle t,\vartheta_t\rangle\),其中 \(t\in\mathcal{T}\) 是工具,\(\vartheta_t\) 是工具调用的参数。
###### 定义4(依赖边)。
边 \(e_{\langle v^i,v^j\rangle}\in\mathcal{E}\) 是一个元组 \(\langle v^i,v^j,\mu\rangle\),表示从节点 \(v^i\) 到节点 \(v^j\) 的有向依赖,其中 \(\mu\) 指定依赖语义,即数据依赖或控制依赖。
工作流执行从用于用户查询解析的LLM节点开始,沿图中的依赖边推进,直到由另一个LLM节点生成最终响应以进行响应合成。在执行过程中,LLM节点基于可用上下文和中间结果进行推理,而工具调用节点通过真实工具调用提供外部能力。
### II-B 工作流生成作为图搜索
输入由一组可用工具 \(\mathcal{T}\) 和一组历史任务求解记录 \(\mathcal{D}=\{(q_i,r_i,\pi_i)\}_{i=1}^{N}\) 组成,其中 \(N\) 是记录数量,\(q_i\) 是用户查询,\(r_i\) 是参考执行结果,\(\pi_i\) 是经过验证的工具编排日志。这些记录既支持工具集成智能体工作流的自动构建,也支持其评估。
基于第II-A节中的定义,我们通过公式(1)定义可用工具 \(\mathcal{T}\) 上的候选工作流搜索空间,
\[
\Omega(\mathcal{T})=\left\{\mathcal{G}=(\mathcal{V},\mathcal{E})\mid\mathrm{Valid}(\mathcal{G},\mathcal{T})=\text{True}\right\}
\tag{1}
\]
其中 \(\mathrm{Valid}(\mathcal{G},\mathcal{T})\) 是一个有效性谓词,表示候选工作流 \(\mathcal{G}\) 是否满足工具集成工作流的基本约束。具体而言,\(\mathcal{G}\) 仅在以下情况下有效:其工具调用节点能够调用 \(\mathcal{T}\) 中的真实工具,其依赖边构成可执行图,并且它包含至少一条从输入查询到最终响应的完整执行路径。
为估计候选工作流 \(\mathcal{G}\in\Omega(\mathcal{T})\) 的质量,我们在 \(\mathcal{D}\) 中的每个历史查询 \(q_i\) 上执行 \(\mathcal{G}\),生成工具编排轨迹 \(\hat{\pi}_i\) 和执行结果 \(\hat{r}_i\)。由于复杂的工具使用任务既要求正确的工具选择,也要求正确的执行调度\[38](https://arxiv.org/html/2608.10039#bib.bib28)\],我们在工具调用层面和最终结果层面评估候选工作流。具体而言,我们将 \(\hat{\pi}_i\) 与经过验证的编排日志 \(\pi_i\) 进行比较以评估工具调用正确性,并将 \(\hat{r}_i\) 与参考执行结果 \(r_i\) 进行比较以获得执行分数。
工具调用正确性(TC)衡量智能体工作流是否以正确的参数调用正确的工具,同时避免冗余调用。给定历史查询 \(q_i\),设其经过验证的工具编排日志为 \(\pi_i=\{(t_i^k,\theta_i^k)\}_{k=1}^{K_i}\),其中 \(K_i\) 是工具调用次数,\(t_i^k\) 和 \(\theta_i^k\) 分别表示第 \(k\) 次参考调用的工具名称和参数。类似地,设候选工作流 \(\mathcal{G}\) 产生的工具编排轨迹为 \(\hat{\pi}_i=\{(\hat{t}_i^k,\hat{\theta}_i^k)\}_{k=1}^{\hat{K}_i}\),其中 \(\hat{K}_i\) 是工具调用次数,\(\hat{t}_i^k\) 和 \(\hat{\theta}_i^k\) 分别表示第 \(k\) 次调用的工具名称和参数。我们通过公式(2)定义 \(\mathcal{G}\) 在查询 \(q_i\) 上的工具调用正确性,
\[
TC_i(\mathcal{G})=\frac{\left\|\operatorname{LCS}_{t=\hat{t}\land\theta=\hat{\theta}}(\pi_i,\hat{\pi}_i)\right\|}{\max(K_i,\hat{K}_i)}
\tag{2}
\]
其中 \(\operatorname{LCS}_{t=\hat{t}\land\theta=\hat{\theta}}(\pi_i,\hat{\pi}_i)\) 表示参考工具调用与工作流产生的工具调用之间的最长公共子序列,其中匹配的调用相似文章
@ycombinator: Flowscope 部署智能体以学习并记录企业运营模式。在此基础上,其智能体会重新设计并自动化……
Flowscope 是一家由 Y Combinator 支持的 AI 原生咨询公司,通过直接集成到现有的企业系统中,部署智能体在几天内完成业务流程的映射、重新设计和自动化。
FlowBank: 通过预计算和重用的查询自适应智能体工作流优化
FlowBank引入了一个三阶段框架,通过预计算一组多样化的可重用工作流并自适应地为每个查询选择最佳工作流,来优化LLM多智能体系统中的智能体工作流,在保持成本竞争力的同时实现了更高的分数。
SkillFlow:自主智能体终身技能发现与演化基准测试
SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。
SkillFlow:流程驱动的递归技能演化用于智能体编排
SkillFlow 提出了一种基于流程驱动的递归技能演化框架,用于基于大语言模型的智能体编排,采用 Tempered Trajectory Balance 来防止策略崩溃并提供透明的信用分配。在 14 个数据集上的实验表明,在问答、数学、代码和决策制定任务中,该框架显著优于基线方法。
工具即连续流:用于演进式智能体推理
本文介绍了 FlowAgent,这是一个新颖的框架,它利用条件流匹配将工具链重新概念化为连续轨迹生成,以提高长时序智能体推理的鲁棒性。