FlowEvo:通过工作流与可执行技能的协同演化实现自演化智能体

Hugging Face Daily Papers 论文

摘要

FlowEvo是一个免训练框架,使得大语言模型智能体能够在推理时协同演化可复用技能和工作流,在ALFWorld、HumanEval和GSM8K等基准测试中实现了最先进的准确性和效率。

大语言模型智能体可以通过在推理时构建工作流来适应复杂任务,但在一个场景中发现的流程在执行后通常会被丢弃。现有的技能库提供了可复用的可执行例程,但通常是离线组装的,并且不会从智能体自身的工作流中增长。我们介绍了FlowEvo,一个免训练框架,其中工作流和技能在推理时协同演化。FlowEvo将成功的工作流编译为可调用的技能,将其存储在持久库中,并使用检索到的技能,要么通过直接执行,要么作为构建新工作流的上下文。它还跟踪每个技能的下游效用,并抑制导致负迁移的技能。使用共享的GPT-4o-mini主干网络,FlowEvo在ALFWorld、HumanEval、MBPP、GSM8K和MATH-500的完整标准划分上,在8个基线中实现了最高的准确性。在ALFWorld上,它达到了85.6%,比最强基线高出26.4个百分点,同时使用了大约三分之一数量的令牌。在跨越7B到671B参数的10个基础模型中,FlowEvo在50个模型-数据集比较中有49个优于ExpeL。代码可在https://github.com/DEFENSE-SEU/FlowEvo获取。
查看原文
查看缓存全文

缓存时间: 2026/08/22 00:12

论文页面 - FlowEvo:通过工作流与可执行技能的协同进化实现智能体自我进化

来源:https://huggingface.co/papers/2607.21596 发布于 8月20日

·

提交者:https://huggingface.co/LeoYML

Leo Y (https://huggingface.co/LeoYML) 于 8月21日

摘要

FlowEvo 使得大语言模型智能体能够在推理过程中协同进化可复用技能与工作流,从而在各类基准测试中提升准确率与效率。

大语言模型智能体可以通过在推理时构建工作流来适应复杂任务,但某一进程中发现的程序通常在执行后即被丢弃。现有的技能库(https://huggingface.co/papers?q=skill%20libraries)提供了可复用的可执行例程,但通常是在离线组装,并且不会从智能体自身的工作流中增长。我们提出了 FlowEvo(https://huggingface.co/papers?q=FlowEvo),一个无需训练的框架,其中工作流与技能在推理时协同进化。FlowEvo(https://huggingface.co/papers?q=FlowEvo)将成功的工作流编译为可调用的技能,存储在一个持久库中,并通过直接执行或作为构建新工作流的上下文来使用检索到的技能。它还跟踪每个技能的下游效用,并抑制导致负迁移(https://huggingface.co/papers?q=negative%20transfer)的技能。使用共享的 GPT-4o-mini 主干,FlowEvo(https://huggingface.co/papers?q=FlowEvo)在 ALFWorld、HumanEval、MBPP、GSM8K 和 MATH-500 的完整标准划分上,在 8 个基线中取得了最高准确率。在 ALFWorld 上,它达到了 85.6%,比最强基线高出 26.4 个点,同时使用的大约只有其三分之一的 token 数。在涵盖从 70 亿到 6710 亿参数的 10 个基础模型上,FlowEvo(https://huggingface.co/papers?q=FlowEvo)在 50 个模型-数据集比较中有 49 个超越了 ExpeL。代码可在 https://github.com/DEFENSE-SEU/FlowEvo 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2607.21596) 查看 PDF (https://arxiv.org/pdf/2607.21596) GitHub 仓库 (https://github.com/DEFENSE-SEU/FlowEvo) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2607.21596)

通过你的智能体获取本文:

hf papers read 2607.21596

没有最新的 CLI?请运行:curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型

0

暂无模型链接本文

在模型的 README.md 中引用 arxiv.org/abs/2607.21596 以将其链接到此页面。

引用本文的数据集

0

暂无数据集链接本文

在数据集的 README.md 中引用 arxiv.org/abs/2607.21596 以将其链接到此页面。

引用本文的 Space

0

暂无 Space 链接本文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.21596 以将其链接到此页面。

包含本文的收藏夹

0

暂无收藏夹包含本文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

SkillFlow:流程驱动的递归技能演化用于智能体编排

arXiv cs.AI

SkillFlow 提出了一种基于流程驱动的递归技能演化框架,用于基于大语言模型的智能体编排,采用 Tempered Trajectory Balance 来防止策略崩溃并提供透明的信用分配。在 14 个数据集上的实验表明,在问答、数学、代码和决策制定任务中,该框架显著优于基线方法。

SkillFlow:自主智能体终身技能发现与演化基准测试

Hugging Face Daily Papers

SkillFlow 推出了一个涵盖20个任务家族共166项任务的基准测试,用于评估自主智能体在终身学习协议下,随时间推移发现、修复并维护技能的能力。实验揭示了主流模型之间存在显著的能力差距:Claude Opus 4.6 通过技能演化获得了显著提升,而其他模型的收益有限甚至为负。

EvoMAS:学习多智能体系统的执行时工作流

arXiv cs.AI

EvoMAS 是一个框架,通过将工作流构建形式化为顺序决策问题,来学习多智能体系统中的执行时工作流。它通过根据不断变化的任务状态动态调整智能体协作,在复杂任务上优于静态多智能体设计方法。

EvoMaster:构建可进化大规模自主科学智能体的基础框架

Hugging Face Daily Papers

# 论文页面 - EvoMaster:构建可进化大规模自主科学智能体的基础框架 来源:[https://huggingface.co/papers/2604.17406](https://huggingface.co/papers/2604.17406) 作者:,,,,,,,,,,,,,,,,,,,,, ## 摘要 EvoMaster 是一个可扩展、自我进化的智能体框架,专为大规模科学发现设计,支持在实验周期中迭代优化假设并持续积累知识。大语言模型与智能体的融合正在催生“智能体科学”新时代。