借助工作流进化更好的工作流
摘要
FloWright 提出了一种分层、结构感知的奖励范式,使多智能体工作流中的 LLM 智能体无需额外模型或标注数据即可实现自我进化与协同进化;而 DataWright 则通过自适应数据增强,将现有数据集转化为工作流级别的任务。采用 FloWright 训练的小型开源模型性能最高提升 +7.41%,其中多角色协同进化(+5.03%)优于仅优化单一角色(+2.83%)。
查看缓存全文
缓存时间: 2026/10/02 04:28
论文页面 - 需要工作流,才能进化出更好的工作流
Source: https://huggingface.co/papers/2610.01026
摘要
应对复杂的现实世界任务可能超出单个大语言模型(LLM)的能力,因此促使人们采用多智能体工作流,让多个专职智能体协同完成这些任务。近期的方法训练 LLM 根据执行结果构建更好的工作流,但它们只优化工作流生成器,而构建或执行每个工作流的其他智能体则保持固定——尽管每一个执行结果都取决于所有这些智能体。然而,将训练扩展到生成器之外是困难的:智能体之间相互耦合,而一个工作流的结果只是一个稀疏的单一分数,无法判断究竟是哪个智能体导致了失败。我们提出 FloWright,它以工作流本身作为载体来优化工作流。通过引入层级化、感知结构的奖励范式,FloWright 使一个角色可以自我进化,两个或更多角色可以协同进化,且无需额外的模型、标签或执行。考虑到工作流通常在单一智能体已能处理的数据上进行训练和评估这一局限,我们进一步提出 DataWright——一种自适应的数据强化方法,可将现有数据集转换为难度递增的工作流级任务。在文档、幻灯片、图表、代码、数学和金融任务上,经 FloWright 训练的小型开放模型取得了最高 +7.41% 的性能提升,其中协同进化更多角色(+5.03%)比仅优化其中单个角色(+2.83%)带来更大的收益。我们的项目主页:https://xhguo7.github.io/FloWright/。
查看 arXiv 页面 (https://arxiv.org/abs/2610.01026)查看 PDF (https://arxiv.org/pdf/2610.01026)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2610.01026)
引用本论文的模型 0
没有模型关联本论文
在模型的 README.md 中引用 arxiv.org/abs/2610.01026,即可将该模型与本页面关联。
引用本论文的数据集 0
没有数据集关联本论文
在数据集的 README.md 中引用 arxiv.org/abs/2610.01026,即可将该数据集与本页面关联。
引用本论文的 Space 0
没有 Space 关联本论文
在 Space 的 README.md 中引用 arxiv.org/abs/2610.01026,即可将该 Space 与本页面关联。
包含本论文的合集 0
没有合集包含本论文
将本论文加入合集 (https://huggingface.co/new-collection) 即可将其与本页面关联。
相似文章
FlowEvo:通过工作流与可执行技能的协同演化实现自演化智能体
FlowEvo是一个免训练框架,使得大语言模型智能体能够在推理时协同演化可复用技能和工作流,在ALFWorld、HumanEval和GSM8K等基准测试中实现了最先进的准确性和效率。
CoEvolve:通过智能体-数据互进化训练LLM智能体
CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。
奖励驱动的大语言模型代理工作流:融合POMDP路由与自我修正的自主决策
本文提出了一种奖励驱动的大语言模型代理工作流,融合了POMDP路由与自我修正奖励模型,在ALFWorld和WebShop等基准测试中任务成功率提升了24.5%。
多智能体RL何时能提升LLM工作流?工作流、规模与策略共享的权衡
本文研究了端到端强化学习训练何时能改善多智能体LLM工作流,比较了不同工作流、任务和模型规模下的共享策略与隔离策略训练,揭示了条件性权衡。
@rohanpaul_ai: 更好的自我改进智能体需要更好的求解器,而非更大的更新编写模型。这挑战了常见的习惯……
本文厘清了自我改进的LLM智能体中进化器与智能体的角色,表明一个小型进化器可以编写足够好的更新,而中端智能体最能从中受益。论文建议将最强的模型用作任务执行器,而非更新编写器。