借助工作流进化更好的工作流

Hugging Face Daily Papers 论文

摘要

FloWright 提出了一种分层、结构感知的奖励范式,使多智能体工作流中的 LLM 智能体无需额外模型或标注数据即可实现自我进化与协同进化;而 DataWright 则通过自适应数据增强,将现有数据集转化为工作流级别的任务。采用 FloWright 训练的小型开源模型性能最高提升 +7.41%,其中多角色协同进化(+5.03%)优于仅优化单一角色(+2.83%)。

应对复杂的现实任务可能超出单个大语言模型(LLM)的能力,因此需要借助多智能体工作流,让多个专长不同的智能体协同完成这些任务。近期的方法通过执行结果来训练 LLM 构建更好的工作流,但它们仅优化工作流生成器,而构建和执行工作流的其他智能体保持不变——尽管每一个结果都取决于所有智能体的表现。然而,将训练扩展到生成器之外颇具挑战:各智能体之间相互耦合,且工作流的结果只是一个单一的稀疏分数,无法判断究竟是哪个智能体导致了失败。我们提出 FloWright,借助工作流本身作为基准来优化工作流。通过引入分层、结构感知的奖励范式,FloWright 使单个角色能够自我进化,并使两个及以上角色实现协同进化,且无需额外的模型、标注或执行。考虑到工作流的训练与评估通常采用单一智能体即可处理的数据,我们进一步提出 DataWright——一种自适应数据增强方法,将现有数据集转化为难度更高的工作流级任务。在文档、演示文稿、图表、代码、数学和金融任务上,采用 FloWright 训练的小型开源模型性能最高提升 +7.41%,其中多角色协同进化(+5.03%)带来的收益超过仅优化其中一个角色(+2.83%)。项目主页:https://xhguo7.github.io/FloWright/。
查看原文
查看缓存全文

缓存时间: 2026/10/02 04:28

论文页面 - 需要工作流,才能进化出更好的工作流

Source: https://huggingface.co/papers/2610.01026

摘要

应对复杂的现实世界任务可能超出单个大语言模型(LLM)的能力,因此促使人们采用多智能体工作流,让多个专职智能体协同完成这些任务。近期的方法训练 LLM 根据执行结果构建更好的工作流,但它们只优化工作流生成器,而构建或执行每个工作流的其他智能体则保持固定——尽管每一个执行结果都取决于所有这些智能体。然而,将训练扩展到生成器之外是困难的:智能体之间相互耦合,而一个工作流的结果只是一个稀疏的单一分数,无法判断究竟是哪个智能体导致了失败。我们提出 FloWright,它以工作流本身作为载体来优化工作流。通过引入层级化、感知结构的奖励范式,FloWright 使一个角色可以自我进化,两个或更多角色可以协同进化,且无需额外的模型、标签或执行。考虑到工作流通常在单一智能体已能处理的数据上进行训练和评估这一局限,我们进一步提出 DataWright——一种自适应的数据强化方法,可将现有数据集转换为难度递增的工作流级任务。在文档、幻灯片、图表、代码、数学和金融任务上,经 FloWright 训练的小型开放模型取得了最高 +7.41% 的性能提升,其中协同进化更多角色(+5.03%)比仅优化其中单个角色(+2.83%)带来更大的收益。我们的项目主页:https://xhguo7.github.io/FloWright/。

查看 arXiv 页面 (https://arxiv.org/abs/2610.01026)查看 PDF (https://arxiv.org/pdf/2610.01026)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2610.01026)

引用本论文的模型 0

没有模型关联本论文

在模型的 README.md 中引用 arxiv.org/abs/2610.01026,即可将该模型与本页面关联。

引用本论文的数据集 0

没有数据集关联本论文

在数据集的 README.md 中引用 arxiv.org/abs/2610.01026,即可将该数据集与本页面关联。

引用本论文的 Space 0

没有 Space 关联本论文

在 Space 的 README.md 中引用 arxiv.org/abs/2610.01026,即可将该 Space 与本页面关联。

包含本论文的合集 0

没有合集包含本论文

将本论文加入合集 (https://huggingface.co/new-collection) 即可将其与本页面关联。

相似文章

CoEvolve:通过智能体-数据互进化训练LLM智能体

arXiv cs.CL

CoEvolve提出了一个智能体-数据互进化框架,通过闭环、交互驱动的学习来训练LLM智能体,同时适配智能体和其训练数据分布。该方法从轨迹回滚中提取反馈信号以指导基于LLM的任务合成,在AppWorld和BFCL基准上的多个Qwen模型中展示了显著的改进(绝对收益15-19%)。