LongWoF-Bench:评估用于可验证长工作流任务的EvoMap Genes

Hugging Face Daily Papers 论文

摘要

本文介绍了LongWoF-Bench,一个用于评估长工作流任务的基准,并证明EvoMap Gene通过重用经过验证的执行经验,提高了任务完成效率并降低了令牌成本。

大型语言模型越来越需要执行复杂的工作流,其成功取决于维护相互依赖的约束并生成满足严格端到端验证的工件。然而,成功的执行经验通常在一次运行后丢失,迫使后续模型从头重新发现策略和失败模式。我们研究这种经验是否可以通过EvoMap进行外部化和重用,其中验证者确认的执行轨迹被整合到结构化的Gene中。为了评估这一设置,我们引入了长工作流基准(LongWoF-Bench),包含778个可机器验证的任务,涵盖代码生成、代理环境合成、数学推理和规则遵循。在252个具有验证者确认的Opus轨迹的任务中,进化后的EvoMap Gene在所有七个评估模型上比Skill高出8.7-15.5个百分点,收益扩展到来自不同模型系列的消费模型。相比之下,参考蒸馏的Gene没有表现出相同的优势,这表明仅紧凑表示是不够的,并且Gene效用与经过验证的经验来源密切相关。对于Claude Opus,Gene重用还比Skill多完成39个任务,同时将求解时间令牌消耗减少了9.9%。总之,这些结果表明,经过验证的执行经验可以作为可重用的外部资源被保留和共享,使模型能够提高长工作流的完成度,而无需反复支付经验发现的全部成本。
查看原文
查看缓存全文

缓存时间: 2026/08/25 12:35

论文页面 - LongWoF-Bench:评估用于可验证长流程任务的EvoMap基因

来源:https://huggingface.co/papers/2608.23200

摘要

EvoMap将经过验证的执行经验外化为可复用的结构化基因,从而提升长流程任务完成率,并降低跨多种模型的令牌成本。

大型语言模型日益被期望执行复杂的工作流程,这些流程的成功取决于维持相互依赖的约束条件,并产出满足严格端到端验证的成果。然而,成功的执行经验通常在单次运行后即丢失,迫使后续模型从零开始重新探索策略和失败模式。我们研究了这种经验能否通过EvoMap (https://huggingface.co/papers?q=EvoMap) 进行外化和复用。在此框架下,由验证器确认的执行轨迹 (https://huggingface.co/papers?q=verifier-confirmed%20execution%20trajectories) 被整合为结构化的基因 (https://huggingface.co/papers?q=Gene)。为评估此场景,我们推出了长流程基准测试 (LongWoF-Bench (https://huggingface.co/papers?q=LongWoF-Bench)),包含778个可机器验证的任务,涵盖代码生成 (https://huggingface.co/papers?q=gene)、智能体环境合成、数学推理和规则遵循。

在包含252个具有验证器确认的Opus轨迹的任务上,经过演化的EvoMap (https://huggingface.co/papers?q=EvoMap) 基因 (https://huggingface.co/papers?q=Gene) 在所有七个评估模型上的表现均优于技能 (https://huggingface.co/papers?q=Skill),优势达8.7至15.5个百分点,且这种提升也适用于来自不同模型系列的消费级模型。相比之下,参考蒸馏基因 (https://huggingface.co/papers?q=reference-distilled%20Gene) 并未展现出相同的优势,这表明仅仅紧凑的表示是不够的,基因 (https://huggingface.co/papers?q=Gene) 的效用与经过验证的经验来源 (https://huggingface.co/papers?q=verified%20experience%20provenance) 密切相关。对于Claude Opus,基因 (https://huggingface.co/papers?q=Gene) 复用也比技能 (https://huggingface.co/papers?q=Skill) 多完成了39个任务,同时将解决时间的令牌消耗降低了9.9%。综上,这些结果表明,经过验证的执行经验可以作为一种可复用的外部资源被保留和共享,使模型无需反复支付经验探索的全部成本即可提升长流程任务的完成率。

查看arXiv页面 (https://arxiv.org/abs/2608.23200)查看PDF (https://arxiv.org/pdf/2608.23200)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.23200)

在您的智能体中获取此论文:

hf papers read 2608\.23200

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

没有模型链接此论文。

在模型的README.md中引用arxiv.org/abs/2608.23200,以从本页链接它。

引用本文的数据集1

EvoMapAI/LongWoF-Bench 查看器• 更新于38分钟前 • 1.74k • 69 (https://huggingface.co/datasets/EvoMapAI/LongWoF-Bench)

引用本文的空间0

没有空间链接此论文。

在空间的README.md中引用arxiv.org/abs/2608.23200,以从本页链接它。

包含本文的收藏0

没有收藏包含此论文。

将本文添加到收藏 (https://huggingface.co/new-collection)以从本页链接它。

相似文章

ContextWeave:一个真实世界的工作流基准

arXiv cs.AI

ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。

EvoMAS:学习多智能体系统的执行时工作流

arXiv cs.AI

EvoMAS 是一个框架,通过将工作流构建形式化为顺序决策问题,来学习多智能体系统中的执行时工作流。它通过根据不断变化的任务状态动态调整智能体协作,在复杂任务上优于静态多智能体设计方法。