LongWoF-Bench:评估用于可验证长工作流任务的EvoMap Genes
摘要
本文介绍了LongWoF-Bench,一个用于评估长工作流任务的基准,并证明EvoMap Gene通过重用经过验证的执行经验,提高了任务完成效率并降低了令牌成本。
查看缓存全文
缓存时间: 2026/08/25 12:35
论文页面 - LongWoF-Bench:评估用于可验证长流程任务的EvoMap基因
来源:https://huggingface.co/papers/2608.23200
摘要
EvoMap将经过验证的执行经验外化为可复用的结构化基因,从而提升长流程任务完成率,并降低跨多种模型的令牌成本。
大型语言模型日益被期望执行复杂的工作流程,这些流程的成功取决于维持相互依赖的约束条件,并产出满足严格端到端验证的成果。然而,成功的执行经验通常在单次运行后即丢失,迫使后续模型从零开始重新探索策略和失败模式。我们研究了这种经验能否通过EvoMap (https://huggingface.co/papers?q=EvoMap) 进行外化和复用。在此框架下,由验证器确认的执行轨迹 (https://huggingface.co/papers?q=verifier-confirmed%20execution%20trajectories) 被整合为结构化的基因 (https://huggingface.co/papers?q=Gene)。为评估此场景,我们推出了长流程基准测试 (LongWoF-Bench (https://huggingface.co/papers?q=LongWoF-Bench)),包含778个可机器验证的任务,涵盖代码生成 (https://huggingface.co/papers?q=gene)、智能体环境合成、数学推理和规则遵循。
在包含252个具有验证器确认的Opus轨迹的任务上,经过演化的EvoMap (https://huggingface.co/papers?q=EvoMap) 基因 (https://huggingface.co/papers?q=Gene) 在所有七个评估模型上的表现均优于技能 (https://huggingface.co/papers?q=Skill),优势达8.7至15.5个百分点,且这种提升也适用于来自不同模型系列的消费级模型。相比之下,参考蒸馏基因 (https://huggingface.co/papers?q=reference-distilled%20Gene) 并未展现出相同的优势,这表明仅仅紧凑的表示是不够的,基因 (https://huggingface.co/papers?q=Gene) 的效用与经过验证的经验来源 (https://huggingface.co/papers?q=verified%20experience%20provenance) 密切相关。对于Claude Opus,基因 (https://huggingface.co/papers?q=Gene) 复用也比技能 (https://huggingface.co/papers?q=Skill) 多完成了39个任务,同时将解决时间的令牌消耗降低了9.9%。综上,这些结果表明,经过验证的执行经验可以作为一种可复用的外部资源被保留和共享,使模型无需反复支付经验探索的全部成本即可提升长流程任务的完成率。
查看arXiv页面 (https://arxiv.org/abs/2608.23200)查看PDF (https://arxiv.org/pdf/2608.23200)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.23200)
在您的智能体中获取此论文:
hf papers read 2608\.23200
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
没有模型链接此论文。
在模型的README.md中引用arxiv.org/abs/2608.23200,以从本页链接它。
引用本文的数据集1
EvoMapAI/LongWoF-Bench 查看器• 更新于38分钟前 • 1.74k • 69 (https://huggingface.co/datasets/EvoMapAI/LongWoF-Bench)
引用本文的空间0
没有空间链接此论文。
在空间的README.md中引用arxiv.org/abs/2608.23200,以从本页链接它。
包含本文的收藏0
没有收藏包含此论文。
将本文添加到收藏 (https://huggingface.co/new-collection)以从本页链接它。
相似文章
ContextWeave:一个真实世界的工作流基准
ContextWeave 是一个新的纵向基准,用于评估在现实办公工作流中,回忆的记忆是否能够提升下游智能体的性能。它利用 14 名参与者经过隐私保护的多月工作流,创建了 1,005 个可执行任务。
FlowEvo:通过工作流与可执行技能的协同演化实现自演化智能体
FlowEvo是一个免训练框架,使得大语言模型智能体能够在推理时协同演化可复用技能和工作流,在ALFWorld、HumanEval和GSM8K等基准测试中实现了最先进的准确性和效率。
Workflow-GYM:面向真实世界专业领域中计算机使用代理任务的长期评估
Workflow-GYM 是一个用于评估 AI 代理在专业领域中长期 GUI 任务的基准。实验表明,即使是最先进的模型也仅能达到约 30% 的成功率,揭示了重大挑战。
LongWebBench:评估长时域设置下的结构性和功能性网页生成
LongWebBench是一个基准测试,用于从结构和功能两个角度评估长时域网页生成,采用基于VLM的指标和DOM增强的基于代理的流程。实验表明,当前的VLM在长程连贯性和可执行交互方面存在困难。
EvoMAS:学习多智能体系统的执行时工作流
EvoMAS 是一个框架,通过将工作流构建形式化为顺序决策问题,来学习多智能体系统中的执行时工作流。它通过根据不断变化的任务状态动态调整智能体协作,在复杂任务上优于静态多智能体设计方法。