EVOHARNESSBENCH: 你的代理能否跟上不断演进的框架?

Hugging Face Daily Papers 论文

摘要

本文介绍了EVOHARNESSBENCH,一个用于评估在工具、技能和代理框架不断演进下的LLM代理的基准测试,揭示了在保持和适应方面的差距。

现代基于LLM的代理通过工具、可重用技能和专家代理的框架运作,这决定了他们观察到的内容和能做的事情。在实践中,随着新能力的加入,这个框架不断演进。我们介绍了EVOHARNESSBENCH,一个用于在受控框架演进下评估代理的基准测试,涵盖三个轴(工具、技能和代理)。与现有的代理持续学习基准测试不同,后者通常将非平稳性(即随时间变化的内容)置于任务流中,同时保持框架固定,而EVOHARNESSBENCH将非平稳性置于外部提供的框架本身。它包含17个从基于验证器的基准测试确定性构建的多阶段框架流,包括802个任务、520个工具、42个技能和62个代理。我们评估了两个互补的设置,对应于框架演进的核心挑战:部署评估,它隔离了随着框架扩展对先前可访问能力的保持;以及自演化适应评估,它测试随着新能力引入,积累的经验是否仍然有用。我们的结果揭示了三个持续存在的差距。首先,仅框架扩展就可能降低先前已解决任务的性能,导致框架诱导的遗忘。其次,自演化适应带来的增益在框架演进的不同阶段、能力轴和环境中仍不一致。第三,保持和适应可能朝着不同的方向发展:保留早期能力不一定能改善对新引入能力的适应,反之亦然。这些结果确立了框架演进作为构建能够跟上演进框架同时保持先前有效行为代理的独特挑战。
查看原文
查看缓存全文

缓存时间: 2026/09/10 02:15

论文页面 - EVOHARNESSBENCH:您的智能体能否跟上演进中的工具框架?

来源:https://huggingface.co/papers/2609.04280 作者:

,

,

,

,

,

,

,

,

,

,

摘要

本研究引入了一个基准测试,用于评估在演进的工具、技能和智能体框架下的LLM智能体,揭示了它们在记忆保持、适应性以及工具框架诱发遗忘方面持续存在的差距。

现代基于LLM的智能体 (https://huggingface.co/papers?q=LLM-based%20agents) 通过一个包含工具、可重用技能和专家智能体的框架运行,该框架决定了智能体的观察范围和能力。在实践中,随着新能力的加入,这个框架不断演进。我们引入了EVOHARNESSBENCH (https://huggingface.co/papers?q=EVOHARNESSBENCH),这是一个用于评估智能体在受控的工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 下的基准测试,评估涵盖三个轴(工具、技能和智能体)。与现有的智能体持续学习基准不同,后者通常将非平稳性(即随时间变化的内容)置于任务流中,同时保持框架固定,而EVOHARNESSBENCH (https://huggingface.co/papers?q=EVOHARNESSBENCH) 将非平稳性 (https://huggingface.co/papers?q=non-stationarity) 置于外部提供的框架本身。它包含17个确定性构建的多阶段框架流,源自基于验证器的基准测试,包含802个任务、520个工具、42项技能和62个智能体。我们评估了两种互补的设置,对应于工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 的核心挑战:部署评估 (https://huggingface.co/papers?q=deployment%20evaluation),它隔离了框架扩展时对先前可访问能力的记忆保持;以及自演进适应 (https://huggingface.co/papers?q=self-evolving%20adaptation) 评估,它测试了在新能力引入时,积累的经验是否仍然有用。我们的结果揭示了三个持续存在的差距。首先,仅框架的扩展就可能导致对先前已解决任务性能的下降,产生工具框架诱发的遗忘 (https://huggingface.co/papers?q=harness-induced%20forgetting)。其次,自演进适应 (https://huggingface.co/papers?q=self-evolving%20adaptation) 带来的收益在工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 的不同阶段、能力轴和环境中表现不一致。第三,记忆保持和适应性可能相互矛盾:保留早期的能力并不一定能提高对新引入能力的适应能力,反之亦然。这些结果确立了工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 作为构建能够跟上演进中的工具框架并保留先前有效行为的智能体的一个独特挑战。

查看arXiv页面 (https://arxiv.org/abs/2609.04280) 查看PDF (https://arxiv.org/pdf/2609.04280) 项目页面 (https://mas-orchestra.salesforceresearch.ai/evoharness/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04280)

在您的智能体中获取此论文:

hf papers read 2609.04280

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.04280 以从此页面链接它。

引用此论文的数据集0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.04280 以从此页面链接它。

引用此论文的Space0

无Space链接此论文

在Space的README.md中引用 arxiv.org/abs/2609.04280 以从此页面链接它。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

Evo-Bench:语言模型能否改进智能体工具框架?

Hugging Face Daily Papers

介绍 Evo-Bench,这是首个用于评估语言模型在搜索、办公和通用智能体领域中内在工具框架进化能力的基准,表明顶级模型取得了显著进步,但在办公工作流上仍面临挑战。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。