EVOHARNESSBENCH: 你的代理能否跟上不断演进的框架?
摘要
本文介绍了EVOHARNESSBENCH,一个用于评估在工具、技能和代理框架不断演进下的LLM代理的基准测试,揭示了在保持和适应方面的差距。
查看缓存全文
缓存时间: 2026/09/10 02:15
论文页面 - EVOHARNESSBENCH:您的智能体能否跟上演进中的工具框架?
来源:https://huggingface.co/papers/2609.04280 作者:
,
,
,
,
,
,
,
,
,
,
摘要
本研究引入了一个基准测试,用于评估在演进的工具、技能和智能体框架下的LLM智能体,揭示了它们在记忆保持、适应性以及工具框架诱发遗忘方面持续存在的差距。
现代基于LLM的智能体 (https://huggingface.co/papers?q=LLM-based%20agents) 通过一个包含工具、可重用技能和专家智能体的框架运行,该框架决定了智能体的观察范围和能力。在实践中,随着新能力的加入,这个框架不断演进。我们引入了EVOHARNESSBENCH (https://huggingface.co/papers?q=EVOHARNESSBENCH),这是一个用于评估智能体在受控的工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 下的基准测试,评估涵盖三个轴(工具、技能和智能体)。与现有的智能体持续学习基准不同,后者通常将非平稳性(即随时间变化的内容)置于任务流中,同时保持框架固定,而EVOHARNESSBENCH (https://huggingface.co/papers?q=EVOHARNESSBENCH) 将非平稳性 (https://huggingface.co/papers?q=non-stationarity) 置于外部提供的框架本身。它包含17个确定性构建的多阶段框架流,源自基于验证器的基准测试,包含802个任务、520个工具、42项技能和62个智能体。我们评估了两种互补的设置,对应于工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 的核心挑战:部署评估 (https://huggingface.co/papers?q=deployment%20evaluation),它隔离了框架扩展时对先前可访问能力的记忆保持;以及自演进适应 (https://huggingface.co/papers?q=self-evolving%20adaptation) 评估,它测试了在新能力引入时,积累的经验是否仍然有用。我们的结果揭示了三个持续存在的差距。首先,仅框架的扩展就可能导致对先前已解决任务性能的下降,产生工具框架诱发的遗忘 (https://huggingface.co/papers?q=harness-induced%20forgetting)。其次,自演进适应 (https://huggingface.co/papers?q=self-evolving%20adaptation) 带来的收益在工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 的不同阶段、能力轴和环境中表现不一致。第三,记忆保持和适应性可能相互矛盾:保留早期的能力并不一定能提高对新引入能力的适应能力,反之亦然。这些结果确立了工具框架演进 (https://huggingface.co/papers?q=harness%20evolution) 作为构建能够跟上演进中的工具框架并保留先前有效行为的智能体的一个独特挑战。
查看arXiv页面 (https://arxiv.org/abs/2609.04280) 查看PDF (https://arxiv.org/pdf/2609.04280) 项目页面 (https://mas-orchestra.salesforceresearch.ai/evoharness/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04280)
在您的智能体中获取此论文:
hf papers read 2609.04280
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.04280 以从此页面链接它。
引用此论文的数据集0
无数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.04280 以从此页面链接它。
引用此论文的Space0
无Space链接此论文
在Space的README.md中引用 arxiv.org/abs/2609.04280 以从此页面链接它。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
Evo-Bench:语言模型能否改进智能体工具框架?
介绍 Evo-Bench,这是首个用于评估语言模型在搜索、办公和通用智能体领域中内在工具框架进化能力的基准,表明顶级模型取得了显著进步,但在办公工作流上仍面临挑战。
HarnessDev:LLMs能否创建并演化其自身的代理执行框架?
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。
EvoSafeHarness:为保护智能体而演化的模型与领域专用安全框架
EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。