Evo-Bench:语言模型能否改进智能体工具框架?

Hugging Face Daily Papers 论文

摘要

介绍 Evo-Bench,这是首个用于评估语言模型在搜索、办公和通用智能体领域中内在工具框架进化能力的基准,表明顶级模型取得了显著进步,但在办公工作流上仍面临挑战。

大型语言模型(LLMs)推动了自主智能体的快速发展,但标准评估仍局限于静态任务求解。一个新兴的前沿方向是工具框架进化(harness evolution)——即智能体自主优化其自身操作框架的能力。然而,系统性地评估这一能力仍然具有挑战性,因为现有评估未能将框架改进与基础模型能力分离开来,无法防止针对特定任务的过拟合,也难以捕捉长时程的迭代研究过程。为了解决这些挑战,我们引入了 Evo-Bench,这是首个旨在评估模型在搜索、办公和通用智能体领域中内在工具框架进化能力的基准。为了严格分离这一能力,Evo-Bench 采用了一种新颖的框架引导构建框架:它利用辅助任务进化来识别真正对框架改进敏感的任务,随后通过敏感性感知的分层划分来确保跨套件的稳健泛化。对九个前沿和开放权重模型的广泛评估表明,顶级模型取得了高达 16.6 个百分点的绝对提升,接近最先进的人工设计基线。关键的是,尽管自主进化在通用任务上优于人工框架,并在搜索任务上表现出色,但在需要高度特定处理流程的办公任务上却表现挣扎。此外,我们的分析揭示了诸如早期饱和等关键的时间异常,同时证明合成的框架可作为一种高度可迁移的推理结构,持续提升多种策略模型。
查看原文
查看缓存全文

缓存时间: 2026/08/11 06:20

论文页面 - Evo-Bench: 语言模型能否改进智能体工具框架?

来源:https://huggingface.co/papers/2608.09096

摘要

大型语言模型(LLMs)推动了自主智能体的快速发展,但标准评估仍局限于静态任务求解。一个新兴的前沿方向是工具框架进化(harness evolution)——即智能体自主优化其自身运行工具框架的能力。然而,系统性地基准测试这一能力仍具挑战性,因为现有评估无法将工具框架改进与基础模型能力分离、无法防止任务特定过拟合,也无法捕捉长时程迭代式研究。为应对这些挑战,我们引入了 Evo-Bench,这是首个旨在评估模型在搜索(Search)、办公(Office)和通用(General)智能体领域中内在工具框架进化能力的基准。为严格分离该能力,Evo-Bench 采用了一种新颖的、由工具框架引导的构建框架:它利用辅助任务进化来识别对框架改进真正敏感的任务,随后通过敏感性感知的分层划分来确保跨套件的稳健泛化。对九个前沿及开放权重模型的广泛评估显示,顶级模型取得了高达 16.6 分的绝对增益,接近最先进的人工工程基线。关键在于,尽管自主进化在通用任务中优于人工工具框架,并在搜索任务中表现出色,但在需要高度特定处理流程的办公任务中却表现挣扎。此外,我们的分析揭示了如早期饱和等关键时间异常,同时证明合成出的工具框架可作为高度可迁移的推理结构,持续提升多样化的策略模型。

查看 arXiv 页面 (https://arxiv.org/abs/2608.09096)查看 PDF (https://arxiv.org/pdf/2608.09096)项目页面 (https://evobench.org/)GitHub1 (https://github.com/RUCAIBox/Evo-Bench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.09096)

在你的智能体中获取这篇论文:

hf papers read 2608\.09096

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.09096 以从此页面关联它。

引用此论文的数据集1

RUC-AIBOX/Evo-Bench 查看器• 大约 3 小时前更新 • 608 • 40 (https://huggingface.co/datasets/RUC-AIBOX/Evo-Bench)

引用此论文的 Spaces0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.09096 以从此页面关联它。

包含此论文的收藏集1

相似文章

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

EVA-Bench:评估语音代理的新型端到端框架

Hugging Face Daily Papers

EVA-Bench 提出了一个全面的端到端评估框架,用于评估语音代理,模拟真实的多轮对话,并通过新颖的准确度(EVA-A)和体验(EVA-X)指标衡量语音特定故障模式下的性能。该基准包含企业领域的 213 个场景以及用于口音和噪声鲁棒性的扰动套件,揭示了当前系统的显著差距。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。