HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers 论文

摘要

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

随着LLM越来越多地部署在智能体系统中,它们的能力不仅取决于模型权重,还取决于harness:即围绕它们的提示、工具、控制流、记忆和编排代码。这使得自动化harness优化——由AI系统对harness进行迭代式、评估引导的改进——既是改进AI系统的重要途径,也是对AI系统本身的一项高要求能力。然而,社区缺乏一种通用协议来衡量前沿LLM在此任务上的表现。我们引入了HarnessOpt-Bench,这是一个在昂贵且随机的评估条件下进行端到端harness优化的基准测试。优化器(一个与编码harness配对的LLM)接收目标智能体的种子harness、评分评估反馈和固定的目标评估预算。它编辑harness并提名一个最终候选版本,该候选版本根据其在留出测试分区上相对于种子harness的归一化增益进行评分,而该测试分区在整个搜索过程中不可访问。可信执行环境强制执行评估边界,计量目标智能体的资源使用,并保留候选版本以供审计。我们在共享编码harness和各自原生harness两种条件下,对5个前沿LLM作为优化器进行了评估,涵盖4个下游任务,共111次评分运行。实验结果表明,优化器模型的差异大于它们所借助的编码harness的差异;原生harness并非始终更优;且增益在不同任务和种子设置下差异显著。这些结果确立了harness优化是一项可测量、可区分的能力,并且具有很大的改进空间。
查看原文
查看缓存全文

缓存时间: 2026/08/07 05:56

论文页面 - HarnessOpt-Bench:评估LLM在Harness优化中的表现

来源:https://huggingface.co/papers/2608.06301

摘要

随着LLM越来越多地部署在智能体系统中,其能力不仅取决于模型权重,还取决于harness:即围绕它们的提示词、工具、控制流、记忆和编排代码。这使得自动化harness优化——由AI系统对harness进行迭代且基于评估的改进——既是提升AI系统的重要途径,也是对AI系统自身的一项高要求能力。然而,社区目前缺乏一种通用协议来衡量前沿LLM在此任务上的表现。我们推出了HarnessOpt-Bench,这是一个在昂贵且随机的评估条件下进行端到端harness优化的基准。优化器(一个LLM与一个编码harness配对使用)接收目标智能体的种子harness、带评分的评估反馈以及固定的目标评估预算。它编辑harness并提名一个最终候选版本,该版本根据其在测试分区上相对于种子版本的归一化增益进行评分,而该测试分区在整个搜索过程中保持不可访问。一个可信执行环境强制执行评估边界、计量目标智能体的资源使用情况,并保留候选版本以供审计。我们在4个下游任务上、通过111次有评分的运行,评估了5个前沿LLM作为优化器分别在共享编码harness和其原生harness下的表现。实验结果表明,优化器模型之间的差异大于它们所依托的编码harness之间的差异,原生harness并非始终更优,且收益在不同任务和种子模式下差异显著。这些结果确立了harness优化是一项可测量且具有区分度的能力,并且仍有很大的提升空间。

查看 arXiv 页面 (https://arxiv.org/abs/2608.06301) 查看 PDF (https://arxiv.org/pdf/2608.06301) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06301)

在您的智能体中获取此论文:

hf papers read 2608\.06301

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该模型。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该数据集。

引用此论文的Space 0

没有Space链接此论文

在Space README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该Space。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

停止在不公开执行框架的情况下比较LLM智能体

arXiv cs.AI

这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。

不是能力问题:LLM智能体层级间的控制敏感度是非单调的

arXiv cs.AI

本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。