HarnessOpt-Bench:评估LLM在Harness优化中的表现
摘要
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
查看缓存全文
缓存时间: 2026/08/07 05:56
论文页面 - HarnessOpt-Bench:评估LLM在Harness优化中的表现
来源:https://huggingface.co/papers/2608.06301
摘要
随着LLM越来越多地部署在智能体系统中,其能力不仅取决于模型权重,还取决于harness:即围绕它们的提示词、工具、控制流、记忆和编排代码。这使得自动化harness优化——由AI系统对harness进行迭代且基于评估的改进——既是提升AI系统的重要途径,也是对AI系统自身的一项高要求能力。然而,社区目前缺乏一种通用协议来衡量前沿LLM在此任务上的表现。我们推出了HarnessOpt-Bench,这是一个在昂贵且随机的评估条件下进行端到端harness优化的基准。优化器(一个LLM与一个编码harness配对使用)接收目标智能体的种子harness、带评分的评估反馈以及固定的目标评估预算。它编辑harness并提名一个最终候选版本,该版本根据其在测试分区上相对于种子版本的归一化增益进行评分,而该测试分区在整个搜索过程中保持不可访问。一个可信执行环境强制执行评估边界、计量目标智能体的资源使用情况,并保留候选版本以供审计。我们在4个下游任务上、通过111次有评分的运行,评估了5个前沿LLM作为优化器分别在共享编码harness和其原生harness下的表现。实验结果表明,优化器模型之间的差异大于它们所依托的编码harness之间的差异,原生harness并非始终更优,且收益在不同任务和种子模式下差异显著。这些结果确立了harness优化是一项可测量且具有区分度的能力,并且仍有很大的提升空间。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06301) 查看 PDF (https://arxiv.org/pdf/2608.06301) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06301)
在您的智能体中获取此论文:
hf papers read 2608\.06301
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该数据集。
引用此论文的Space 0
没有Space链接此论文
在Space README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
AI能否让其他AI变得更优秀?我们测试了5个前沿LLM在重写其他代理框架的能力,评分基于它们从未见过的测试集(HarnessOpt-Bench,arXiv + MIT代码)
文章介绍了HarnessOpt-Bench,一个评估LLM改进其他AI代理框架能力的基准测试,并基于5个前沿模型的研究结果,指出模型选择对性能的影响大于框架选择。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
超越提示:衡量与优化大语言模型工具代理框架
本文研究代理框架优化,以改进大语言模型工具代理而无需重新训练,重点关注提示和工具边界中间件,并引入了一个协议和PRISM优化器以实现可测量的增益。
HarnessDev:LLMs能否创建并演化其自身的代理执行框架?
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。
Harness优化价值何在?自演化LLM代理中的局部增益与预算分配陷阱
本文介绍HarnessEvo,将LLM代理框架分解为可独立演化的槽位,揭示优化价值局部存在于反思/控制等特定组件中,均匀预算分配次优,并主张针对性的预算集中。