HarnessOpt-Bench:评估LLM在Harness优化中的表现
摘要
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
查看缓存全文
缓存时间: 2026/08/07 05:56
论文页面 - HarnessOpt-Bench:评估LLM在Harness优化中的表现
来源:https://huggingface.co/papers/2608.06301
摘要
随着LLM越来越多地部署在智能体系统中,其能力不仅取决于模型权重,还取决于harness:即围绕它们的提示词、工具、控制流、记忆和编排代码。这使得自动化harness优化——由AI系统对harness进行迭代且基于评估的改进——既是提升AI系统的重要途径,也是对AI系统自身的一项高要求能力。然而,社区目前缺乏一种通用协议来衡量前沿LLM在此任务上的表现。我们推出了HarnessOpt-Bench,这是一个在昂贵且随机的评估条件下进行端到端harness优化的基准。优化器(一个LLM与一个编码harness配对使用)接收目标智能体的种子harness、带评分的评估反馈以及固定的目标评估预算。它编辑harness并提名一个最终候选版本,该版本根据其在测试分区上相对于种子版本的归一化增益进行评分,而该测试分区在整个搜索过程中保持不可访问。一个可信执行环境强制执行评估边界、计量目标智能体的资源使用情况,并保留候选版本以供审计。我们在4个下游任务上、通过111次有评分的运行,评估了5个前沿LLM作为优化器分别在共享编码harness和其原生harness下的表现。实验结果表明,优化器模型之间的差异大于它们所依托的编码harness之间的差异,原生harness并非始终更优,且收益在不同任务和种子模式下差异显著。这些结果确立了harness优化是一项可测量且具有区分度的能力,并且仍有很大的提升空间。
查看 arXiv 页面 (https://arxiv.org/abs/2608.06301) 查看 PDF (https://arxiv.org/pdf/2608.06301) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.06301)
在您的智能体中获取此论文:
hf papers read 2608\.06301
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该模型。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该数据集。
引用此论文的Space 0
没有Space链接此论文
在Space README.md 中引用 arxiv.org/abs/2608.06301 以从此页面链接该Space。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。
有人有兴趣构建一个纯 harness 基准测试吗?
一项关于创建社区驱动的基准测试的提议,专门用于评估 LLM harness,并设有一个排行榜,衡量 harness 在多样化真实世界任务上的表现。
不是能力问题:LLM智能体层级间的控制敏感度是非单调的
本文通过实证测试了“更结构化的控制(harness)能普遍提高LLM智能体可靠性”这一常见假设,发现不同模型层级间存在非单调关系。它引入了HEAT-24基准,并揭示了严格的控制可能会损害前沿聊天模型,但有利于推理模型。