有人有兴趣构建一个纯 harness 基准测试吗?

Reddit r/LocalLLaMA 新闻

摘要

一项关于创建社区驱动的基准测试的提议,专门用于评估 LLM harness,并设有一个排行榜,衡量 harness 在多样化真实世界任务上的表现。

现有许多 LLM 基准测试,但几乎没有针对 harness 的基准测试。我认为构建这样一个基准测试将是一个非常棒的社区项目。最终目标:在多样化真实世界任务[1]上,按底层模型和推理努力程度分组,建立一个 harness 性能(多维度)排行榜。任何人都可以贡献结果。任务标准、测量指标、底层框架等应由一个小组而非个人决定。如果有足够兴趣,我将创建一个 Discord。声明:我是一个名为 Dirac 的编码代理(https://github.com/dirac-run/dirac)的维护者,因此我不会影响最终基准测试的样子,以避免任何利益冲突。我只是想促成这件事。[1] 多样化真实世界任务是指贡献者遇到的足够复杂的任务,最好来自开源仓库。
查看原文

相似文章

我们需要一个工具基准排行榜

Reddit r/AI_Agents

本文主张需要一个基准排行榜,用于比较AI模型工具(例如KimiCode、OpenCode和Codex),而不仅仅是模型本身,并提出了一个代码库,用于测试模型+工具组合的成本、运行时间、token使用量和得分。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

停止在不公开执行框架的情况下比较LLM智能体

arXiv cs.AI

这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。