有人有兴趣构建一个纯 harness 基准测试吗?
摘要
一项关于创建社区驱动的基准测试的提议,专门用于评估 LLM harness,并设有一个排行榜,衡量 harness 在多样化真实世界任务上的表现。
现有许多 LLM 基准测试,但几乎没有针对 harness 的基准测试。我认为构建这样一个基准测试将是一个非常棒的社区项目。最终目标:在多样化真实世界任务[1]上,按底层模型和推理努力程度分组,建立一个 harness 性能(多维度)排行榜。任何人都可以贡献结果。任务标准、测量指标、底层框架等应由一个小组而非个人决定。如果有足够兴趣,我将创建一个 Discord。声明:我是一个名为 Dirac 的编码代理(https://github.com/dirac-run/dirac)的维护者,因此我不会影响最终基准测试的样子,以避免任何利益冲突。我只是想促成这件事。[1] 多样化真实世界任务是指贡献者遇到的足够复杂的任务,最好来自开源仓库。
相似文章
我们需要一个工具基准排行榜
本文主张需要一个基准排行榜,用于比较AI模型工具(例如KimiCode、OpenCode和Codex),而不仅仅是模型本身,并提出了一个代码库,用于测试模型+工具组合的成本、运行时间、token使用量和得分。
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
迈向万能工具:设计直观、透明且精简的LLM控制框架
本文探讨了设计LLM控制框架的原则,旨在使其直观、透明且精简,借鉴Unix哲学以减少认知负荷并提高可靠性。
训练一个用于模型无关和任务环境无关的能力改进的harness,基于类似PyTorch的框架 [P]
介绍了一个训练框架,以模型无关和任务环境无关的方式提升任务型LLM的能力,并在Terminal Bench和SWE-Bench上展示了结果。
停止在不公开执行框架的情况下比较LLM智能体
这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。