展示 HN:FrontierHarness Eval – 9个测试框架,相同模型,每次通过成本差异最高达17倍
摘要
FrontierHarness Eval 对九个软件工程测试框架在单一模型上进行基准测试,表明根据所使用的测试框架,每个成功任务的成本差异最高可达17倍。
暂无内容
查看缓存全文
缓存时间: 2026/09/02 17:51
# 前沿评估平台
来源:https://frontierharness.org/
### 通过率
### 每个成功任务的中位数成本
### 每个任务的中位数成本
### 每个成功任务的中位数缓存命中率
### 每个成功任务的中位数耗时
## 数据之外的洞察
1. 01**OpenCode:未统计失败案例。** 仅涵盖15次成功通过。若计入失败尝试,成本将增至每次任务3.24美元。
2. 02**缓存命中率不等于成本。** 一个缓存的300轮失败任务可能比一次短暂的缓存未命中消耗更多资源。
3. 03**质量与成本可能背离。** Claude Code成功通过19项任务,但单次任务成本高达18.34美元。
## 在Runta上运行你的评估工具。
若您想在Runta测试自己的评估工具,我们将提供100美元初始额度支持。
获取100美元额度 (https://dashboard.runta.com/request-demo)开始免费试用 (https://dashboard.runta.com/)
## 受测评估工具
**Codex**
`v0.148.0`
**DeepSeek Harness**
`v0.1.0-rc.8`
**Claude Code**
`v2.1.237`
**Pi**
`v0.84.2`
**Oh My Pi**
`v17.4.0`
**Kimi Code**
`v0.37.2`
**Exo Harness**
`v0.1.0`
**OpenCode**
`v1.18.19`
**Hermes**
`v0.20.4`
- FrontierHarness v1.0聚焦于软件工程场景与终端任务,其结论未必适用于其他知识工作领域。
- 所有测试均在Runta智能体运行时环境中进行。所有评估工具及任务环境均预先配置为标准快照。每次运行均采用全新还原,确保vCPU、内存、磁盘容量、磁盘内容与内存状态完全一致。
相似文章
同一模型,不同运行框架:编码智能体的差异化表现
本研究探讨了在模型固定不变的情况下,改变编码智能体中的运行框架配置如何影响其在代码基准测试上的表现。研究结果表明,一种能自动缩短早期工具输出以管理上下文的“优化框架”,可提升任务完成率,尤其在上下文长度受限的场景下效果显著。
@LangChain: .@FactoryAI 首席技术官 @enoreyes 算了笔账。相同的代码审查任务,价格因评估框架不同而天差地别。Eno o…
LangChain 分享了 FactoryAI 首席技术官 Eno Reyes 的分析:相同的代码审查任务,根据所使用的评估框架,价格差异巨大。他认为,一个优秀的模型无关评估框架可以改进任何模型。
HarnessOpt-Bench:评估LLM在Harness优化中的表现
HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。
@rohit4verse: 两个月前,我写了《The Harness Is Everything》,获得130万观看。上周的Life-Harness论文:在126个模型环境中,有116个……
Life-Harness论文表明,仅通过修补评估框架而不修改模型,就能在126个设置中的116个提升性能,在18个骨干网络上实现88.5%的平均提升。
有人有兴趣构建一个纯 harness 基准测试吗?
一项关于创建社区驱动的基准测试的提议,专门用于评估 LLM harness,并设有一个排行榜,衡量 harness 在多样化真实世界任务上的表现。