展示 HN:FrontierHarness Eval – 9个测试框架,相同模型,每次通过成本差异最高达17倍

Hacker News Top 工具

摘要

FrontierHarness Eval 对九个软件工程测试框架在单一模型上进行基准测试,表明根据所使用的测试框架,每个成功任务的成本差异最高可达17倍。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/02 17:51

# 前沿评估平台 来源:https://frontierharness.org/ ### 通过率 ### 每个成功任务的中位数成本 ### 每个任务的中位数成本 ### 每个成功任务的中位数缓存命中率 ### 每个成功任务的中位数耗时 ## 数据之外的洞察 1. 01**OpenCode:未统计失败案例。** 仅涵盖15次成功通过。若计入失败尝试,成本将增至每次任务3.24美元。 2. 02**缓存命中率不等于成本。** 一个缓存的300轮失败任务可能比一次短暂的缓存未命中消耗更多资源。 3. 03**质量与成本可能背离。** Claude Code成功通过19项任务,但单次任务成本高达18.34美元。 ## 在Runta上运行你的评估工具。 若您想在Runta测试自己的评估工具,我们将提供100美元初始额度支持。 获取100美元额度 (https://dashboard.runta.com/request-demo)开始免费试用 (https://dashboard.runta.com/) ## 受测评估工具 **Codex** `v0.148.0` **DeepSeek Harness** `v0.1.0-rc.8` **Claude Code** `v2.1.237` **Pi** `v0.84.2` **Oh My Pi** `v17.4.0` **Kimi Code** `v0.37.2` **Exo Harness** `v0.1.0` **OpenCode** `v1.18.19` **Hermes** `v0.20.4` - FrontierHarness v1.0聚焦于软件工程场景与终端任务,其结论未必适用于其他知识工作领域。 - 所有测试均在Runta智能体运行时环境中进行。所有评估工具及任务环境均预先配置为标准快照。每次运行均采用全新还原,确保vCPU、内存、磁盘容量、磁盘内容与内存状态完全一致。

相似文章

同一模型,不同运行框架:编码智能体的差异化表现

arXiv cs.AI

本研究探讨了在模型固定不变的情况下,改变编码智能体中的运行框架配置如何影响其在代码基准测试上的表现。研究结果表明,一种能自动缩短早期工具输出以管理上下文的“优化框架”,可提升任务完成率,尤其在上下文长度受限的场景下效果显著。

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。