harness-benchmark

标签

Cards List
#harness-benchmark

我们需要一个工具基准排行榜

Reddit r/AI_Agents · 2026-06-30

本文主张需要一个基准排行榜,用于比较AI模型工具(例如KimiCode、OpenCode和Codex),而不仅仅是模型本身,并提出了一个代码库,用于测试模型+工具组合的成本、运行时间、token使用量和得分。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈