DeepSWE基准测试提醒:费用按任务计费,而非整个运行流程。
摘要
DeepSWE基准测试的费用是按任务计费,而非整个运行流程。运行Mimo V2.5 Pro这类模型,完整运行一次约需225美元,而Mimo V2.5非专业版约需7.15美元。用户在选择运行昂贵模型前应了解这一点。
我原本在运行Deep SWE基准测试,看到Mimo V2.5 Pro标价1.99美元,以为运行Mimo V2.5(非专业版)会更便宜,低于1.99美元。但实际上,它不像Artificial Analysis那样按总量计费,你需要将单价乘以总任务数(共113个任务)。这意味着Mimo V2.5 Pro完整运行一次实际约需225美元,GPT 5.5 medium总计约264美元。幸运的是,根据Mimo V2.5(非专业版)前14个任务约0.89美元的成本来看,完整运行大约需要7.15美元,所以我仍打算让它继续运行。但如果你打算用更贵的模型运行该基准测试,请务必谨慎,因为一般观念中它是个便宜的测试。以下是基于已完成任务的项目估算:
### **截至目前(14个任务)— 总成本:0.89美元**
* **缓存命中(98.8%):** 1.535亿 token | 0.43美元
* **缓存未命中(1.2%):** 180万 token | 0.25美元
* **输出:** 72.3万 token | 0.20美元
### **预估(113个任务)— 总成本:约7.15美元**
* **缓存命中成本:** 3.47美元
* **缓存未命中成本:** 2.04美元
* **输出成本:** 1.64美元
相似文章
OUI-1:全球首款用于 Generative UI 的模型
OUI-1 是全球首款用于 Generative UI 的模型,一个经过微调的 DiffusionGemma,能够以速度和可靠性在消费硬件上生成用户界面。
XHToken/Spark-X2.5-4B vs inclusionAI/Ling-3.0-tiny vs Nanbeige/Nanbeige4.2-3B
本文探讨了哪些小型人工智能模型最具实用性,并介绍了同一尺寸级别中的三款竞争模型。
相比GPT-4o直接视觉处理,我将图像处理token使用量减少了约95%,同时保持了大致相同的准确度。这有多重要?[P]
一位研究人员分享了初步结果,展示了一种方法,与GPT-4o相比,将图像处理token使用量减少约95%,同时保持了相似的准确度,并寻求关于其重要性的反馈。
@dair_ai:一篇关于编程智能体的极具参考价值的基准测试论文。在Claude Code环境中运行的Claude Opus 5仅通过23.9%的测试项……
该论文提出了一种新的编程智能体评估基准,用于衡量其在真实环境中完成实际客户服务任务的能力。
Astra 在 Blueprint-bench2 上获得最高分
Astra 在 Blueprint-Bench 2 上获得最高分,这是一个测试 AI 智能体使用空间推理和跨公寓学习将公寓照片转换为精确 2D 平面图能力的基准测试。