一旦计入重试次数,更便宜的AI模型未必更便宜

Reddit r/artificial 新闻

摘要

一项并排编码实验对比了GPT-5.6 Luna与DeepSeek V4 Flash,结果显示,在计入重试后,DeepSeek看似5倍的价格优势大幅缩水。文章主张采用更全面的基准测试,报告每次尝试的成本和每次验证成功的成本。

我使用GPT-5.6 Luna和DeepSeek V4 Flash进行了一个小型的并排编码实验。任务是用相同的提示词生成一个可玩的浏览器版伪装游戏。两次运行都通过AIHubMix使用相同的API网关完成。记录的结果如下: - GPT-5.6 Luna:0.10美元,691秒,首次运行即完美成功 - DeepSeek V4 Flash:0.02美元,729秒,第三次运行才成功 结果看似简单:DeepSeek便宜了5倍。但这个结论完全取决于重试次数如何计算。如果每次尝试收费0.02美元,那么达到成功结果的实际成本接近0.06美元。如果显示的数字是累计费用,那么5倍的比较才成立。这一区别很重要,因为真实AI系统很少只为成功生成付费。它们还要为失败的调用、重试、验证、人工审查以及下游恢复付费。一个更有信息量的基准测试应该同时报告: - 单次尝试的成本 - 到首次验证成功为止的累计成本和时间 它还应该将视觉成功与功能正确性、可维护性、安全性和边缘情况行为区分开来。这只是一个任务,因此不能证明哪个模型总体上更好。一个规范的后续研究应该使用固定的模型版本、相同的设置、自动化功能测试,每个模型至少20次试验,并报告中位数和p95。对于生产级AI系统,主要指标应该是什么:最低推理价格、首次通过成功率,还是每次验证结果的预期成本?
查看原文

相似文章

DeepSeek刚刚戳破了美国AI泡沫。

Reddit r/ArtificialInteligence

DeepSeek的V4 Pro模型在定价上比GPT-5.5和Claude Opus等竞争对手低10-35倍,这表明随着'足够好'的模型以显著更低的成本压缩利润率,AI泡沫面临通缩压力。

如何衡量编程模型成本

Reddit r/AI_Agents

一篇解析文章,分析 AI 模型用于编程的实际成本,通过 token 定价、缓存分布和订阅数学来比较 DeepSeek Flash 和 OpenAI 的 Luna。