单token便宜,单任务昂贵:AI模型定价与性能对比 [OC]
摘要
本文分析了像Anthropic的Opus 5.5和ChatGPT的Astra等AI模型的成本效益,使用Artificial Analysis分数来比较单token定价与任务完成效率。
Anthropic今天发布的Opus 5.5让我深入研究了一番。我想了解使用这个最新顶级模型的最佳努力等级。这使我基于Artificial Analysis Intelligence Index v4.3.2分数得到了以下内容。如果你看第一个图表,你会发现在这个指数中,随着努力等级的提高,Opus 5.5变得更智能。(这是该评分模型的结果,但并非总是如此:参见Opus 5.5的最佳努力等级)根据第一个图表,Opus 5.5是唯一一个在最佳价值象限中的模型。第二个图表展示了不同的情况:成功完成一个任务的成本。在那里,ChatGPT的Astra模型在xhigh努力等级下悄然进入绿色区域。它在中等和高努力等级下与当今顶级的Opus 5.5直接竞争。另一件事是廉价但较弱的象限。只有当你能获得准确结果时,它们才值得花钱。https://preview.redd.it/lokbgl5xy5rh1.png?width=1472&format=png&auto=webp&s=6379a82e21a7bc72165f25f195516b2e697f9533
相似文章
每百万Token的价格毫无意义
本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。
每个AI提示都需花费成本——这改变了一切
文章认为,AI的真正挑战不仅在于构建更智能的模型,更在于以规模化的方式降低成本效率,强调了减少token使用、提升速度以及优化基础设施的重要性。
质量差距不到2%但成本相差10倍:在相同的工具调用任务上测试5个模型[D]
一位开发者在工具调用任务上测试了五个AI模型,发现廉价模型的表现与Opus等昂贵模型相差不到2%,腾讯混元(Tencent's Hunyuan)成本低于1.50美元,而Opus为15美元,通过将简单任务路由到廉价模型,每日成本从40美元降至9美元。
为何AI模型越来越昂贵?
文章讨论了Opus 4.7、GPT 5.5和Gemini 3.5 flash等先进AI模型成本的意外上涨,与之前价格下降的预期形成对比。
OpenAI与Anthropic打响价格战,中国AI竞争对手步步紧逼
OpenAI和Anthropic正在下调中端AI模型的价格,以与更便宜的中国竞争对手竞争,同时保持旗舰模型价格稳定。文章分析了代币定价的复杂性,并指出这是美国实验室捍卫其高端产品的一次关键考验。