每百万Token的价格毫无意义
摘要
本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。
暂无内容
查看缓存全文
缓存时间: 2026/07/06 20:06
# 每百万token的价格毫无意义
来源:https://janilowski.pl/en/blog/2026/price-per-m-tokens/
2026年7月5日 · 阅读时间4分钟
- \#技术
- \#机器学习
当API账单砸到你头上时,就不能光凭感觉说话了。许多公司现在发现AI确实可能很贵。一个可能让你的AI账单水涨船高的习惯,就是通过“`每百万token X美元`”来比较模型。数字越小,成本应该越低,对吧?嗯,其实不一定。
### 每百万token X美元根本无法比较
每家前沿实验室都有自己的分词器,这决定了同一段文本会被切分成多少个token。例如,本文迄今为止的所有文字,在gpt-4o中会被切分成160个token,但在gpt-4(1106-preview,通过tiktokenizer.vercel.app (https://tiktokenizer.vercel.app/) 生成)中则要消耗200个token。即使在同一家前沿实验室(这里指OpenAI)内部,不同模型按token计价也是不可比较的。在不同实验室之间进行比较,尤其是当他们不断调整专有分词器时,会引入一个难以可靠衡量的误差。Anthropic最近修改了其分词器,导致Claude将同一段文本切分出的token数增加了30%。在其他条件不变的情况下,这相当于一次相当猛烈的涨价;不过,还有另一个重要因素需要考虑。
### token效率的极端差异
即使忽略分词器的影响,另一个重要因素是一个额外token实际上值多少钱。我不是指token的价格,而是你用它能实现多少成果。如果你正用AI做正经工作,很可能你的大部分token消耗都花在了“思考”上——这个过程通常被隐藏或模糊化,但依然按与可见输出token相同的费率计费。这种技术可以大幅提升输出质量;然而,所谓“思维链”的长度可能成为影响你AI使用总成本的主要因素——而且这个长度可能差异巨大。
我挑选了目前美国前沿实验室和中国实验室(后者通常被宣传为与美国模型几乎一样好,但成本只有1/x,且x往往大于10)提供的部分最优AI模型,并将它们列在下方表格中。我还包含了每个模型在Artificial Analysis基准测试中的得分,该基准测试会为AI模型分配任务。AA研究者的目标一方面是衡量模型能力,另一方面是衡量每个任务完成后的计费金额。
| 模型 | 每百万token输入/输出价格 | AA智能基准测试得分 | 每基准测试任务成本 |
|---|---|---|---|
| **Claude Fable 5** | **$10 / $50** | 60 | **$3.25** |
| **Claude Opus 4.8 max** | **$5 / $25** | 56 | **$1.78** |
| **Claude Sonnet 5 max** | **$3 / $15** | 53 | **$2.29** |
| **GPT-5.5 xhigh** | **$5 / $30** | 55 | **$0.99** |
| **GLM-5.2 max** | **$1.40 / $4.40** | 51 | **~$0.46** |
| **DeepSeek V4 Pro max** | **$0.435 / $0.87** | 44 | **~$0.04–$0.05** |
| **MiniMax-M3** | **$0.30 / $1.20** | 44 | **~$0.18** |
| **Kimi K2.6** | **$0.95 / $4.00** | 43 | **~$0.31** |
注意,即便GPT-5.5的名义价格比Claude Opus 4.8更高,它在基准测试中完成每个任务的实际成本却只有Anthropic模型的一半。GLM-5.2的每token价格远低于GPT(3.57倍/5.68倍)和Claude(3.57倍/6.82倍);但其每任务成本并未按比例降低,这表明它在token效率上不如西方的前沿模型。
让我困惑的一个模型是Sonnet 5,因为它似乎性能不如Opus 4.8,同时由于token效率低得多,每任务成本反而更高。如果有使用它的人能向我解释这个模型的目的,我会很乐意倾听。(阴谋论:也许这是Anthropic的一种心理战术——用更低的标价来诱使人们使用一个token效率更低的模型,从而最终抬高他们的账单?)
DeepSeek V4 Pro看起来是性价比最突出的异常点。尽管它在智能基准测试中得分明显较低,但其每任务成本极低。Fable 5(带安全约束的Mythos)似乎带来了适度的改进,但价格相比GPT-5.5上涨了3倍以上。
总体而言,我认为这张表格表明,每百万token的价格并不是一个有意义的成本指标。如果不考虑每任务的实际成本,你将做出更差的模型选择决策,最终以更高的价格获得更差的性能。
相似文章
AI模型定价对比:每百万Token的输入与输出成本
彭博社报道称,中国在AI领域的激进推进正在为美国同行AI模型制造商创造一个‘死亡区’,这很可能是由激烈的定价竞争所驱动。
今年智能密度大幅提升,但我的账单没变。$/M 数字并不是真正的花钱之处。
作者反思了 AI 模型每 token 的价格大幅下降,但实际成本保持平稳,因为更便宜的模型会被更频繁地重新运行。他们认为,重要的是每完成步骤的成本,而不是每百万 token 的成本。
按代币计费是智能体的错误成本指标
文章认为,代币价格作为AI智能体的成本指标并不充分,提出有效成本应通过成功运行和验证来衡量,并讨论了路由和失败策略。
如何衡量编程模型成本
一篇解析文章,分析 AI 模型用于编程的实际成本,通过 token 定价、缓存分布和订阅数学来比较 DeepSeek Flash 和 OpenAI 的 Luna。
@omarsar0: 我一直说这些模型的token效率被低估了。对这些模型要更有野心。尝试不同……
Omar认为AI模型的token效率被低估,并引用Artificial Analysis的报告,指出DeepSeek完成基准测试任务的成本比Fable低105倍。