如何衡量编程模型成本

Reddit r/AI_Agents 新闻

摘要

一篇解析文章,分析 AI 模型用于编程的实际成本,通过 token 定价、缓存分布和订阅数学来比较 DeepSeek Flash 和 OpenAI 的 Luna。

最近,DeepSeek 和 OpenAI 发布了它们小型模型(Flash 和 Luna)的最新版本,据称在 DeepSWE 上的得分约为 GPT5.4,但人们很难理解它们的成本是多少。下面是一些基本的计算。一个好的经验法则是,如果你使用诸如 Codex Luna 的订阅,你获得的总量大约是你最大总使用量的 12-25 倍。粗略地说,通过 Codex 20x 订阅,你每月大约可以获得 1400 亿个 token。按实际美元成本计算,如果每月约 70 亿个 token,Luna 大约要花费 250 美元。相比之下,DeepSeek 每 70 亿个 token 需要 75 美元,大约是 Luna 价格的三分之一。但你需要直接购买。如果你的预算较少,比如每月 10-20 美元,你可能可以使用 opencode go,并取得相当不错的进展。要衡量一个模型的成本,需要计算 token 成本与分布的关系。对于编程用途,你的使用量平均分布大约是 93/95% 的缓存输入 token,非缓存约 2-4%,输出约 1-2%。输出会随着你是否使用 max 而成比例增加。DeepSeek flash 便宜得多的主要原因是,其缓存 token 定价约为 Luna 同等定价的 1/7,输出 token 约为其 1/5。如果你的使用场景显著不同,主要是生成 token,而不使用缓存,那么分布会改变。
查看原文

相似文章

一旦计入重试次数,更便宜的AI模型未必更便宜

Reddit r/artificial

一项并排编码实验对比了GPT-5.6 Luna与DeepSeek V4 Flash,结果显示,在计入重试后,DeepSeek看似5倍的价格优势大幅缩水。文章主张采用更全面的基准测试,报告每次尝试的成本和每次验证成功的成本。

每百万Token的价格毫无意义

Hacker News Top

本文认为,由于分词器和Token效率的差异,按每百万Token价格比较AI模型会产生误导。文章提供了一个基准成本分析,表明每Token价格较高的模型在完成每个任务时反而可能更便宜,其中DeepSeek V4 Pro是一个突出的成本效率异常值。

33种AI图像模型的成本分析

Reddit r/artificial

一项关于33种不同AI图像生成模型成本的比较分析,为开发者和企业提供定价与价值的洞察。