Anthropic/OpenAI可能每从你那里收取100美元,实际支出却超过1000美元(39分钟阅读)
摘要
一项分析表明,像Anthropic和OpenAI这样的AI公司每获得100美元收入,可能实际花费超过1000美元,凸显了LLM市场不可持续的经济状况。
LLM辅助编程短期内不太可能变得负担得起。虽然它能让开发者实现以前无法做到的事情,但对大多数用例来说并不经济可行。它现在之所以可行,是因为订阅服务得到了大量补贴。需要循环和‘思考’的严肃用例通过API使用已变得非常昂贵。开发者需要为成本持续上升做好准备,并构建更具韧性的系统。
查看缓存全文
缓存时间: 2026/06/08 15:13
# Anthropic/OpenAI 可能每收你100美元,就要支出超过1000美元
来源:https://ea.rna.nl/2026/06/07/anthropic-openai-may-be-spending-more-than-1000-for-every-100-you-pay-them/
出于一些不便明说的原因,在搁置15个月后(https://ea.rna.nl/2025/10/27/ai-generated-podcast-ai-slopcast/ 那篇2025年10月的文章,以及 https://ea.rna.nl/2025/06/15/ai-has-invented-a-new-language-and-added-sex-to-a-dull-office-context/ 那篇2025年6月的文章,都不算正经作品),我们重新开始写关于生成式AI/LLM的内容(https://ea.rna.nl/the-chatgpt-and-friends-collection/)。今天,这是关于"用大'语言'模型写代码"系列文章的第一篇,因为用LLM写代码被定位为LLM的"杀手级应用(https://en.wikipedia.org/wiki/Killer_application)"。
我们插播一段关于Anthropic最近发布的博客文章《当AI自我构建时》(https://www.anthropic.com/institute/recursive-self-improvement)的简短讨论。
### Anthropic是不是碰巧雇了谷歌的营销人员?
Anthropic的这篇博客文章是暗示性写作的典范。免责声明是存在的,但要么被隐藏起来,要么被夹在更夸张的陈述之间。一句"我们可能错了"是有的,但在数千字假设他们*没有*错的文本中,这一句话能起什么作用呢?基准测试也值得怀疑——在编码任务上相比人类达到50%甚至80%的成功率,对于完全自主(无人参与)的编码来说实际上毫无用处。每天提交8倍多的代码行数真的是好事吗?如果每天都在替换前一天不合理的内容呢?如果LLM的编辑方式让"代码行数"这个指标变得比本来就更不可靠呢?总而言之,这让我想起了谷歌关于其"Willow"量子计算芯片的欺骗性言论(https://ea.rna.nl/2024/12/31/googles-willow-quantum-computer-impressive-science-and-misleading-marketing/)。
顺便说一下,关于"每天提交8倍多的代码行数真的是好事吗?":我很多基于LLM的提交都是这样的,老实说,我增加提交次数只是为了能在Claude Code跑偏时回溯。即使没有中间提交,我提交的变更量最终也比实际保留的代码行数多出7倍……所以,"8"这个估计值与其说是生产力提升,不如说是开销增加的说法似乎还挺有道理……
如果我以后有机会写"用Claude写代码"的深度文章,会再讨论这个问题。
顺便一提,这篇文章又长又绕(我在这方面确实有些困难,抱歉),所以先提供:
### **太长不看版**—— LLM写代码看起来不太可能负担得起(更别说"AI自我构建"了)
我一直在做一些实验。实验内容是:"Claude Code到底有多好?"这个实验还在进行中,Claude Code目前已经创建了约4万行代码和一个可运行(尽管不完整)的应用。我希望稍后汇报这个体验(但这写起来要困难得多)。与此同时,我遇到了成本问题,这引发了一个小型研究项目,得出了一些有趣的观察和结论:
- 先从一个重要观察开始:由于Claude Code和我自己(生疏但还算扎实)的编程背景的结合,我能够让它创建了这个应用(目前尚未完成但可用),否则我不可能在这么短的时间内创建出来,而考虑到时间和精力,这本来意味着'根本不可能'。对于有经验的程序员来说,初次体验非常令人印象深刻,因为他们知道正常情况下自己需要多少理解才能创建这样的代码;
- 但是……LLM写代码在大多数情况下在经济上并不可行。现在之所以可行,是因为订阅费被大量补贴。如果你使用每月100美元的Claude Max套餐,并每周用完限额来全力进行"自主编码"(几乎无人干预),你使用的token量按API定价成本将超过1000美元。Anthropic似乎在忙着(Opus 4.7, 4.8)堵住这个亏损缺口,即使成功且不损失质量,这也意味着实质性改进的终结(即S曲线的终结);
- 而且……虽然简单的对话(无论是预算模型还是前沿模型)确实变得"便宜到无法计费",但那些需要递归/间接/工具使用/"思考"(不)模型的严肃用途(如编码、复杂推理)在token使用量上爆炸式增长,使得这些用途变得非常昂贵。一个顶级递归模型在"高努力"设置下的*单个任务*,按API费率估计成本约为75美元。我见过*单个查询*使用了一百万个token,这意味着按API费率最高可达25美元;
- 所以……向世界展示的经济模型似乎基于这样一个组合:那些需要最大量的暴力计算才能在任何复杂事物上近似好结果的任务的价值,同时隐藏成本或谈论"便宜到无法计费";
- 因此:趁这艘船还没沉,好好享受音乐,并准备好一个可靠的救生筏。
以下是我正在构建(并乐在其中)的应用截图的一部分。这是一个真实的应用,可能帮助我创建我需要的图表(所以是数据和图形的结合)。目标是研究"用LLM写代码",我构建的东西只是一个例子,我认为自己对这个主题有点经验(https://ea.rna.nl/archimate/free-archimate-overview-pdf/):
"我们的角色正在下沉,它们正把它们的接口也拖下水!"(来自我的测试对象的例子,我让Claude Code生成了100%的代码,我没有*编辑*它,但我经常告诉它如何*解决*某些问题,比如跳线下方的小间隙强化了"跨越"的暗示)
先从一个重要观察开始:由于Claude Code和我自己(生疏但还算扎实)的编程背景的结合,我能够让它创建一个应用(目前尚未完成但可用),否则我不可能在这么短的时间内创建出来,而考虑到时间和精力,这本来意味着'根本不可能'。但这里有个问题,甚至不止一个。我稍后会报告技术问题以及回答:"Claude Code到底在多大程度上'写代码'?"今天,我主要被经济学问题所震撼。
我的"氛围编码"(我真的很讨厌这个词,无论有没有LLM,编码都谈不上什么"氛围")实验到目前为止已经进行了4个月(不是全职,注意)。我从一个非常小的项目开始,感受LLM编码,最后选择了Claude Code,使用Opus 4.6,中等努力程度设置。如果使用更高设置,它更容易在森林中迷路。低一些,结果就很差(更多关于管理代码质量的内容将在后续文章中讨论)。在我最终更严肃的项目(最后两个月)进行一段时间后,"中等努力"的结果变差了,所以我切换到"高",质量大致回到了原来的水平。
管理成本也是体验的一部分。首先,我订阅了20美元/月的套餐。很快就遇到了使用限制。有一个每5小时重置的限制和一个每周重置的限制,你可以通过按API定价购买token来超出限制。所以我试着添加了一些额外资金。我发现按API成本购买token显然比保持在限制内贵得多。当我还在用20美元/月套餐时,我买了一些额外token来完成一些工作,几天之内我就买了大约80美元的token。这时我清楚地意识到,支付100美元/月比使用最便宜的选项并在需要时按API成本追加资金要划算得多。
我之前就在关注成本,比如训练与推理(通过生成式AI生成结果)的对比,得出的结论是,驱动成本的不是训练,而是推理/生成。得出这个结论后,我开始研究LLM*使用*来执行一个*任务*的成本。而且我——坦白说——实际上使用了一些LLM聊天机器人(Gemini、Claude)来帮助我进行这项研究。现在,在你因为确信这些LLM太不可靠而停止阅读之前,它们确实是非常不错的搜索引擎,即使它们在自身生成的内容上会犯错误。毕竟,它们吞噬了所有那些ArXiv文章,而基于PageRank的传统网络搜索无法做到的事情,LLM可以:它们根据实际内容找到信息。在办公室环境中使用LLM的人会证实这一点。
我得到的第一批答案是标准的快速粗略答案,比如Sam Altman那句名言:推理变得"便宜到无法计费"。这些话被证明是真的,但也极具误导性/不完整,非常之甚,你接下来会看到。归根结底,'每个token'的价格对用户来说并不相关,相关的是你为获得一个"解决方案"或"完成任务"支付了多少。而我们已经知道,虽然结果有所改进,但token数量猛增,尤其是使用间接/递归("思考"模型)时。旁注:称它们为"思考模型"极具误导性。它们根本不是(https://ea.rna.nl/2025/02/28/generative-ai-reasoning-models-dont-reason-even-if-it-seems-they-do/)这回事。它们所做的首先是大规模不可见的递归、间接和试错。就像一个LLM在幕后创建20个或100个方法,反复这样做,使用一些额外工具(比如先生成一个Python脚本,然后运行该脚本——必须多次运行直到脚本中没有明显错误),甚至可能测试几次,然后将输出作为LLM更多的输入。以此类推。大量的间接和递归,大量的"试错",几乎全部对用户不可见。所以我调查了这个趋势,从"2023年Q1到现在,平均每个查询使用了多少token?"开始,这样我就可以将每个token成本的下降与使用token数量的上升结合起来。试了几次后,我开始了一个新的对话,使用更聚焦的初始提示。
重要的是要记住,人们不想要单个查询的结果,这只对最简单的任务才是真的。实际上,他们通常进行多次查询,有反复的交流,然后才接受结果。所以,你还需要估计平均需要多少次查询才能达到一个解决方案。
还有所有那些你看不到的token。有不计入计费的token,有"暗token",而且随着被错误标签(https://ea.rna.nl/2025/02/28/generative-ai-reasoning-models-dont-reason-even-if-it-seems-they-do/)的"思考"模型的出现,背景中存在着大量的间接/递归和难以置信的"试错",这些你看不到作为输入或输出的东西,但都在使用一大堆token。我们知道这些"递归"模型使用的token数量远超你作为用户看到的结果。
这些也是你看不到的token,但它们仍然按可见输出(生成)token成本向你收费。为了了解成本,Opus 4.6按token计费时,输入(你给的数据,比如它每次查询从你的代码库中提取的数据以及它在后台读取的内容)为5美元/百万token,生成数据(包括后台那些"递归努力"中的生成)为25美元/百万token。
无论如何,几乎所有这些都大量依赖估算。可靠的数据非常少。这篇文章是基于我能得出的最佳合理估计的结果,其中一部分*是*可靠数据:我自己的体验。
为了展示使用成本的发展,我想出了一个简单的框架:
第一个要素是如何衡量每个token的成本。我们下面会看订阅费用,但我们遵循的标准是"API每token"成本随时间的变化。这是我们拥有的对真实token成本的最佳估计,但它很脆弱,因为只要供应商不公开这一点,我们就必须做出假设。他们在API定价下盈利吗?还是这种使用实际上仍在亏损并受补贴?这两种情况在当前都是可能的。而且API定价发生过奇怪的事情(见下文)。但我们没有更好的数据。今天,像Claude Opus 4.6这样的顶级模型,每百万输入token(你的代码、文档、查询)收费5美元,每百万生成token收费25美元。听起来很便宜,但这里"你看不到的东西"将发挥作用。
然后有两种人们使用LLM的任务。一种是容错的:结果非常准确并不极端重要,这种使用可能被比作"便宜的衣服":不太好,但便宜(这个例子取自工业革命初期,当时体力劳动开始在工厂中被自动化,数字革命现在正在对某些脑力劳动做类似的事情(https://ea.rna.nl/2024/07/27/generative-ai-doesnt-copy-art-it-clones-the-artisans-cheaply/))。这样的请求也会导致更少的后续查询和回复,人们简单地接受LLM产生的内容。
但有些领域准确性极端重要:编码就是一个例子。IT系统极其脆弱。一个小错误就能让航空公司停飞。因此,这些请求是容错的,我们需要正确的结果。其他例子可能涉及健康、金融等,小错误可能导致严重的负面后果。准确性问题是生成式AI的一个特别问题。它是大规模统计估计,所以不准确是不可避免的风险。
换句话说,人们使用LLM的"任务"(一系列查询直到解决,即一个*任务*)并不是单一的,它涵盖从快速提问(高准确性不重要)到极端依赖正确结果的任务。快速预算模型确实很快,对于简单的事情确实"便宜到无法计费",只要解决方案在数据中有良好代表,问题不太复杂,模型对于很多人来说就做得"足够好"。但让这些预算模型处理任何严肃的事情,它们的结
相似文章
⚡️ Anthropic与OpenAI的订阅亏损远超预期
SemiAnalysis的新分析显示,Anthropic和OpenAI的订阅服务亏损远超此前估计,通过API使用其AI模型的真实成本比订阅费用高出数个数量级。
OpenAI 质疑 Anthropic 收入夸大数十亿美元
OpenAI 的 CRO 声称,由于对云转销商交易采用总额会计法,Anthropic 的 300 亿美元年度经常性收入 (run rate) 被夸大了约 80 亿美元;美国证券交易委员会 (SEC) 可能需要对使用超大规模云分销的 AI 公司设定先例。
AI的可负担性危机
文章分析了AI平台不可持续的经济学,揭示了巨额补贴,像OpenAI和Anthropic这样的公司通过远低于成本的收费损失了数十亿美元,导致了可负担性危机。
在OpenAI和Anthropic实现盈利的世界中,消费者AI使用会是什么样子?
本文讨论了随着OpenAI和Anthropic等公司追求盈利,从免费或低成本AI使用向更受限、利润驱动模式的必然转变。
廉价AI可能扰乱OpenAI和Anthropic的IPO(7分钟阅读)
本文讨论了来自中国实验室和其他竞争对手的廉价AI模型的日益普及如何在OpenAI和Anthropic计划IPO之前威胁其估值和市场地位,因为企业客户越来越寻求具有成本效益的替代方案。