AI 竞赛突然变得尴尬起来
摘要
本文指出,AI 竞赛的叙事已经发生转变:西方实验室如今正悄悄采用中国在开放方面的技术进展,例如 DeepSeek 的 KV 缓存压缩技术(体积比 V1 小 437 倍),这已推动 Anthropic 和 OpenAI 的推理及缓存 token 定价大幅下降。
暂无内容
查看缓存全文
缓存时间: 2026/09/30 17:03
# AI 竞赛突然变得尴尬了 | insufferable.dev
来源:https://insufferable.dev/posts/the-ai-race-just-got-awkward/
如果你看一眼当下的新闻标题,很容易让人误以为西方实验室正被中国实验室集体「蹲点」吊打。
## 蒸馏大戏
几乎没有哪一周,Anthropic 不会再发一篇文章,指责中国人在蒸馏他们的模型(https://techcrunch.com/2026/02/23/anthropic-accuses-chinese-ai-labs-of-mining-claude-as-us-debates-ai-chip-exports/),甚至把这些人描绘成人类本身的威胁(https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks)之类的。
这么写对他们是很有好处的,因为这能为后续从法律和监管层面限制这些模型铺好路(https://apnews.com/article/a5c40346394ef5fa9ae710c5aabdc62c)。
但很显然,无脑蒸馏的日子已经结束了。
不只是结束,如今的玩法换成了「采纳」中国实验室的成果。注意我这里用的是「采纳」,而不是 Anthropic 常用的那种充满火药味的「偷窃」。
原因在于,跟西方公司不同,中国人几乎是在把秘方公之于众。
## 另一种玩法
最近被毫无致谢地照搬的,是 DeepSeek 慷慨分享给全世界的 KV cache 优化突破。
这项优化堪称惊人:对于像编程这类使用超长会话上下文的场景,KV cache 占用相比 DeepSeek-V1 大约缩小了 **437 倍**。
他们是率先发布 MLA 架构的团队,该架构将缓存压缩了约 15 倍,随后又相继推出「压缩稀疏注意力」(Compressed Sparse Attention)和「重度压缩注意力」(Heavily Compressed Attention)。最新的 DeepSeek-V4.1-Flash 更进一步,采用 CSA2、跨层缓存复用、因果编码器-解码器架构以及 FP4 缓存,将全局 KV cache 压低到每 token 890 字节。
这些东西为什么重要?因为要为长上下文模型提供服务,最大的成本之一就是把这块缓存放进 GPU 显存所需的显存容量。
437 个等面积方格缩成 1 个:每百万 token 的 KV cache 从 389.12 GB 降到 890 MB,内存占用减少约 99.77%。
下面的图表展示了这一切疯狂到了什么程度:
每百万 token 的 KV cache 显存占用:DeepSeek-V1 为 389.12 GB,V3.2 为 48.07 GB,V4-Flash 为 3.51 GB,V4.1-Flash 为 890 MB。最新的缓存比 V1 小 437.2 倍。
## 顺着缓存追钱
跟两个月前同档位模型的价格对比一下。以下所有价格均为每 100 万 token:
百万 token 定价前后对比。Anthropic Opus 5 到 5.5:输入价从 $5 降到 $4,缓存写入从 $6.25 降到 $5,缓存读取从 $0.50 降到 $0.20,便宜 60%。OpenAI GPT-5.6 Sol 到 GPT-6.1 Sol:输入价从 $5 降到 $2,缓存写入从 $6.25 降到 $2.50,缓存输入从 $0.50 降到 $0.10,便宜 80%。
## 一声很安静的感谢
这一切必然意味着,西方 AI 公司如今的推理利润率已经相当可观。
对先进 GPU 的获取限制,迫使中国实验室把性能优化列为首要目标,而成果也确实摆在眼前。
我不知道他们为什么要如此大方地把这样的突破白白送出去,但他们就是这么做了。而且这一次,Anthropic 和 OpenAI 发布的模型确实达到了顶级水平,并且正在使用这些优化。
他们对「被抄」似乎有点尴尬。所以 Claude Opus 5.5 和 GPT-6.1 Sol 都选择了静悄悄地发布,几乎没有事前预告。
用户评价在使用体验方面相当出色,而且质量相比他们的旗舰模型(Claude Fable 5.1 和 GPT-6 Astra)似乎也没有差得太远。
缓存读取的价格,就是采纳这些成果的证据。它出现了大幅下降:Opus 5.5 相比 Opus 5,缓存读取定价下调了 60%;而 GPT-6.1 Sol 相比 GPT-5.6 Sol 七月底的价格,更是直接砍掉了 80%。
所以,是中国实验室向西方那些仍在亏损的实验室抛去了一根救命稻草,而我真的完全想不明白这是为什么。
相似文章
真正的AI竞赛可能已不再处于前沿
本文讨论了开放权重模型(尤其是来自中国公司的模型)在生产型AI工作负载中日益占据主导地位,这挑战了像Anthropic和OpenAI这样的公司的前沿模型的相关性。
@VraserX: AI竞赛正悄然转变为:封闭前沿智能 vs 开放权重智能。从长远来看,这可能更重要…
文章讨论了AI竞赛如何演变为封闭前沿智能与开放权重智能之间的对比,这对OpenAI、Google和Meta等AI公司的权力分配可能具有更长远的影响。
OpenAI与Anthropic打响价格战,中国AI竞争对手步步紧逼
OpenAI和Anthropic正在下调中端AI模型的价格,以与更便宜的中国竞争对手竞争,同时保持旗舰模型价格稳定。文章分析了代币定价的复杂性,并指出这是美国实验室捍卫其高端产品的一次关键考验。
AI竞赛内幕:DeepMind、OpenAI、Anthropic、中国与超级智能的角逐
概述了DeepMind、OpenAI、Anthropic和中国等领先实验室在AI开发中的竞争格局,它们正争相迈向超级智能。
一款新型低成本中国AI模型正迎头赶上,挑战Anthropic和OpenAI的本土市场
一款新型低成本中国AI模型正迅速崛起,与Anthropic和OpenAI等美国顶级AI公司展开竞争。