AI 竞赛突然变得尴尬起来

Hacker News Top 新闻

摘要

本文指出,AI 竞赛的叙事已经发生转变:西方实验室如今正悄悄采用中国在开放方面的技术进展,例如 DeepSeek 的 KV 缓存压缩技术(体积比 V1 小 437 倍),这已推动 Anthropic 和 OpenAI 的推理及缓存 token 定价大幅下降。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/30 17:03

# AI 竞赛突然变得尴尬了 | insufferable.dev 来源:https://insufferable.dev/posts/the-ai-race-just-got-awkward/ 如果你看一眼当下的新闻标题,很容易让人误以为西方实验室正被中国实验室集体「蹲点」吊打。 ## 蒸馏大戏 几乎没有哪一周,Anthropic 不会再发一篇文章,指责中国人在蒸馏他们的模型(https://techcrunch.com/2026/02/23/anthropic-accuses-chinese-ai-labs-of-mining-claude-as-us-debates-ai-chip-exports/),甚至把这些人描绘成人类本身的威胁(https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks)之类的。 这么写对他们是很有好处的,因为这能为后续从法律和监管层面限制这些模型铺好路(https://apnews.com/article/a5c40346394ef5fa9ae710c5aabdc62c)。 但很显然,无脑蒸馏的日子已经结束了。 不只是结束,如今的玩法换成了「采纳」中国实验室的成果。注意我这里用的是「采纳」,而不是 Anthropic 常用的那种充满火药味的「偷窃」。 原因在于,跟西方公司不同,中国人几乎是在把秘方公之于众。 ## 另一种玩法 最近被毫无致谢地照搬的,是 DeepSeek 慷慨分享给全世界的 KV cache 优化突破。 这项优化堪称惊人:对于像编程这类使用超长会话上下文的场景,KV cache 占用相比 DeepSeek-V1 大约缩小了 **437 倍**。 他们是率先发布 MLA 架构的团队,该架构将缓存压缩了约 15 倍,随后又相继推出「压缩稀疏注意力」(Compressed Sparse Attention)和「重度压缩注意力」(Heavily Compressed Attention)。最新的 DeepSeek-V4.1-Flash 更进一步,采用 CSA2、跨层缓存复用、因果编码器-解码器架构以及 FP4 缓存,将全局 KV cache 压低到每 token 890 字节。 这些东西为什么重要?因为要为长上下文模型提供服务,最大的成本之一就是把这块缓存放进 GPU 显存所需的显存容量。 437 个等面积方格缩成 1 个:每百万 token 的 KV cache 从 389.12 GB 降到 890 MB,内存占用减少约 99.77%。 下面的图表展示了这一切疯狂到了什么程度: 每百万 token 的 KV cache 显存占用:DeepSeek-V1 为 389.12 GB,V3.2 为 48.07 GB,V4-Flash 为 3.51 GB,V4.1-Flash 为 890 MB。最新的缓存比 V1 小 437.2 倍。 ## 顺着缓存追钱 跟两个月前同档位模型的价格对比一下。以下所有价格均为每 100 万 token: 百万 token 定价前后对比。Anthropic Opus 5 到 5.5:输入价从 $5 降到 $4,缓存写入从 $6.25 降到 $5,缓存读取从 $0.50 降到 $0.20,便宜 60%。OpenAI GPT-5.6 Sol 到 GPT-6.1 Sol:输入价从 $5 降到 $2,缓存写入从 $6.25 降到 $2.50,缓存输入从 $0.50 降到 $0.10,便宜 80%。 ## 一声很安静的感谢 这一切必然意味着,西方 AI 公司如今的推理利润率已经相当可观。 对先进 GPU 的获取限制,迫使中国实验室把性能优化列为首要目标,而成果也确实摆在眼前。 我不知道他们为什么要如此大方地把这样的突破白白送出去,但他们就是这么做了。而且这一次,Anthropic 和 OpenAI 发布的模型确实达到了顶级水平,并且正在使用这些优化。 他们对「被抄」似乎有点尴尬。所以 Claude Opus 5.5 和 GPT-6.1 Sol 都选择了静悄悄地发布,几乎没有事前预告。 用户评价在使用体验方面相当出色,而且质量相比他们的旗舰模型(Claude Fable 5.1 和 GPT-6 Astra)似乎也没有差得太远。 缓存读取的价格,就是采纳这些成果的证据。它出现了大幅下降:Opus 5.5 相比 Opus 5,缓存读取定价下调了 60%;而 GPT-6.1 Sol 相比 GPT-5.6 Sol 七月底的价格,更是直接砍掉了 80%。 所以,是中国实验室向西方那些仍在亏损的实验室抛去了一根救命稻草,而我真的完全想不明白这是为什么。

相似文章

真正的AI竞赛可能已不再处于前沿

TechCrunch AI

本文讨论了开放权重模型(尤其是来自中国公司的模型)在生产型AI工作负载中日益占据主导地位,这挑战了像Anthropic和OpenAI这样的公司的前沿模型的相关性。

OpenAI与Anthropic打响价格战,中国AI竞争对手步步紧逼

Ars Technica

OpenAI和Anthropic正在下调中端AI模型的价格,以与更便宜的中国竞争对手竞争,同时保持旗舰模型价格稳定。文章分析了代币定价的复杂性,并指出这是美国实验室捍卫其高端产品的一次关键考验。