@FinanceYF5: Kimi K3爆红两天,Deedy说这背后是一整套算力经济学 1/ K3上线才两天,冲到OpenRouter第10名,日均1400亿Token,但服务器已经扛不住了。 吞吐从30 Token/s掉到13,延迟飙到72秒,首字等待超过20秒…

X AI KOLs Following 模型

摘要

Kimi K3上线两天即冲到OpenRouter第10名,日均处理1400亿Token,但因负载过高导致吞吐下降、延迟飙升。

Kimi K3爆红两天,Deedy说这背后是一整套算力经济学 1/ K3上线才两天,冲到OpenRouter第10名,日均1400亿Token,但服务器已经扛不住了。 吞吐从30 Token/s掉到13,延迟飙到72秒,首字等待超过20秒——这是Deedy长文「AI核心叙事是算力」的开场数据,以下全是他自己的判断。 https://t.co/zYo9KuY3N4
查看原文
查看缓存全文

缓存时间: 2026/07/20 21:36

Kimi K3爆红两天,Deedy说这背后是一整套算力经济学

1/ K3上线才两天,冲到OpenRouter第10名,日均1400亿Token,但服务器已经扛不住了。

吞吐从30 Token/s掉到13,延迟飙到72秒,首字等待超过20秒——这是Deedy长文「AI核心叙事是算力」的开场数据,以下全是他自己的判断。 https://t.co/zYo9KuY3N4

Kimi K3 Goes Viral in Two Days, Deedy Says There’s a Whole Set of Compute Economics Behind It

1/ K3 has only been online for two days, rocketing to #10 on OpenRouter with a daily average of 140 billion Tokens, but the servers are already buckling.

Throughput dropped from 30 Tokens/s to 13, latency spiked to 72 seconds, first-token wait exceeding 20 seconds—this is the opening data from Deedy’s long essay “AI’s Core Narrative Is Compute,” and everything below is his own judgment.

2/ 就算部署量化版K3,光8块B300就要50万美元起。

用更推荐的GB300 NVL72整机架要400万美元。

他判断:Moonshot大概率没这么多算力接住需求,美国推理商想接盘也未必扩得动——2.8万亿参数不是闹着玩的。

3/ GPU厂商现在流行签3到5年长约,还要30%首付款,价格一路飙升。

两大实验室、超大云厂、Grok和Meta早锁定算力,剩下的公司抢零头。

Meta是最大变数:年底手握约7GW算力,还没绑定哪个大模型。

4/ 前沿模型价格3年没怎么降:GPT-4和o1都是每百万Token 60美元,Opus 4为75,GPT-5为10,Fable为50,现在Sol是30、K3是15,只跌了4到5倍。

同期前沿需求至少涨了3个数量级,按METR数据任务处理能力至少涨了32倍。

5/ 他的推论:需求趋近无限增长、性能持续提升,价格哪怕降一点,前沿总价值依然暴涨。

反面假设:性能触顶、多数任务用不上顶级模型、突然低成本做出前沿智能,逻辑会松动;钱流向前沿不代表划算,成本高也可能亏。

6/ 巧的是,Deedy说这篇分析是他自己写好、设置定时发布的,结果刚好卡在Kimi官方发布算力紧张公告之前——纯属巧合式印证。

阅读原文:

以上就是全部

如果您喜欢这个主题:

1.关注我(@FinanceYF5) 2. 点赞+转发下面第一条帖子

旧金山的这个周末有点疯狂。

AGI Summit连轴转了两天,中间还抽空看了场世界杯决赛,从AI大佬的演讲现场直接切到球迷的呐喊声——这种反差感只有旧金山夏天能给你。

24小时内塞进了太多新回忆,慢慢发。

相似文章