关于Kimi K3:其能力与相关不满(70分钟阅读)
摘要
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。
Kimi K3是一款非常出色的模型,基准测试表现优异。它是迄今为止最大的(即将成为)开放模型,拥有2.8T参数,这解释了它的许多优势。该模型有一定程度的蒸馏,性能看起来参差不齐,但很可能适用于许多工作流程。按照目前的发展速度,中国似乎有能力在年底前发布一个Mythos级别的开放模型。
查看缓存全文
缓存时间: 2026/07/21 21:28
# 关于 Kimi K3:它的能力及相关争议
来源:https://thezvi.wordpress.com/2026/07/20/on-kimi-k3-its-capabilities-and-related-discontents/
Kimi K3 是一款非常优秀的模型,基准测试成绩出色。假设其权重按计划发布,那么仅从原始能力来看,它将成为最强的开源模型。但请不要冲昏头脑。不要仅凭 Kimi K3 的相对优势来评判它。总体来看,它落后于闭源模型前沿好几个月,至少四个月,我的中位数估计是六个月,其中后训练差距较小,预训练差距较大。这个时间差比以前短了,但现在的几个月“密度”更高。它有一定程度的蒸馏。其基准测试成绩很可能高于实际表现。所有基准测试都是在最大努力下评分的,通常使用的 token 数远多于 Fable 或 Sol 在类似测试中使用的数量。性能表现参差不齐。Kimi 在某些方面会很出色,在其他方面则会逊色一些。未来几周我们会了解更多。目前访问权限不稳定,真正有机会试用 Kimi K3 的人还不多,因此我对它的能力评估的误差范围比平时更大。唉,时不我待,我们继续吧。
它是目前最大的开源模型,参数规模达 2.8T,处于 Claude Opus 可能尺寸的上限,接近 Mythos 可能尺寸的下限,这解释了它许多进步的原因。它速度慢,且似乎极度消耗 token。许多正面评价是因为这是个大模型,因此至少带有相当的“大模型味道”,通常以更慢、更贵换取一些性能提升。这是个好策略,但他们短期内很难再复制。从 Claude 进行蒸馏显然是其中一部分原因,很可能主要来自 Fable,但也显然远非全部。显然,即使只带来一点点帮助,Moonshot 也会这么做。他们发布更大模型的时间点颇有深意。再说一次,这是个好模型,但一旦纠正了基准测试的过度表现,再看看预期的实际性能,很难说这与我们对一个 2.8T 参数的 Kimi K3 的预期有多大不同。不妨考虑一下:Kimi K3 的(初步非官方)Epoch 能力指数正好落在中国趋势线上(https://x.com/peterwildeford/status/2079052877801128237)。
Kimi K3 绝对值得一试,看看它是否适合你的工作流程。以这个价格点——无论是 API 还是订阅——它都无法取代那些更小更便宜的开源模型,而且我认为它在与顶级闭源模型的竞争中通常会落败,但在某些领域,Kimi K3 会是一个不错的选择。
> Andrew Curran (https://x.com/AndrewCurran_/status/2078729593096434114):继 Kimi K3 的成功之后,Moonshot AI 已通知投资者,计划在未来六个月内于香港进行 IPO,据彭博社报道。好主意。打铁要趁热。
#### 目录
1. DeepSeek 时刻:又来了。(https://thezvi.substack.com/i/207449107/deepseek-moments-here-we-go-again)
2. 我们曾有过一个时刻(2025年6月重演)。(https://thezvi.substack.com/i/207449107/we-had-a-moment-reprise-from-june-2025)
3. 之后的故事。(https://thezvi.substack.com/i/207449107/the-story-since-then)
4. Kimi K3 公告、宣传及基本事实。(https://thezvi.substack.com/i/207449107/the-kimi-k3-announcement-pitch-and-basic-facts)
5. 论现代刷榜。(https://thezvi.substack.com/i/207449107/on-modern-benchmaxxing)
6. 他人的基准测试。(https://thezvi.substack.com/i/207449107/other-people-s-benchmarks)
7. 基准测试不等于真实世界。(https://thezvi.substack.com/i/207449107/benchmarks-are-not-the-real-world)
8. 技术保障?那是什么?(https://thezvi.substack.com/i/207449107/technical-safeguards-what-are-those)
9. Kimi 能做的事。(https://thezvi.substack.com/i/207449107/things-kimi-can-do)
10. Kimi 不能做的事。(https://thezvi.substack.com/i/207449107/things-kimi-cannot-do)
11. 不容易让 Kimi 做的事。(https://thezvi.substack.com/i/207449107/things-it-is-not-easy-to-get-kimi-to-do)
12. 开源权重模型不安全,而且无法解决。(https://thezvi.substack.com/i/207449107/open-weight-models-are-unsafe-and-nothing-can-fix-this)
13. Dean Ball 尝试建设性讨论。(https://thezvi.substack.com/i/207449107/dean-ball-attempts-to-be-constructive)
14. OpenAI 员工对此相对乐观。(https://thezvi.substack.com/i/207449107/openai-employees-are-relatively-bullish-on-this-one)
15. Kimi K3 在典型智能体编程和 3D 方面相对最强。(https://thezvi.substack.com/i/207449107/kimi-k3-is-relatively-strongest-at-typical-agentic-coding-and-3d)
16. 各方反应。(https://thezvi.substack.com/i/207449107/reactions)
17. 你是谁?(https://thezvi.substack.com/i/207449107/who-are-you)
18. 他们是怎么做到的?(https://thezvi.substack.com/i/207449107/how-did-they-do-it)
19. 结论。(https://thezvi.substack.com/i/207449107/conclusion)
#### DeepSeek 时刻:又来了
所有关于中国模型的讨论都笼罩在 DeepSeek 时刻(https://thezvi.substack.com/p/deepseek-r1-0528-did-not-have-a-moment)的阴影之下。有太多人非常、非常希望另一个 DeepSeek 时刻(https://thezvi.substack.com/p/deepseek-r1-0528-did-not-have-a-moment)能够发生。这些人非常、非常想讲这样一个故事:中国开源模型正在追赶美国闭源模型,AI 和推理将变得商品化。他们的动机各不相同。他们通常想肯定开源模型,或强调“技术栈”的重要性。其他人则只是想看到 OpenAI 和 Anthropic 倒下,或者知道这样的说法能卖座。通常其最终目的是反对所有 AI 监管,或反对任何可能“拖慢我们”或导致我们“输给中国”的事情。用“那我们应该把算力卖给他们,让他们运行这些模型并建造更好的模型”来回应(https://x.com/peterwildeford/status/2077946879547990242)“中国现在有了更好的模型”简直是在主动自杀。然而每一次,是的,总会有人这样争论。唉。
通常,他们只是想告诉美国 AI 停止采取预防措施,别再烦人并拆除分类器(https://x.com/ramez/status/2077848618497921422),就像“精灵已经出瓶了,所以放出更大的精灵,给他无限的愿望,这是唯一的办法”。人们真的宁愿承担重大灾难风险,也不愿应付分类器,而且对此非常愤怒。
当天谷歌股价下跌 4.4%,SpaceX 下跌 3.1%(https://x.com/AndrewCurran_/status/2077847329655452104),英伟达下跌超过 2%,科技股在周五继续下跌,所以我们很可能又要重演这一切了。是的,我们正面临再次重演的风险(https://www.axios.com/2026/07/17/china-ai-kimi-k3-open-source-anthropic-opus?utm_campaign=mrf-utm_campaign=editorial&utm_source=x&utm_medium=owned_social&utm_source=twitter&utm_medium=social&mrfcid=202607176a4f1cc2c72f0423c6346038):
> Axios(https://x.com/axios/status/2078055882840047769)(错误说法):中国刚刚抹平了美国的 AI 领先优势
> Seán Ó hÉigeartaigh(https://x.com/S_OhEigeartaigh/status/2078077922473054582):不,没有。(尽管 Kimi K3 无疑令人印象深刻)
模式如下:
1. 中国模型发布。
2. 引用一些令人印象深刻的基准测试。
3. 因此,美国的领先优势消失了,证明完毕,就这样,不,真的,就这样了。
在 Axios 的案例中,引用的基准测试是 Arena。仅凭这一点,他们就断言美国的领先优势已消失。我本想忽略,但这种逻辑风格已经多次说服了华盛顿特区,并产生了实质性的政策影响。想到这些人现在又知道了 Mythos 的存在,我不禁不寒而栗。对 Fable 越狱的困惑很容易扩展到更广泛的愚蠢恐慌。最初的 DeepSeek 时刻(https://thezvi.substack.com/p/deepseek-r1-0528-did-not-have-a-moment)是由于多种事件交汇而产生的。让我们回顾一下。
#### 我们曾有过一个时刻(2025年6月重演)
我们都记得**DeepSeek 时刻**(https://thezvi.substack.com/p/on-deepseeks-r1),它导致了**App Store 恐慌**(https://thezvi.substack.com/p/deepseek-panic-at-the-app-store),引发了许多从根本上看毫无意义且事后证明相当愚蠢的股市动荡,经历了**非常紧张的一周**(https://thezvi.substack.com/p/deepseek-lemon-its-wednesday)以及**最终结论——不要恐慌**(https://thezvi.substack.com/p/deepseek-dont-panic)。经过几个月,我们逐渐清晰地看到了(大部分)发生了什么:多种叙事因素共同作用,将 DeepSeek 的 r1 从一个令人印象深刻但并不特别令人惊讶、值得更新的模型,变成了震撼世界的一声惊雷,尽管缺乏直接的“宣传”。具体来说,以下因素共同导致了这一效果:
1. **“六百万美元模型”**(https://thezvi.substack.com/p/deekseek-v3-the-six-million-dollar)叙事。人们将 v3 的边际计算成本与 OpenAI 和 Anthropic 等美国实验室的整体预算等同起来。这就像说 DeepSeek 在苹果上的花费远低于 OpenAI 在食物上的花费。但在进行同类比较时,DeepSeek 确实花费更少,但差异远没有那么显著。
2. DeepSeek 同时发布了一款免费应用,界面异常简洁,并展示了思维链(CoT)。DeepSeek 是快速追随者,因此他们没有理由隐藏 CoT。比较时只将 DeepSeek 的最佳用例与其他地方的相同用例进行对比,忽略了 DeepSeek 缺乏或表现不佳的功能和用例。所以,如果你想进行第一天的免费查询,你会获得当时独特且病毒式传播的体验。这迫使其他实验室也展示 CoT,并加速发布各种模型和功能。
3. 需要一段时间才能真正了解一个模型有多好,而不同的风格、可见的 CoT 以及兴奋感让人们认为 r1 比实际更好。
4. 时机无可挑剔。DeepSeek 恰好赶在一系列其他模型发布之前。两周内就很清楚,美国实验室仍然领先。这是 DeepSeek 周期的顶峰,也是其他实验室周期的低谷。
5. 技术在时机上也无可挑剔。当时是 RL 扩展的早期阶段,训练过程仍然可以廉价完成。DeepSeek 在从芯片中榨取最大性能方面做得很好,但随着计算劣势的持续,他们未来可能会遇到越来越大的困难。
6. DeepSeek 利用了“安全测试是什么?”以及快速跟进的角度,尽可能快地发布,在模型刚一具备可行性时就不可撤销地发布其新模型,使其看起来相对更先进、更不落后于实际情况。Teortaxes 指出,R1 论文指出了许多需要修复的问题,但 DeepSeek 当时没有时间修复,而 R1-0528 修复了这些问题,这些在恐慌期间并未被“计入”。
7. DeepSeek 开启了整个“势头”论点。中国之前发布的模型落后得多,DeepSeek 现在不那么落后了(有些人甚至说领先了),人们认为“哦,这意味着他们很快就会领先”。然而事实并非如此,你不能这样假设,而且从追随者转变为领导者是一个巨大的飞跃。
8. 这与对中国粉丝和各类中国鹰派普遍存在的“中国赶上美国”叙事的需求高度相关。展望未来,我们留下了一个“导弹差距”式的故事。
9. 还有很多人一直在推动“开源模型获胜”的论点,他们认为非开源模型要么注定失败,要么不算数。这些人非常直言不讳,氛围是他们选择的武器,有些人还与特朗普政府关系密切。
10. 股市严重缺乏情景意识,因此他们认为这次发布的重要性远超实际,这导致各种人“觉醒”到早已知道的事情,并预期他人也会觉醒,同时人们对任何底层动态的运作方式普遍误解,包括杰文斯悖论,以及如果你想运行 r1,你会去购买更多芯片,包括英伟达芯片。也有可能 DeepSeek 的股市反应很大程度上与特朗普政策声明相关的内幕交易有关。
本质上:有效市场假说是错误的。
#### 之后的故事
自那以后,中国已经赶上或正在追赶的想法不断出现,推动了华盛顿的许多讨论,作为这一时刻的回响。每当有新最强或令人兴奋的中国模型发布时,这种想法就会重新出现。中国每有一天没有发布模型,他们看起来就落后一天。当他们发布时,他们就会“赶上”,看起来不那么落后了。自 r1 之后、K3 之前,排名前 10 的此类潜在时刻很可能是:
1. Manus。
2. DeepSeek r1-0528。
3. Kimi K2。
4. GPT-5(反向),以极其愚蠢的方式吓坏了很多人。
5. DeepSeek v3.1。
6. Kimi K2 Thinking。
7. DeepSeek v3.2。
8. Kimi K2.5。
9. DeepSeek v4。
10. GLM-5.2。
主要是 Kimi 和 DeepSeek。Manus 引发了炒作热潮并吓到了人,而 GLM-5.2 是迄今为止他们最强的产品,使 GLM 系列崭露头角。其中许多都是好模型,但没有一个从根本上改变游戏规则。
大体上,自 DeepSeek 时刻(https://thezvi.substack.com/p/deepseek-r1-0528-did-not-have-a-moment)以来,当时 DeepSeek 落后大约八个月,但通过快速跟进在关键方面赶超,我们一直在波动。一段时间内,中国似乎落后很多。GLM-5.2 和 Kimi K3 令人印象深刻。目前对时间差的最佳估计处于最低点。AI 领域的事件全面加速,因此尚不清楚产品周期的差距是否比以前更小,我有些预计下周会再次因 Qwen 而重演这一切。
Kimi K3 是 2.8T,似乎仍然落后于 4 月 7 日宣布的 Mythos Preview,因此这提供了一个三个月差距的下限起点。
> Ethan Mollick (https://x.com/emollick/status/2078132339029180788):正如我一直所说,Kimi 是一款非常好的模型。但它不是 DeepSeek r1 时刻,因为它大致处于我预期的曲线上,而不是一次意外的飞跃。由于各种原因,它将被视为 DeepSeek 时刻(https://thezvi.substack.com/p/deepseek-r1-0528-did-not-have-a-moment),尤其是随着更多人听说它。
Ryan Greenblatt 尽管对 Kimi K3 感到惊喜,但基于前向传递计算,估计其预训练质量大约介于 Opus 4 和 Opus 4.5 之间(https://x.com/RyanGreenblatt/status/2077948135763268043),加上一些其他优势,所以大约落后 8 个月,正如人们所料。后训练更接近,至少部分是由于蒸馏。Moonshot 显然在创新,但也明显在进行蒸馏,既有直接蒸馏,也有通过观察输出和复制技术进行快速跟进。
英国 AISI 发布了一份关于 Kimi K3 之前所有内容的报告(https://x.com/AISecurityInst/status/2078103148665667648),显示在狭隘网络任务上的时间差距随着时间的推移略有缩小。他们的完整报告在这里。(https://www.aisi.gov.uk/blog/how-far-behind-the-frontier-are-leading-open-weight-models-on-cyber)
我的理解是,狭隘且相对简单的编程任务是开源权重模型相对最强的领域,这里的基准测试已接近饱和。事实上,当你阅读完整的文章时,你会对更长的任务得到不同的答案。
> UKAI Sec
相似文章
Kimi K3,以及我们还能从pelican基准测试中学到什么
中国AI实验室Moonshot AI发布了Kimi K3,一个2.8万亿参数的开源权重模型,声称这是首个开源的3T级模型,并在多个基准测试中击败了多个领先模型。文章还讨论了该模型的定价以及一个有趣的pelican SVG基准测试。
@EntelligenceAI: Kimi K3 将在几小时内发布,这可能是一年中最重要的开源模型发布之一。为什么…
Kimi K3 是 Moonshot 最新的开放权重模型,发布时具备新架构、智能体集群能力,并专注于长期智能体工作流,使其成为其他顶级模型的主要竞争者。
Moonshot 即将推出的 Kimi 3 有望缩小与 Anthropic 的 Opus 4.8 的差距
Moonshot AI 即将推出的 Kimi K3 模型拥有 2-3 万亿参数,预计将匹敌或超越 Anthropic 的 Opus 4.8,标志着中国开放权重 AI 模型的一大步。
@thealexker: Kimi-K3 发布中未被充分重视的亮点:> 早期 K3 编写了后期开发阶段的大部分内核 > 它…
Kimi.ai 发布了 Kimi K3,一个拥有 2.8 万亿参数的多模态模型,支持 100 万上下文,采用了新颖的 Delta Attention 和 Attention Residuals,以及包含 MiniTriton 编译器的自优化堆栈。该模型实现了最高 6.3 倍的解码速度提升和约 25% 的训练效率提升。
@eliebakouch: Kimi K3(总参数2.8万亿)是一个开源权重模型,与fable和gpt 5.6 sol竞争,同时价格便宜得多,……
Kimi K3 是一个开源权重的2.8万亿参数大语言模型,采用了线性注意力、潜在MoE和新激活函数等创新,以更低成本提供有竞争力的性能。