Kimi K3的设计秘密可能在其思考痕迹中(6分钟阅读)
摘要
Kimi K3是Moonshot AI最新的开放权重模型,通过使用极端的推理令牌并在其思维链中模拟智能体工作流来迭代设计,从而实现了顶尖性能。
Kimi K3使用了极大量的思考令牌。它的推理量是Claude Opus 4.8的12倍以上,是Kimi K2.6的两倍多。该模型的性能主要源于其独特的思维链方法,它像完整的AI智能体一样迭代设计,但这一切都在其思维链内部进行。本文通过分析Kimi K3的思考痕迹来解释模型的性能。
查看缓存全文
缓存时间: 2026/07/24 17:01
# Kimi K3 的设计秘诀,或许藏在它的思考轨迹里
来源: https://notes.designarena.ai/kimi-k3s-design-secret-may-be-in-its-thinking-traces/
Kimi K3,Moonshot AI 最新推出的开放权重¹模型,在单轮 Frontend Arena 排行榜上以 1392 的 Elo 分数位列第一。这比 Kimi K2.6 高出 10 个名次,比 Kimi K2.7 Code 高出 16 个名次,是我们在 Moonshot 模型系列中见过的最大跃升。
然而,我们发现 Kimi K3 的思考 token 用量极其夸张,**比 Claude Opus 4.8 多出 12 倍以上的推理**,**是 Kimi K2.6 的两倍多**。
这实在是*大量*的推理,因此我们决定深入探究,看看 Kimi K3 到底在思考些什么。
我们发现,Kimi K3 的性能主要归功于其**独特的思维链方法**——它仿佛在思维链内部**像完整 AI 智能体那样迭代改进设计**,而这种策略正是其性能提升的关键。这种策略能够生成复杂、有目的性的网站,具备创意性的组件设计,同时还提升了 Kimi K3 与外部依赖项集成能力。
## Kimi K3 如何在思维链中模拟智能体
只需快速浏览 Kimi K3 的思考轨迹,就能解释其性能表现。Kimi K3 拥有独特的多阶段思考轨迹:它会从规划切换到决策,再到设计最终网站的各个部分。这正是智能体的工作流程——一种我们从未见过的模式。事实上,在最终设计阶段,Kimi K3 会写出示例代码,以便在最终生成时能够正确创建它精心设计的交互效果。
相比之下,该模型系列中的前代模型的推理轨迹要短得多,而且很少编写代码。它们通常只决定高层次的细节或板块,然后就直接跳转到最终输出。
如果我们汇总 Kimi 模型的所有生成结果,就会发现 K3 在推理过程中编写的代码量,是其同系列任何其他模型的 10 倍以上——**花在编码上的推理 token 甚至比实际推理的还多**。
没有其他模型在推理时会有如此密集的代码块,这是因为 Kimi K3 在推理过程中**针对每个组件进行迭代**,进行“思维测试”,而不是像在智能体循环中那样使用常规测试。这也意味着 Kimi K3 实际上是在用代码思考,将计划的规格说明以代码和具体约束的形式表达,而不是制定一个模糊的计划。
没有其他大模型会在推理阶段同时进行这种高层次规划和低层次迭代,因为这种策略会增加思考时间,而不是直接工作。通过选择这种推理轨迹策略,Kimi K3 刻意生成结果——消耗更多 token 但效果更好,本质上是用 token 换取智能。这使得生成速度变慢,但偏好分数更高,从而在偏好度 vs. 速度图表上开创了新的帕累托前沿。
## Kimi K3 的思考能力驾驭了 Unsplash 图片
然而,Kimi K3 还有一件秘密武器:对训练数据卓越的索引能力。通常,推理比智能体流程要弱,因为智能体无法使用网络搜索等工具来更新内部思考。但对 Kimi K3 而言,其学习到的互联网索引非常强大,以至于它可以直接检查自己的思维索引,判断刚输出的推理是否是最新且正确的。下面是一个例子:Kimi K3 使用 Unsplash(一个免费图片提供商,模型常用它来寻找主视觉和其他填充图片)时的表现。上方是思维链推理过程,下方是模型生成 ID 时想到的 Unsplash CDN 图片。
**Kimi K3 思考它想要什么图片,一次性给出该图片的 Unsplash ID,然后思考这个 Unsplash ID 是否真的有效,再决定是否使用它。**
0:00
/0:20
这意味着 Kimi K3 在为自己的网站寻找图片方面异常出色。下面是上述思维链生成的网站。
0:00
/0:21
其他模型(如 Fable 5)不像 Kimi K3 那样充分利用自己学习到的索引,也不会对生成的图片进行如此深入的推理。下面是 Kimi K3 与其他模型的一些生成示例对比:Kimi K3 没有漏掉任何图片装饰,而 Claude Fable 5 和 Kimi K2.7 Code 则不得不依赖替代文本和默认值。
0:00
/0:15
这种思考也延伸到了依赖项的使用上:Kimi K3 之所以能创建出更流畅的滚动动画、图表和前端用户界面,仅仅是因为它在推理过程中思考了如何使用这些依赖项。
## 这对模型选择意味着什么
Kimi K3 是设计改进方面的一大步,也是整个开源模型领域的巨大飞跃。像这样的发布提醒我们,开源前沿领域的进展有多快,以及开源模型如何能够提出新想法,推动所有人前进。每一次这样的发布,都为研究人员和开发者提供了更强大的起点,让他们能够在此基础上继续前进。
我们将继续监测 Kimi K3 的性能,并关注它与其他模型的对比。祝贺 Moonshot AI 团队发布这一模型。您是否喜欢 Kimi K3 胜过其他模型?欢迎在 DesignArena.ai (http://designarena.ai/?ref=notes.designarena.ai) 上亲自体验。
*想获得这样的见解?加入我们:* intelligence.ai (https://www.intelligence.ai/careers?ref=notes.designarena.ai) 。
¹ *开放权重将于 2026 年 7 月 27 日前发布。* (https://x.com/Kimi_Moonshot/status/2077830229968683203?s=20&ref=notes.designarena.ai)
相似文章
关于Kimi K3:其能力与相关不满(70分钟阅读)
Kimi K3是Moonshot AI推出的2.8T参数开放模型,基准测试表现强劲,但可能过度优化,且落后顶级闭源模型数月。它从Claude蒸馏而来,其发布可能先于IPO。
@EntelligenceAI: Kimi K3 将在几小时内发布,这可能是一年中最重要的开源模型发布之一。为什么…
Kimi K3 是 Moonshot 最新的开放权重模型,发布时具备新架构、智能体集群能力,并专注于长期智能体工作流,使其成为其他顶级模型的主要竞争者。
reteetzad/Kimi-K3
Kimi K3 是 Moonshot AI 即将推出的开放前沿模型,采用混合专家架构,具备原生智能体能力及增强型代码理解上下文,计划于 2026 年 7 月 27 日发布。
Kimi K3,以及我们还能从pelican基准测试中学到什么
中国AI实验室Moonshot AI发布了Kimi K3,一个2.8万亿参数的开源权重模型,声称这是首个开源的3T级模型,并在多个基准测试中击败了多个领先模型。文章还讨论了该模型的定价以及一个有趣的pelican SVG基准测试。
Kimi K3: 开放前沿智能
Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。