Kimi K3 架构概述与笔记

Hacker News Top 模型

摘要

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/28 18:27

# Kimi K3 架构笔记 原文链接:https://sebastianraschka.com/blog/2026/kimi-k3-architecture-notes.html 昨天发布的超大规模开源权重模型 Kimi K3 架构图,附带一些观察和思考。 1. 是的,看起来相对复杂,但它本质上是一个放大版的生产版本,基于他们去年发布的 **Kimi Linear 模型**(https://sebastianraschka.com/llm-architecture-gallery/#card-kimi-linear-48b-a3b)(规模从 48B 扩展到 2.8T;K3 是目前最大的开源权重模型)。 2. 与 Kimi Linear 相比,新增的一个组件是 **LatentMoE**(https://sebastianraschka.com/llm-architecture-gallery/latent-moe/)。我在下图中省略了它,因为已经很拥挤了,但它本质上与 Nemotron 3 Ultra 中的 LatentMoE 相同(如果你好奇,可以在我的 **LLM 架构图库**(https://sebastianraschka.com/llm-architecture-gallery/)中找到)。其思路是通过类似**多头潜在注意力**的方式来压缩大型线性层。 3. Kimi K3 的整体趋势(类似于 Nemotron 3、DeepSeek V4 等)也是追求更好的推理效率。也就是说,有许多组件被替换为效率优化的版本,例如:**MoE**(https://sebastianraschka.com/llm-architecture-gallery/moe/)→ LatentMoE,常规注意力 → 多头潜在注意力和 **Kimi Delta Attention**(https://sebastianraschka.com/llm-architecture-gallery/hybrid-attention/)。(我在我的**图库**(https://sebastianraschka.com/llm-architecture-gallery/)中也有简短教程和文章,如果你对更多细节感兴趣的话)。 4. 一个不属于效率优化的组件变更就是**注意力残差**。与 DeepSeek V4 使用 mHC 来改进残差路径类似,注意力残差也是一种改进残差路径的方式,但工作方式略有不同。例如,mHC 使残差路径更宽;而注意力残差(已在 Kimi Linear 中出现)则在层之间连接残差,连接本身使用注意力分数作为重要性/贡献权重。根据报告,它持续(略微)改进了验证损失和下游性能,同时在训练成本上增加约 4%,推理成本增加约 2%。 5. 有趣的是,Kimi K3 去掉了所有 RoPE 层,转而全部使用 **NoPE**(无位置编码)。(同样,这一点继承自 Kimi Linear)。而在其他架构中,最近的趋势是在局部注意力层(如**滑动窗口注意力**)中使用 RoPE,在全局层中使用 NoPE。之前也有一些架构全部使用 NoPE,但据我所知,这是首个达到前沿水平的此类模型。 6. Kimi K3 现在也原生支持多模态,非常棒! 技术报告中还有几个其他有趣的训练细节,但架构方面目前就这些。整体来说是一次非常出色的发布。 组合的 Kimi K3 架构图,包含 Kimi Delta Attention、门控多头潜在注意力、注意力残差、LatentMoE,以及基准对比 **图 1.** Kimi K3 架构及发布时的基准对比。详见架构图库中的 **K3**(https://sebastianraschka.com/llm-architecture-gallery/#card-kimi-k3)。来源:我的 **Substack 笔记** 网站版本(https://substack.com/@rasbt/note/c-303378576)。 ## 继续阅读 **本周几个值得关注的开源权重模型** 简要介绍六个新开源权重模型的架构,包括 Nanbeige 4.2、Laguna S 2.1、Motif-3-Beta、Solar Open 2、Antares 1B 和 BTL-3。(https://sebastianraschka.com/blog/2026/notable-open-weight-models-this-week.html) **《从零构建推理模型》列表 6.5 的更正** 针对《从零构建推理模型》第 198 页列表 6.5 中随机种子的简短更正说明。(https://sebastianraschka.com/blog/2026/reasoning-model-listing-6-5-correction.html) **Inkling:一个带有惊喜的新开源 975B MoE 模型** 关于 Thinking Machines Lab 的 975B Inkling 模型的简短笔记,包括基准测试、稀疏 MoE 设计、短卷积、RMSNorm 和位置偏置。(https://sebastianraschka.com/blog/2026/inkling-architecture-benchmark-notes.html)

相似文章

unsloth/Kimi-K3

Hugging Face Models Trending

Kimi K3 是一个开放权重的 2.8T 参数原生多模态代理模型,具有新颖的架构(KDA、AttnRes),1M 词元上下文,以及开源的 MoE 框架。

Kimi K3: 开放前沿智能

Reddit r/LocalLLaMA

Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。

发布 Kimi K3 模型权重和技术报告(2分钟阅读)

TLDR AI

Kimi Moonshot 发布了 Kimi K3,这是一个 2.8 万亿参数的多模态模型,拥有 100 万 token 的上下文窗口,以及 Kimi Delta Attention 和 Attention Residuals 等架构创新。公司声称其效率显著提升,在内部基准测试中超越了 Claude Opus 4.8 和 GPT-5.5。