从第一性原理理解 Kimi K3:给任何想搞懂这个庞然大物的人推荐的阅读顺序

Reddit r/ArtificialInteligence 新闻

摘要

一份指南,推荐基础论文和 Kimi 模型报告的最佳阅读顺序,以理解 Moonshot AI 的 Kimi K3 架构,涵盖线性注意力、MoE 和残差连接。

每个人都在谈论 Kimi K3,但如果你直接跳进技术报告,很快就会意识到它建立在多年的研究之上——正如任何突破性成果一样!如果你想理解 Kimi 团队为之付出的工作,以下是我推荐的阅读顺序。 Linear Transformers Are Secretly Fast Weight Programmers 这是基础。这篇论文提供了对线性注意力最具影响力的解释之一,表明许多线性注意力机制可以被视为快速权重程序员。它没有将注意力纯粹视为两两 token 之间的交互,而是将线性注意力描述为一个持续更新联想记忆的系统。不理解这个视角,就很难理解为什么现代线性注意力架构再次变得有竞争力。 Gated DeltaNet (arXiv:2412.06464) 一旦你熟悉了线性注意力,就可以继续学习 Gated DeltaNet。这篇论文引入了门控 delta 更新机制,改进了长序列中状态的更新方式。该模型不是使用固定的更新规则,而是学习何时以及多少信息应该被写入记忆。后来出现在 Moonshot AI 工作中的许多想法都直接建立在这些状态更新概念之上。 Kimi Linear / Kimi Delta Attention (KDA) 这是 Moonshot AI 引入最终成为 Kimi K3 骨干架构的地方。Kimi Linear 提出了 Kimi Delta Attention (KDA),一种混合线性注意力架构,旨在结合线性注意力的效率,并在短上下文、长上下文和强化学习设置中达到与全注意力相当或更好的性能。理解 KDA 至关重要,因为 Kimi K3 就是建立在它之上的。 LatentMoE (arXiv:2601.18089) → Stable LatentMoE Kimi K3 不仅仅是关于注意力。它还显著推进了混合专家(MoE)设计。先从 LatentMoE 开始,它引入了一种潜在空间路由公式,能够在保持强大模型质量的同时实现更高的稀疏性。然后再研究 Stable LatentMoE,这是 Moonshot AI 对这些想法的演进,Kimi K3 使用它来高效扩展稀疏专家路由。在 K3 中,Stable LatentMoE 每个 token 激活 896 个路由专家中的 16 个,这有助于其报告的扩展效率提升。 Attention Residuals (arXiv:2603.15031) 自从 Transformer 被引入以来,残差连接基本上没有变化。Attention Residuals 提出了一个简单的问题:与其天真地把所有这些残差挤在一起,不如让模型自己决定如何使用残差网络呢?(感谢这个人正确地提出了这个问题:我的版本框架稍微有点错误) Kimi K3 采用这一机制来改善跨模型深度的信息流动,同时保持该方法在大规模训练中的实用性。 跟随 Kimi 模型的演进 最后,按顺序阅读 Kimi 模型报告: - Kimi K1.5 – 强化学习扩展与推理。 - Kimi K2 – 架构和训练流程的持续扩展。 - Kimi K2.5 – 多模态和智能体方面的改进。 - Kimi K3 – 将 Kimi Delta Attention、Attention Residuals、Stable LatentMoE、精炼的训练配方、基础设施进步和大规模强化学习整合到单个前沿模型中。 按顺序阅读这些报告,可以更容易地看到架构是如何演进的,而不是将 K3 视为一个孤立的发布。 最大的收获是,Kimi K3 并非一夜之间出现。它是多条研究线索汇聚的结果: • 线性注意力基础 • 更好的循环状态更新 • 更强的线性注意力架构(KDA) • 更可扩展的稀疏 MoE 路由 • 改进的残差连接 • 连续几代 Kimi 模型整合并精炼了这些想法 如果你打算深入研究 Kimi K3 技术报告,这条阅读路径将为你提供所需的背景,以理解为什么做出这些架构选择——而不只是它们是什么。
查看原文

相似文章

Kimi K3 架构概述与笔记

Hacker News Top

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。

Kimi K3 如何通过工程创新跻身前沿 [R]

Reddit r/MachineLearning

Moonshot 推出的 Kimi K3 是一款开放权重的模型,在 580 个模型中排名第四。其创新包括 Kimi Delta Attention(减少 KV 缓存内存)、Quantile Balancing(专家负载均衡)以及 AgentENV(高效 RL 训练沙盒)。