@akshay_pachaar: 一个矩阵取代了KV缓存。(该技术100%开源)Kimi刚刚发布了K3,一个前沿规模的开源模型…
摘要
Kimi发布了K3,一个2.8T参数的开源模型,采用delta attention避免KV缓存增长,实现了百万token上下文窗口,内存成本线性增长。
查看缓存全文
缓存时间: 2026/07/24 23:16
一个矩阵取代了 KV 缓存。
(该技术 100% 开源)
Kimi 刚刚发布了 K3,一个处于前沿规模的开源模型。
它依赖于一种称为 Delta 注意力(delta attention)的新机制,该机制不维护不断增长的 KV 缓存。这就是它能够在不导致内存爆炸的情况下,拥有百万级 token 上下文的原因。
在理解 Delta 注意力之前,我们需要先理解注意力机制本身。
注意力机制本质上是一种查找。每个 token 都存储一个键(key),类似于地址,以及一个值(value),即该地址上的内容。为了构建其输出,一个 token 会发出一个查询(query),将其与序列中的每一个键进行匹配,并检索出那些键匹配上的值的混合体。这就是图表顶部所描绘的图景。
标准注意力机制会保留每一对键值对作为一个列表,每个 token 对应一个条目。这个列表就是 KV 缓存,它会随着序列增长而增长,因此每个新 token 都必须扫描整个列表来构建其输出。上下文长度翻倍,存储量和扫描量都会翻倍,这就是二次方成本和内存膨胀的根源。
Delta 注意力保留了查找操作,但丢弃了列表。整个历史信息被压缩成一个固定大小的矩阵,它仍然像一个查找表一样工作。给它一个键,它就会返回与该键关联的历史值。无论是一千个 token 还是一百万个 token,这个矩阵的大小都保持不变。
难点在于如何写入信息。你无法将一个新的键值对直接钉到一个固定大小的矩阵上,因为新的写入会覆盖旧的,导致信息模糊。Delta 规则通过每个 token 执行两步操作来解决这个问题,如图表底部所示。
→ 在写入之前先读取。它将新 token 的键交给矩阵,查看内存当前返回的值是什么,即内存对该地址的现有猜测。
→ 写入差值,而不是值本身。它将这个猜测与它实际想要存储的值进行比较,然后只写入它们之间的差距。这个差距就是 delta(差值),它修正旧的关联,而不是在上面叠加一个新的。
这个矩阵还允许旧条目随着时间的推移而淡化,因此一个固定大小的矩阵可以持续吸收长序列而不会填满。
这就是图表所描绘的转变。标准注意力通过保留所有内容来记忆,并支付二次方成本来重新扫描。Delta 注意力通过重写一个矩阵来记忆,并支付线性成本。
你确实会失去一些东西。一个压缩后的矩阵无法精确存储每个 token,因此对任何一个单独 token 的回忆都变成近似。这就是为什么生产模型会将两者交错使用:使用几个全注意力层进行精确查找,其余层则运行线性注意力。
两者的区别在于一个动词。标准注意力是追加,而 Delta 注意力是修正。
阅读更多:https://kimi.com/blog/kimi-k3
对于任何想要全面了解 KV 缓存的人,我写了一篇详细文章,引用如下。它从头开始解释 KV 缓存的工作原理,每一步都有图解说明。
Kimi K3 技术博客:开放前沿智能
来源:https://www.kimi.com/blog/kimi-k3 今天,我们推出 Kimi K3——这是我们能力最强的模型。Kimi K3 是一个基于我们创新的 Kimi Delta 注意力(KDA)和注意力残差(AttnRes)构建的 2.8T 参数模型,具备原生视觉能力和一百万 token 的上下文窗口。它是世界上首个开放的 3T 级模型,专为长时程编码、知识工作和推理等领域的前沿智能而设计。
尽管其整体性能仍落后于最强大的专有模型(Claude Fable 5 和 GPT 5.6 Sol),但 Kimi K3 在我们的评估套件中展示了前沿级别的性能,持续优于其他受测模型。
Kimi K3 现已可在 Kimi.com (https://www.kimi.com/)、Kimi Work (https://www.kimi.com/products/kimi-work)、Kimi Code (https://www.kimi.com/code) 和 Kimi API (https://platform.kimi.ai/) 上使用。发布之初,Kimi K3 默认使用最大思考力度,后续更新将引入低力度和高力度模式。我们目前正在与推理合作伙伴和开源维护者密切合作,以协调技术细节,确保在生态系统中的可靠部署。完整模型权重将于 2026 年 7 月 27 日发布。关于架构、训练和评估的更多细节将与 Kimi K3 技术报告一同发布。
一个开放的 3T 级模型
Kimi K3 是第一个达到 2.8 万亿参数的开源模型。这标志着 Kimi 在规模化前沿上持续推动的最新一步:在过去十二个月中的九个月里,Kimi 模型一直设定着开源模型规模的最高上限。
Kimi K3 基于 Kimi Delta 注意力(KDA)和注意力残差(AttnRes)构建,这两项架构更新旨在改善信息在序列长度和模型深度上的流动。我们还扩大了混合专家(MoE)的稀疏度,在与 Stable LatentMoE 框架配对时,有效地激活了 896 个专家中的 16 个。结合改进的训练和数据配方,这些结构变化使得与 Kimi K2 相比,整体扩展效率提高了约 2.5 倍,从而使模型能够更有效地将计算转化为智能。
αwKDAαwStable LatentMoEαwGated MLAαwStable LatentMoEwα3×1×Blockn−1Blockn−2Blockn−3EmbeddingRouterLinear12123NNormLinearShared ExpertRouted ExpertLinearConvL2LinearConvL2LinearConvσσLinearσKimi Delta AttentionNormLinearOutput## 编码能力
Kimi K3 拥有强大的长时程编码性能。在最少人类监督的情况下运行,它可以维持长时间的工程会话,导航大型代码仓库,并编排终端工具。
Kimi K3 在融合软件工程与视觉推理的任务中也表现出色——它利用截图和视觉信息来优化游戏开发、前端和 CAD。
以下案例研究展示了 Kimi K3 的编码能力如何转化为开放式软件创作和科学研究。
内核优化
我们测试了模型优化 GPU 内核的能力。每个模型在相同的沙盒环境中独立工作,拥有最多 24 小时来剖析、重写和基准测试四个任务,这些任务涵盖 AttnRes、KDA 以及一个跨 NVIDIA Hopper GPU 和来自替代供应商的 GPGPU 的 512 头维度 MLA 内核。Kimi K3 的性能与 Fable 5(含回退)相当,并显著优于 Opus 4.8、GPT 5.6 Sol 和 GPT 5.5。
Claude Fable 5 由第三方评估,其结果可能包含回退行为。在大多数模型中,某些过程包含微小的、可接受的精度捷径,这些仍在我们的数值容差范围内。GPGPU 指用于图形渲染之外的通用计算 GPU。
在 Kimi K3 开发的后期阶段,一个早期版本的 Kimi K3 处理了团队大部分的内核优化工作。
GPU 编译器开发
我们进一步测试了 Kimi K3 是否能从头开始构建一个 GPU 编程系统。Kimi K3 开发了 MiniTriton,一个紧凑的类 Triton 编译器,具有自己的 tile 级 IR 层(基于 MLIR)、优化 passes 和 PTX 代码生成流水线。在受支持的屋顶线基准测试中,MiniTriton 提供了与 Triton 和 torch.compile 相当或更优的性能——在某些工作负载上超越了 Triton。除了微基准测试,MiniTriton 还能以稳定的收敛性支撑端到端的 nanoGPT 训练,其损失曲线与参考值紧密吻合,仅有轻微偏差——这在实际工作负载上验证了整个流水线。这些结果表明,Kimi K3 能够构建一个连贯的端到端编译器——从 DSL 前端、IR passes 到 PTX 代码生成和运行时——而不仅仅是孤立的核函数;其从头开始的 Tensor Core 路径已经能够与 Triton 高度优化的堆栈相媲美。
MiniTriton CUDA-core roofline on NVIDIA L20
游戏开发和数字创作
Kimi K3 结合了强大的 3D 推理能力、编码能力和视觉能力,能将概念、图像和视频转化为完全可玩的互动体验。通过在代码和实时截图之间无缝迭代——即时查看并优化输出——Kimi K3 实现了真正的“视觉在环”。
芯片设计
作为一个早期的概念验证,Kimi K3 设计了一款芯片,用于服务一个基于自身架构构建的 nano 模型。在单次 48 小时的自主运行中,K3 使用开源 EDA 工具在 Nangate 45nm 库上构建、优化并验证了该芯片。在 4 mm² 的面积内,该芯片在 100 MHz 下满足时序收敛,并在仿真中维持超过 8700 tokens/s 的解码吞吐量,集成了 146 万个标准单元、0.277 MB 的 SRAM 和一个融合反量化的 INT4 MAC 阵列。一个由模型构建、服务于模型的芯片,反映了 K3 的长时程代理能力。
面向研究的编码
Kimi K3 连接了科学文献和可执行代码,能够自主实现、验证和分析复杂的计算研究流程。
在一个案例中,Kimi K3 在大约两小时内完成了通常需要经验丰富的研究人员一到两周才能完成的工作。为了重现计算天体物理学中的 I-Love-Q 普适关系,它审阅并交叉验证了 20 多篇论文,实现了完整的数值计算流水线,评估了 300 多种状态方程,识别了已发表公式中的不一致之处,生成了超过 3000 行 Python 代码,并制作了一个用于探索结果的交互式 HTML 仪表板。
知识工作
Kimi K3 推进了端到端的知识工作。除了公开基准测试外,Kimi K3(最大模式)在我们内部评估中展现出持续的性能提升,这些评估源自真实用户代理工作流中观察到的常见模式和挑战。这些在截然不同的面向生产的流程中表现出的持续优势,反映了 Kimi K3 代理知识工作能力的全面提升。
内部知识工作基准测试
带交互式可视化的研究
以下是一些例子,展示了 Kimi Work 中的 Kimi K3 在金融咨询和科学研究方面能产出什么:
案例 1:交互式 42 年 AI ASIC 行业研究网站
一个你可以深入探索的交互式研究报告:42 年的 ASIC 行业历史,通过超过 120 轮的递归自我改进创建。Kimi K3 将证据转化为定制的图表、动画图表和交互式视觉叙事。它通过超过 2.8k 次网络搜索/抓取和 1.1k+ 次终端数据拉取,在横跨 87 份季度报告和 99 份原始 PDF 的 11k+ 页面中提取了数据。
案例 2:聚变产业研究
一份带有交互式可视化的咨询风格行业报告——包括时间线、漏斗图、范围条形图、甘特图和出版级幻灯片。
案例 3:GWTC-5 引力波分析
使用 20 多个并发子代理对 391 个引力波事件进行分析,生成了 7 个科学可视化图表、2 个表格以及从 10 多篇论文中综合的文献综述。
Kimi K3 在制作信息图风格演示文稿方面也特别有效,例如下面展示的完全可编辑热力图和年度报告:
微件和仪表板
在 Kimi Work 中,我们引入了两个新功能——微件(Widgets)和仪表板(Dashboard)——它们使得与 Kimi K3 的交互更加可视化和持久化。微件允许你在聊天中直接生成交互式组件,并与本地数据或外部插件连接以进行持续更新。仪表板将你最关心的微件集中到一个围绕某个主题、项目或目标组织的持久的、个性化的视图中。
视频编辑
Kimi K3 在动态设计、动画和视频编辑方面表现出色,因为其原生多模态架构能够在同一模型内理解文本、图像和视频。
在一个例子中,K3 创建了一个 3Blue1Brown 风格的动态图形讲解视频,解释其自身架构,将技术理念转化为动画图表和转场。
在另一个例子中,Kimi K3 从 56 个源片段中编辑了自己的预告片视频,负责片段选择、运动匹配剪切、帧精确节拍同步、音频处理以及多轮修改。像这样一个高密度的短视频,通常需要经验丰富的编辑人员一到两个工作日,或者初学者三到五天。
架构和基础设施
Kimi K3 基于 Kimi Delta 注意力(KDA)和注意力残差(AttnRes)构建。KDA 为扩展注意力提供了高效的基石,而 AttnRes 则跨深度选择性地检索表示,而不是均匀地累积它们。它们共同构成了一个模型架构的骨干,旨在超越万亿参数级别进行扩展。
Kimi K3 使用 Stable LatentMoE,有效地激活了 896 个专家中的 16 个。在这种稀疏度下,路由和优化成为首要挑战。分位数平衡(Quantile Balancing)直接从路由器得分的分位数中推导专家分配,消除了启发式更新和敏感的平衡超参数;而按头 Muon(Per-Head Muon)则扩展了 Muon,通过独立优化注意力头来实现更自适应的大规模学习。Sigmoid Tanh 单元(SiTU)和门控 MLA(Gated MLA)分别改善了激活控制和注意力选择性。这些进步共同实现了在 2.8 万亿参数规模上的稳定高效训练。
Kimi K3 从 SFT 阶段开始应用量化感知训练,使用 MXFP4 权重和 MXFP8 激活以实现广泛的硬件兼容性。为了防止专家不平衡在大的专家并行规模下降低吞吐量,我们引入了一种完全平衡的专家并行训练方法,具有静态形状且在关键路径上无需主机同步。由于推理效率同样受益于更大的高带宽通信域,我们建议在具有 64 个或更多加速器的超节点配置上部署 Kimi K3。最后,由于 KDA 对传统的前缀缓存提出了新挑战,我们已向 vLLM 社区贡献了一个相应的实现,该实现将与模型一同发布。KDA 预填充缓存使我们能够以极具竞争力的 token 价格提供 Kimi K3 服务,尽管其规模庞大且上下文很长。
更多技术细节将在我们即将发布的报告中提供。
可用性
- Kimi K3 智能体:从您的移动应用商店下载或更新最新版 Kimi 应用,支持 iOS、Android 和 HarmonyOS,或访问 kimi.com (https://www.kimi.com/)。
- 使用 Kimi K3 工作:下载最新的 Kimi Work 桌面应用 (https://www.kimi.com/products/kimi-work),版本 3.1.0 或更高,适用于 Windows 和 Apple silicon Mac。
- 使用 Kimi K3 编程:在您的终端中运行 Kimi Code (https://www.kimi.com/code) 并使用
/model命令选择 Kimi K3。 - 使用 Kimi API 构建:访问 Kimi API 平台 (https://platform.kimi.ai/) 并选择
kimi-k3。定价为:缓存命中输入 $0.30/MTok,缓存未命中输入 $3.00/MTok,输出 $15.00/MTok。由 Mooncake 的解耦推理架构驱动,官方 Kimi API 在编码工作负载中的缓存命中率超过 90%。 - 将 Kimi 引入您的组织:Kimi Enterprise (https://www.kimi.com/membership/pricing) 提供企业级数据隐私和成员管理,个人账户与组织账户完全分离。访问定价页面,选择“获取 Kimi Enterprise”为您的团队订阅。
完整基准测试表
以下报告的所有 Kimi K3 结果均在推理努力度设置为“最大”、温度(temperature)= 1.0 和 top-p = 1.0 的情况下获得。根据基准测试的不同,每个模型在三种代理工具之一(KimiCode、Claude Code 或 Codex)下进行评估,具体如下表注释所示。
编码基准测试
- DeepSWE. Kimi K3 使用 KimiCode 工具进行评估。GLM-5.2 的分数取自 GLM-5.2 发布博客 (https://z.ai/blog/glm-5.2);其余所有分数均来自官方 DeepSWE 排行榜 (https://deepswe.datacurve.ai/),在该排行榜下,Kimi K3 使用 mini-SWE-agent 工具达到了 67.3 分。我们报告的是 D
相似文章
@thealexker: Kimi-K3 发布中未被充分重视的亮点:> 早期 K3 编写了后期开发阶段的大部分内核 > 它…
Kimi.ai 发布了 Kimi K3,一个拥有 2.8 万亿参数的多模态模型,支持 100 万上下文,采用了新颖的 Delta Attention 和 Attention Residuals,以及包含 MiniTriton 编译器的自优化堆栈。该模型实现了最高 6.3 倍的解码速度提升和约 25% 的训练效率提升。
Kimi K3: 开放前沿智能
Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。
稀疏设计(5分钟阅读)
Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。
@Michaelzsguo: KV缓存是模型在生成期间的工作记忆。随着上下文窗口变长,模型必须保留更多…
DeepSeek的KV缓存压缩创新,包括MLA和CSA/HCA,将KV缓存大小减少了93%,实现了高效的长上下文推理和基于SSD的缓存,正如antirez的ds4.c项目所展示的那样。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2074502882812952666
一份关于KV缓存管理的实践指南,介绍开源LMCache架构,该架构通过消除代理工作流中的冗余上下文处理,将输入令牌成本降低90%,并将LLM推理速度提升高达14倍。