unsloth/Kimi-K3
摘要
Kimi K3 是一个开放权重的 2.8T 参数原生多模态代理模型,具有新颖的架构(KDA、AttnRes),1M 词元上下文,以及开源的 MoE 框架。
查看缓存全文
缓存时间: 2026/07/28 06:34
unsloth/Kimi-K3 · Hugging Face
来源:https://huggingface.co/unsloth/Kimi-K3 Kimi K3
聊天 (https://www.kimi.com/) 主页 (https://www.moonshot.ai/)
Hugging Face (https://huggingface.co/moonshotai) Twitter 关注 (https://twitter.com/kimi_moonshot) Discord (https://discord.gg/TYU2fdJykW) ModelScope (https://modelscope.cn/organization/moonshotai)
许可协议 (https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE)
📰技术博客 (https://www.kimi.com/blog/kimi-k3) | 📄完整报告 (https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf)
1. 模型介绍
Kimi K3 是一个开放权重的原生多模态智能体模型,也是我们目前最强大的模型。它是一个基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建的 2.8T 参数模型,具备原生视觉能力和 100 万 token 的上下文窗口。它是全球首个开源的 3T 级别模型,专为长程编程、知识工作和推理等前沿智能任务而设计。
关键特性
- 全新架构:Kimi K3 基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建,并通过 Stable LatentMoE 框架扩展 MoE 稀疏性,从 896 个专家中激活 16 个——整体扩展效率相比 Kimi K2 提升约 2.5 倍。
- 长程编程:在最少人工监督下运行,Kimi K3 能够维持长时间的工程会话,导航大型代码仓库,并编排终端工具——从 GPU 内核优化、编译器开发,到视觉闭环的游戏开发、CAD,甚至芯片设计。
- 智能体知识工作:Kimi K3 推动了端到端的知识工作,能够生成包含交互式可视化、小部件和仪表盘的深度研究报告,以及动态设计和视频编辑,这一切得益于其原生多模态架构。
- 原生多模态与长上下文:Kimi K3 在同一模型中理解文本、图像和视频,并支持 100 万 token 的上下文窗口。
- 开放前沿权重:我们根据 Kimi K3 许可协议发布完整的 Kimi K3 模型权重,使前沿智能可用于研究、部署和进一步创新。
2. 模型摘要
| 属性 | 详情 |
|---|---|
| 架构 | 混合专家模型 (MoE) |
| 总参数量 | 2.8T |
| 激活参数量 | 104B |
| 层数 | 93 |
| 密集层数 | 1 |
| 注意力层构成 | 69 KDA + 24 Gated MLA |
| 注意力隐藏维度 | 7168 |
| 注意力头数 | 96 |
| 潜在 MoE 维度 | 3584 |
| MoE 隐藏维度 (每专家) | 3072 |
| 专家数量 | 896 |
| 每 Token 选择的专家数 | 16 |
| 共享专家数量 | 2 |
| 词表大小 | 160K |
| 上下文长度 | 1048576 |
| 注意力机制 | KDA & Gated MLA |
| 激活函数 | SiTU-GLU |
| 视觉编码器 | MoonViT-V2 |
| 视觉编码器参数量 | 401M |
| 量化 | MXFP4 权重 / MXFP8 激活 (量化感知训练) |
| 模态 | 文本, 图像 |
3. 评估结果
| 基准测试 | Kimi K3 (max) | Claude Fable 5 (max, 含降级) | GPT-5.6 Sol (max) | Claude Opus 4.8 (max) | GPT-5.5 (xhigh) | GLM-5.2 (max) |
|---|---|---|---|---|---|---|
| 推理与知识 | ||||||
| GPQA Diamond | 93.5 | 92.6 | 94.1 | 91.0 | 93.5 | 91.2 |
| CritPt | 23.4 | 28.6 | 32.3 | 20.9 | 27.1 | 20.9 |
| AA-LCR | 74.7 | 70.0 | 73.7 | 67.7 | 74.3 | 71.3 |
| HLE-Full | 43.5 / 56.0 | 53.3 / 63.0 | 44.5 / 58.0 | 49.8 / 57.9 | 41.4 / 52.2 | — |
| 编程 | ||||||
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| ProgramBench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Terminal-Bench 2.1 | 88.3 | 88.0 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| SWE-Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
| PostTrainBench | 36.6 | 41.4 | 34.6 | 34.1 | 28.4 | 34.3 |
| MLS-Bench-Lite | 48.3 | 49.9 | 46.2 | 42.8 | 35.5 | 40.4 |
| SciCode | 58.7 | 60.2 | 56.1 | 53.5 | 56.1 | 50.5 |
| Kimi Code Bench 2.0 | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 | 64.2 |
| 智能体 | ||||||
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| DeepSearchQA (F1) | 95.0 | 94.2 | — | 93.1 | — | — |
| ResearchRubrics | 76.2 | — | 73.8 | 73.5 | 64.0 | 71.1 |
| GDPval-AA v2 (Elo) | 1686 | 1747 | 1736 | 1593 | 1491 | 1510 |
| Toolathlon-Verified | 76.5 | 77.9 | 74.9 | 76.2 | 73.5 | 59.9 |
| MCPMark-Verified | 94.5 | 87.4 | 92.9 | 76.4 | 92.9 | — |
| MCP-Atlas | 84.2 | 84.7 | 83.6 | 83.6 | 82.8 | 82.6 |
| AutomationBench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| JobBench | 54.3 | 57.4 | 45.4 | 48.4 | 38.3 | 43.4 |
| AA-Briefcase (Elo) | 1548 | 1583 | 1495 | 1354 | 1158 | 1260 |
| Agents’ Last Exam | 28.3 | 25.7† | 29.6 | 27.0 | 26.6 | 20.4 |
| APEX-Agents | 41.0 | 43.3 | 39.9 | 39.4 | 38.5 | 35.6 |
| OfficeQA Pro | 63.3 | 69.9 | 63.2 | 63.9 | 60.9 | 41.4 |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 | 29.1 | 28.1 |
| OSWorld-Verified | 84.8 | 85.0 | 83.0 | 83.4 | 79.0 | — |
| OSWorld 2.0 | 58.3 | 66.1 | 62.6 | 55.7 | 49.5 | — |
| SaaS-Bench | 60.1 | — | 61.4 | 56.1 | 43.8 | — |
| τ3-Banking | 33.4 | 26.8 | 33.0 | 27.6 | 31.3 | 26.8 |
| Harvey Lab-AA | 94.6 | 93.6 | 87.2 | 91.1 | 86.3 | 91.0 |
| CorpFin v2 | 71.6 | 71.8 | 64.4 | 66.8 | 68.4 | 66.1 |
| Finance Agent v2 | 54.4 | 56.3 | 53.8 | 53.9 | 51.8 | 49.7 |
| Legal Research Bench | 44.2 | 49.5 | 48.1 | 43.8 | 40.4 | 31.3 |
| 视觉 | ||||||
| WorldVQA ForceAnswer | 51.0 | 56.7 | 41.8 | 39.1 | 38.5 | — |
| OmniDocBench | 91.1 | 89.8 | 85.8 | 87.9 | 89.4 | — |
| PerceptionBench | 58.5 | 57.2 | 59.7 | 47.2 | 55.8 | — |
| Video-MME (w. sub) | 90.0 | — | 89.5 | 86.0 | 89.3 | — |
| MMVU | 82.1 | — | 81.2 | 79.2 | 81.7 | — |
| BabyVision w/ python | 85.7 | 90.5 | 88.9 | 81.2 | 83.6 | — |
| MMMU-Pro | 81.6 / 83.4 | 81.2 / 86.5 | 83.0 / 84.6 | 78.9 / 82.7 | 81.2 / 83.2 | — |
| CharXiv (RQ) | 84.8 / 91.3 | 88.9 / 93.5 | 84.6 / 89.1 | 80.5 / 89.9 | 84.1 / 89.0 | — |
| MathVision | 94.3 / 97.8 | 94.8 / 98.6 | 95.8 / 97.8 | 86.7 / 97.1 | 92.2 / 96.8 | — |
| ZeroBench (pass@5) | 23.0 / 41.0 | 23.0 / 46.0 | 17.0 / 35.0 | 17.0 / 34.0 | 22.0 / 41.0 | — |
脚注 所有 Kimi K3 的结果均在推理强度设置为 “max” 且温度 = 1.0 的情况下获得。对于单步任务,如 GPQA Diamond、HLE-Full 以及不使用工具的视觉基准测试,我们设置 top-p = 0.95;对于智能体任务,我们设置 top-p = 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格报告的是不使用工具和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的分数,顺序依次为无工具/有工具。
- 推理与知识基准测试
- CritPt 和 AA-LCR:分数引自 Artificial Analysis,截止日期 2026 年 7 月 23 日。
- 编程基准测试
- DeepSWE:Kimi K3 使用 Kimi Code 框架评估。GLM-5.2 的分数取自 GLM-5.2 发布博客;其余分数均来自官方 DeepSWE 排行榜,在该排行榜下,Kimi K3 使用 mini-SWE-agent 框架获得 67.3 分。我们报告的是 DeepSWE v1.1 任务。
- Terminal-Bench 2.1:Kimi K3 使用 Kimi Code 框架评估。对于其他所有模型,我们报告各框架的最佳分数:GLM-5.2 使用 Claude Code(GLM-5.2 发布博客);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(Artificial Analysis);GPT-5.5 和 GPT-5.6 Sol 使用 Codex(OpenAI)。
- ProgramBench:Kimi K3 使用 Kimi Code 框架评估。GLM-5.2 的分数来自 GLM-5.2 发布博客;其余分数均来自 Vals AI。
- SWE-Marathon:Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.6 Sol 使用 Codex 框架评估。GLM-5.2 的分数来自 GLM-5.2 发布博客。我们的评估基于一个针对 H20 校准过的分支(源自官方任务),截止日期 2026 年 7 月 9 日,早于最终 v1.1 版本发布:GPU 任务的 Docker 镜像、性能门控和参考预言机已针对 H20 重新校准,而正确性和反作弊验证器保持不变。此外,Claude Fable 5 在我们评估中有 35% 的任务触发了降级,这可能会对其测量性能产生负面影响。
- FrontierSWE:Kimi K3 使用 Kimi Code 框架评估,GPT-5.6 Sol 使用 Codex 框架评估;其余结果均来自 FrontierSWE。优势分数使用官方评估脚本从原始分数重新计算,数据截至 2026 年 7 月 16 日。
- PostTrainBench:GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 PostTrainBench 结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现,在最大推理强度下评估,并在 H20 GPU(而非官方设置中的 H100)上运行三次取平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code 框架,GPT-5.6 Sol 使用 Codex 框架。
- MLS-Bench-Lite:Kimi K3 使用 Kimi Code 框架评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 框架评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架评估。
- SciCode:分数引自 Artificial Analysis,截止日期 2026 年 7 月 23 日。
- Kimi Code Bench 2.0(内部):Kimi K3 使用 Kimi Code 框架评估(使用 Claude Code 框架时获得 73.7 分);GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架评估。所有模型均在最大推理强度下评估,但 GPT-5.5 使用 “xhigh” 设置。由于该基准测试包含网络安全和安全相关任务,我们还披露了拒绝或降级任务的占比:Claude Fable 5 在 80 个任务中有 13 个降级和 1 个拒绝;GPT-5.6 Sol 的网络安全防护在 80 个任务中触发了 10 个拒绝;GPT-5.5 在 80 个任务中有 3 个拒绝。
- 智能体基准测试
- OfficeQA Pro:每个测试用例向智能体提供整个 PDF 语料库,所有 PDF 均渲染为图像,不提供机器可读文本。
- OfficeQA Pro 和 SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架评估。
- MCP-Atlas:所有模型在 500 个任务的公开子集上评估,上限为 100 轮交互,使用 Gemini 3.1 Pro 作为评判。
- AutomationBench:所有模型在 600 个任务的公开子集上评估,其余设置遵循官方 GitHub 配置。
- BrowseComp:我们采用在 300K token 时触发的上下文压缩策略。当使用完整的 1M token 上下文窗口且无上下文管理时,Kimi K3 获得 90.4 分。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引自 Anthropic 和 OpenAI。
- GDPval-AA v2、AA-Briefcase、τ3-Banking、Harvey Lab-AA 和 APEX-Agents:分数引自 Artificial Analysis 和 APEX-Agents 排行榜,截止日期 2026 年 7 月 23 日。对于 Harvey Lab-AA,我们报告准则通过率。
- CorpFin v2、Finance Agent v2 和 Legal Research Bench:分数引自 Vals AI。
- Agents’ Last Exam:分数引自 官方排行榜,截止日期 2026 年 7 月 23 日;我们报告排行榜的首要通过率指标。在排行榜上,每个模型与特定框架配对:Kimi K3 使用 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 使用 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 使用 Claude Code。† Claude Fable 5 的运行使用 xhigh 强度,其中 40% 的任务被标记为降级。
- 多模态基准测试
- 除 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 按照官方协议评估,保留原始输入顺序,并将图像前置到文本输入之前。
- PerceptionBench 是一个内部基准测试,专注于原子视觉感知能力。
4. 原生 MXFP4 量化
Kimi K3 从 SFT 阶段开始应用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以实现广泛的硬件兼容性。
5. 部署
您可以通过选择
kimi-k3在 https://platform.kimi.ai 上访问 Kimi K3 的 API,我们提供兼容 OpenAI/Anthropic 的 API。目前,建议在以下推理引擎上运行 Kimi K3:
- vLLM (https://github.com/vllm-project/vllm) — 见 recipes
- SGLang (https://github.com/sgl-project/sglang) — 见 cookbook
- TokenSpeed (https://github.com/lightseekorg/tokenspeed) — 见 recipes
6. 模型使用
Kimi K3 始终启用思考,并将返回 reasoning_content。思考强度通过顶层 reasoning_effort 请求字段配置,支持 "low"、"high" 和 "max"(默认 "max")。
Kimi K3 在保留思考历史模式下训练。对于多轮对话和工具调用,Kimi K3 要求将由 API 返回的完整助手消息原样传回 messages——包括 reasoning_content 和 tool_calls,而不仅仅是 content:
import openai
def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
messages = [
{
"role": "user",
"content": "Tell me three random numbers."
},
{
"role": "assistant",
"reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
"content": "473, 921, 235"
},
{
"role": "user",
"content": "What are the other two numbers you have in mind?"
}
]
response = client.chat.completions.create(
model=model_name,
messages=messages,
stream=False,
max_tokens=4096,
reasoning_effort="max",
)
# the assistant should mention 215 and 222 that appear in the prior reasoning content
print(f"response: {response.choices[0].message.reasoning}")
return response.choices[0].message.content
有关完整指南和示例(视觉输入、结构化输出、部分模式、工具选择、动态工具加载、上下文缓存),请参阅 Kimi K3 快速入门 和 思考强度。
编程智能体框架
Kimi K3 与 Kimi Code CLI 作为其智能体框架配合使用效果最佳。我们热忱邀请您尝试一下——在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3。希望您喜欢使用 Kimi K3 进行构建,并期待您的反馈!
7. 许可协议
代码仓库和模型权重均根据 Kimi K3 许可协议 发布。
8. 联系我们
如果您有任何疑问,请通过 [email protected] 与我们联系。
unsloth/Kimi-K3 的模型树 (https://huggingface.co/docs/hub/model-cards#specifying-a-base-model)
评估结果 (https://huggingface.co/docs/hub/eval-results)
相似文章
Kimi K3 架构概述与笔记
Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。
Kimi-K3 技术报告 [pdf]
MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。
@eliebakouch: Kimi K3(总参数2.8万亿)是一个开源权重模型,与fable和gpt 5.6 sol竞争,同时价格便宜得多,……
Kimi K3 是一个开源权重的2.8万亿参数大语言模型,采用了线性注意力、潜在MoE和新激活函数等创新,以更低成本提供有竞争力的性能。
Kimi K3: 开放前沿智能
Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。
Kimi K3: 开放前沿智能
Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。