unsloth/Kimi-K3

Hugging Face Models Trending 模型

摘要

Kimi K3 是一个开放权重的 2.8T 参数原生多模态代理模型,具有新颖的架构(KDA、AttnRes),1M 词元上下文,以及开源的 MoE 框架。

Task: 图像-文本到文本 Tags: transformers, safetensors, kimi_k3, feature-extraction, compressed-tensors, unsloth, conversational, image-text-to-text, custom_code, base_model:moonshotai/Kimi-K3, base_model:quantized:moonshotai/Kimi-K3, license:other, eval-results, 8-bit, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:34

unsloth/Kimi-K3 · Hugging Face

来源:https://huggingface.co/unsloth/Kimi-K3 Kimi K3


聊天 (https://www.kimi.com/) 主页 (https://www.moonshot.ai/)

Hugging Face (https://huggingface.co/moonshotai) Twitter 关注 (https://twitter.com/kimi_moonshot) Discord (https://discord.gg/TYU2fdJykW) ModelScope (https://modelscope.cn/organization/moonshotai)

许可协议 (https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE)

📰技术博客 (https://www.kimi.com/blog/kimi-k3) | 📄完整报告 (https://github.com/MoonshotAI/Kimi-K3/blob/main/k3_tech_report.pdf)

1. 模型介绍

Kimi K3 是一个开放权重的原生多模态智能体模型,也是我们目前最强大的模型。它是一个基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建的 2.8T 参数模型,具备原生视觉能力和 100 万 token 的上下文窗口。它是全球首个开源的 3T 级别模型,专为长程编程、知识工作和推理等前沿智能任务而设计。

关键特性

  • 全新架构:Kimi K3 基于 Kimi Delta Attention (KDA) 和 Attention Residuals (AttnRes) 构建,并通过 Stable LatentMoE 框架扩展 MoE 稀疏性,从 896 个专家中激活 16 个——整体扩展效率相比 Kimi K2 提升约 2.5 倍。
  • 长程编程:在最少人工监督下运行,Kimi K3 能够维持长时间的工程会话,导航大型代码仓库,并编排终端工具——从 GPU 内核优化、编译器开发,到视觉闭环的游戏开发、CAD,甚至芯片设计。
  • 智能体知识工作:Kimi K3 推动了端到端的知识工作,能够生成包含交互式可视化、小部件和仪表盘的深度研究报告,以及动态设计和视频编辑,这一切得益于其原生多模态架构。
  • 原生多模态与长上下文:Kimi K3 在同一模型中理解文本、图像和视频,并支持 100 万 token 的上下文窗口。
  • 开放前沿权重:我们根据 Kimi K3 许可协议发布完整的 Kimi K3 模型权重,使前沿智能可用于研究、部署和进一步创新。

2. 模型摘要

属性详情
架构混合专家模型 (MoE)
总参数量2.8T
激活参数量104B
层数93
密集层数1
注意力层构成69 KDA + 24 Gated MLA
注意力隐藏维度7168
注意力头数96
潜在 MoE 维度3584
MoE 隐藏维度 (每专家)3072
专家数量896
每 Token 选择的专家数16
共享专家数量2
词表大小160K
上下文长度1048576
注意力机制KDA & Gated MLA
激活函数SiTU-GLU
视觉编码器MoonViT-V2
视觉编码器参数量401M
量化MXFP4 权重 / MXFP8 激活 (量化感知训练)
模态文本, 图像

3. 评估结果

基准测试Kimi K3 (max)Claude Fable 5 (max, 含降级)GPT-5.6 Sol (max)Claude Opus 4.8 (max)GPT-5.5 (xhigh)GLM-5.2 (max)
推理与知识
GPQA Diamond93.592.694.191.093.591.2
CritPt23.428.632.320.927.120.9
AA-LCR74.770.073.767.774.371.3
HLE-Full43.5 / 56.053.3 / 63.044.5 / 58.049.8 / 57.941.4 / 52.2
编程
DeepSWE67.570.073.059.067.046.2
ProgramBench77.876.877.671.970.863.7
Terminal-Bench 2.188.388.088.884.683.482.7
FrontierSWE81.286.671.366.764.967.3
SWE-Marathon42.035.039.040.014.013.0
PostTrainBench36.641.434.634.128.434.3
MLS-Bench-Lite48.349.946.242.835.540.4
SciCode58.760.256.153.556.150.5
Kimi Code Bench 2.072.976.964.871.769.064.2
智能体
BrowseComp91.288.090.484.384.4
DeepSearchQA (F1)95.094.293.1
ResearchRubrics76.273.873.564.071.1
GDPval-AA v2 (Elo)168617471736159314911510
Toolathlon-Verified76.577.974.976.273.559.9
MCPMark-Verified94.587.492.976.492.9
MCP-Atlas84.284.783.683.682.882.6
AutomationBench30.829.129.727.222.712.9
JobBench54.357.445.448.438.343.4
AA-Briefcase (Elo)154815831495135411581260
Agents’ Last Exam28.325.7†29.627.026.620.4
APEX-Agents41.043.339.939.438.535.6
OfficeQA Pro63.369.963.263.960.941.4
SpreadsheetBench 234.834.732.431.629.128.1
OSWorld-Verified84.885.083.083.479.0
OSWorld 2.058.366.162.655.749.5
SaaS-Bench60.161.456.143.8
τ3-Banking33.426.833.027.631.326.8
Harvey Lab-AA94.693.687.291.186.391.0
CorpFin v271.671.864.466.868.466.1
Finance Agent v254.456.353.853.951.849.7
Legal Research Bench44.249.548.143.840.431.3
视觉
WorldVQA ForceAnswer51.056.741.839.138.5
OmniDocBench91.189.885.887.989.4
PerceptionBench58.557.259.747.255.8
Video-MME (w. sub)90.089.586.089.3
MMVU82.181.279.281.7
BabyVision w/ python85.790.588.981.283.6
MMMU-Pro81.6 / 83.481.2 / 86.583.0 / 84.678.9 / 82.781.2 / 83.2
CharXiv (RQ)84.8 / 91.388.9 / 93.584.6 / 89.180.5 / 89.984.1 / 89.0
MathVision94.3 / 97.894.8 / 98.695.8 / 97.886.7 / 97.192.2 / 96.8
ZeroBench (pass@5)23.0 / 41.023.0 / 46.017.0 / 35.017.0 / 34.022.0 / 41.0

脚注 所有 Kimi K3 的结果均在推理强度设置为 “max” 且温度 = 1.0 的情况下获得。对于单步任务,如 GPQA Diamond、HLE-Full 以及不使用工具的视觉基准测试,我们设置 top-p = 0.95;对于智能体任务,我们设置 top-p = 1.0。对于 HLE-Full、MMMU-Pro、CharXiv (RQ)、MathVision 和 ZeroBench,每个单元格报告的是不使用工具和使用工具增强(HLE-Full 使用通用工具,视觉基准测试使用 Python)的分数,顺序依次为无工具/有工具。

  1. 推理与知识基准测试
  2. 编程基准测试
    • DeepSWE:Kimi K3 使用 Kimi Code 框架评估。GLM-5.2 的分数取自 GLM-5.2 发布博客;其余分数均来自官方 DeepSWE 排行榜,在该排行榜下,Kimi K3 使用 mini-SWE-agent 框架获得 67.3 分。我们报告的是 DeepSWE v1.1 任务。
    • Terminal-Bench 2.1:Kimi K3 使用 Kimi Code 框架评估。对于其他所有模型,我们报告各框架的最佳分数:GLM-5.2 使用 Claude Code(GLM-5.2 发布博客);Claude Opus 4.8 和 Claude Fable 5 使用 Terminus 2(Artificial Analysis);GPT-5.5 和 GPT-5.6 Sol 使用 Codex(OpenAI)。
    • ProgramBench:Kimi K3 使用 Kimi Code 框架评估。GLM-5.2 的分数来自 GLM-5.2 发布博客;其余分数均来自 Vals AI
    • SWE-Marathon:Kimi K3、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.6 Sol 使用 Codex 框架评估。GLM-5.2 的分数来自 GLM-5.2 发布博客。我们的评估基于一个针对 H20 校准过的分支(源自官方任务),截止日期 2026 年 7 月 9 日,早于最终 v1.1 版本发布:GPU 任务的 Docker 镜像、性能门控和参考预言机已针对 H20 重新校准,而正确性和反作弊验证器保持不变。此外,Claude Fable 5 在我们评估中有 35% 的任务触发了降级,这可能会对其测量性能产生负面影响。
    • FrontierSWE:Kimi K3 使用 Kimi Code 框架评估,GPT-5.6 Sol 使用 Codex 框架评估;其余结果均来自 FrontierSWE。优势分数使用官方评估脚本从原始分数重新计算,数据截至 2026 年 7 月 16 日。
    • PostTrainBench:GLM-5.2、GPT-5.5 和 Claude Opus 4.8 的分数采用官方 PostTrainBench 结果。Kimi K3、Claude Fable 5 和 GPT-5.6 Sol 使用官方 Harbor 实现,在最大推理强度下评估,并在 H20 GPU(而非官方设置中的 H100)上运行三次取平均值——Kimi K3 和 Claude Fable 5 使用 Claude Code 框架,GPT-5.6 Sol 使用 Codex 框架。
    • MLS-Bench-Lite:Kimi K3 使用 Kimi Code 框架评估;GLM-5.2 和 Claude 系列模型使用 Claude Code 框架评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架评估。
    • SciCode:分数引自 Artificial Analysis,截止日期 2026 年 7 月 23 日。
    • Kimi Code Bench 2.0(内部):Kimi K3 使用 Kimi Code 框架评估(使用 Claude Code 框架时获得 73.7 分);GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架评估。所有模型均在最大推理强度下评估,但 GPT-5.5 使用 “xhigh” 设置。由于该基准测试包含网络安全和安全相关任务,我们还披露了拒绝或降级任务的占比:Claude Fable 5 在 80 个任务中有 13 个降级和 1 个拒绝;GPT-5.6 Sol 的网络安全防护在 80 个任务中触发了 10 个拒绝;GPT-5.5 在 80 个任务中有 3 个拒绝。
  3. 智能体基准测试
    • OfficeQA Pro:每个测试用例向智能体提供整个 PDF 语料库,所有 PDF 均渲染为图像,不提供机器可读文本。
    • OfficeQA Pro 和 SpreadsheetBench 2:Kimi K3、GLM-5.2、Claude Opus 4.8 和 Claude Fable 5 使用 Claude Code 框架评估;GPT-5.5 和 GPT-5.6 Sol 使用 Codex 框架评估。
    • MCP-Atlas:所有模型在 500 个任务的公开子集上评估,上限为 100 轮交互,使用 Gemini 3.1 Pro 作为评判。
    • AutomationBench:所有模型在 600 个任务的公开子集上评估,其余设置遵循官方 GitHub 配置。
    • BrowseComp:我们采用在 300K token 时触发的上下文压缩策略。当使用完整的 1M token 上下文窗口且无上下文管理时,Kimi K3 获得 90.4 分。Claude Fable 5、Claude Opus 4.8、GPT-5.6 Sol 和 GPT-5.5 的结果引自 AnthropicOpenAI
    • GDPval-AA v2、AA-Briefcase、τ3-Banking、Harvey Lab-AA 和 APEX-Agents:分数引自 Artificial AnalysisAPEX-Agents 排行榜,截止日期 2026 年 7 月 23 日。对于 Harvey Lab-AA,我们报告准则通过率。
    • CorpFin v2、Finance Agent v2 和 Legal Research Bench:分数引自 Vals AI
    • Agents’ Last Exam:分数引自 官方排行榜,截止日期 2026 年 7 月 23 日;我们报告排行榜的首要通过率指标。在排行榜上,每个模型与特定框架配对:Kimi K3 使用 Kimi Code;GPT-5.6 Sol 和 GPT-5.5 使用 Codex;Claude Fable 5、Claude Opus 4.8 和 GLM-5.2 使用 Claude Code。† Claude Fable 5 的运行使用 xhigh 强度,其中 40% 的任务被标记为降级。
  4. 多模态基准测试
    • 除 ZeroBench 遵循官方设置运行五次外,所有多模态分数均为三次运行的平均值。MMMU-Pro 按照官方协议评估,保留原始输入顺序,并将图像前置到文本输入之前。
    • PerceptionBench 是一个内部基准测试,专注于原子视觉感知能力。

4. 原生 MXFP4 量化

Kimi K3 从 SFT 阶段开始应用量化感知训练,使用 MXFP4 权重和 MXFP8 激活,以实现广泛的硬件兼容性。

5. 部署

您可以通过选择 kimi-k3 在 https://platform.kimi.ai 上访问 Kimi K3 的 API,我们提供兼容 OpenAI/Anthropic 的 API。目前,建议在以下推理引擎上运行 Kimi K3:

  • vLLM (https://github.com/vllm-project/vllm) — 见 recipes
  • SGLang (https://github.com/sgl-project/sglang) — 见 cookbook
  • TokenSpeed (https://github.com/lightseekorg/tokenspeed) — 见 recipes

6. 模型使用

Kimi K3 始终启用思考,并将返回 reasoning_content。思考强度通过顶层 reasoning_effort 请求字段配置,支持 "low""high""max"(默认 "max")。

Kimi K3 在保留思考历史模式下训练。对于多轮对话和工具调用,Kimi K3 要求将由 API 返回的完整助手消息原样传回 messages——包括 reasoning_contenttool_calls,而不仅仅是 content

import openai

def chat_with_preserved_thinking(client: openai.OpenAI, model_name: str):
    messages = [
        {
            "role": "user",
            "content": "Tell me three random numbers."
        },
        {
            "role": "assistant",
            "reasoning_content": "I'll start by listing five numbers: 473, 921, 235, 215, 222, and I'll tell you the first three.",
            "content": "473, 921, 235"
        },
        {
            "role": "user",
            "content": "What are the other two numbers you have in mind?"
        }
    ]

    response = client.chat.completions.create(
        model=model_name,
        messages=messages,
        stream=False,
        max_tokens=4096,
        reasoning_effort="max",
    )
    # the assistant should mention 215 and 222 that appear in the prior reasoning content
    print(f"response: {response.choices[0].message.reasoning}")
    return response.choices[0].message.content

有关完整指南和示例(视觉输入、结构化输出、部分模式、工具选择、动态工具加载、上下文缓存),请参阅 Kimi K3 快速入门思考强度

编程智能体框架

Kimi K3 与 Kimi Code CLI 作为其智能体框架配合使用效果最佳。我们热忱邀请您尝试一下——在终端中运行 Kimi Code,并使用 /model 命令选择 Kimi K3。希望您喜欢使用 Kimi K3 进行构建,并期待您的反馈!


7. 许可协议

代码仓库和模型权重均根据 Kimi K3 许可协议 发布。


8. 联系我们

如果您有任何疑问,请通过 [email protected] 与我们联系。

unsloth/Kimi-K3 的模型树 (https://huggingface.co/docs/hub/model-cards#specifying-a-base-model)

评估结果 (https://huggingface.co/docs/hub/eval-results)

相似文章

Kimi K3 架构概述与笔记

Hacker News Top

Sebastian Raschka提供了开放权重的Kimi K3模型架构概述,重点介绍了其从480亿到2.8万亿参数的扩展、新的LatentMoE和注意力残差组件、移除RoPE改用NoPE,以及原生多模态支持。该模型强调推理效率,并达到前沿性能水平。

Kimi-K3 技术报告 [pdf]

Hacker News Top

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。

Kimi K3: 开放前沿智能

Hugging Face Daily Papers

Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。

Kimi K3: 开放前沿智能

Reddit r/LocalLLaMA

Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。