有人试过Q1 Kimi K3吗?(555GB)
摘要
Kimi K3是一个庞大的2.9万亿参数混合专家模型,拥有1040亿活跃参数,100万上下文长度,原生支持MXFP4训练,现已提供从540GB到更小尺寸的GGUF量化版本,但运行需要强大的硬件。
查看缓存全文
缓存时间: 2026/07/29 05:57
AtomicChat/Kimi-K3-GGUF · Hugging Face
来源:https://huggingface.co/AtomicChat/Kimi-K3-GGUF
这是对 moonshotai/Kimi-K3(https://huggingface.co/moonshotai/Kimi-K3)的 GGUF 量化版本,镜像存储在 AtomicChat/Kimi-K3(https://huggingface.co/AtomicChat/Kimi-K3)中。
Kimi K3 是一个约 2.9T 参数(104B 活跃)的混合专家模型:93 层,896 个专家,每 token 激活 16 个,隐藏层大小 7168,上下文长度 1M,原生采用 MXFP4 训练。原始模型仅提供 MXFP4 格式,因此这里的所有内容均来自直接的 MXFP4 到 Q8_0 转换,而更低比特的量化则基于该 Q8_0 进行重量化。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#honesty-first-this-thing-is-enormous 先说实话:这东西非常庞大
直言不讳地说,这是一个巨兽。我们制作的最小量化版本 IQ1_S(约 1.56 比特)仍然有大约 540 GB。这已经超过了即使是配置精良的机器所拥有的 512 GB 内存上限。要运行这些模型中的任何一个,你需要足够快的存储(RAM + VRAM 总和)来容纳整个文件。实际上,这意味着需要一台大内存的服务器或一套多 GPU 的严格配置,而不是笔记本电脑或大多数工作站。
我们知道大多数人无法在本地运行这些模型,这没关系。我们制作它们是为了那些少数能够运行的配置,为了那些想要探索模型的人,并且作为存档基础,以便当硬件或工具终于跟得上时,这些量化版本已经存在。经验法则:选择你的内存能够实际容纳的最大量化版本。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#does-it-even-work 它能正常工作吗?
能。在计算重要性矩阵时,我们在 calibration_datav3 上运行了一次完整的困惑度评估,Q3_K_S 的 PPL 为 3.85(上下文 512)。这是一个正常的数值。这意味着量化后的模型是连贯的,没有损坏(损坏的量化会导致困惑度达到几十甚至几百,或出现 NaN),并且 imatrix 中的专家覆盖率达到 99.4% 到 99.8%。
提醒一下:这个数值是在校准数据上测量的,因此请将其视为健康信号,而不是排行榜分数。当量化完成后,我们将在所有版本上运行适当的保留困惑度(wikitext)测试,并将结果表格直接放在这里。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#requirements 要求
kimi_k3 尚未进入主线的 llama.cpp,因此你需要构建我们添加了支持的 fork 版本。它位于此 PR 中:AtomicBot-ai/atomic-llama-cpp-turboquant#58(https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant/pull/58)。
git clone https://github.com/AtomicBot-ai/atomic-llama-cpp-turboquant
cd atomic-llama-cpp-turboquant
git fetch origin pull/58/head:kimi-k3 && git checkout kimi-k3
cmake -B build -DGGML_CUDA=OFF -DLLAMA_CURL=OFF
cmake --build build -j --target llama-cli
然后将 llama-cli 指向任何量化版本的第一个分片(其余分片会自动加载):
./build/bin/llama-cli -m ./IQ2_XXS/Kimi-K3-IQ2_XXS-00001-of-000NN.gguf -p "Hello"
普通的 llama.cpp 主线版本会因为这些文件出现未知架构错误而拒绝加载,直到 Kimi K3 支持被合入上游(跟踪:ggml-org/llama.cpp#26185(https://github.com/ggml-org/llama.cpp/pull/26185))。
目前仅支持文本模式。Kimi K3 是多模态的,但这些 GGUF 文件只包含语言模型本身,因此它们只能以文本到文本方式运行,图像输入暂时无法工作。我们正在积极进行视觉方面的开发:这需要同时具备一个 mmproj 文件(将 MoonViT 视觉塔转换为 GGUF 格式)以及 llama.cpp 的 clip/mtmd 代码中对 MoonViT 的支持。两者都在进行中。当视觉功能落地后,一个小的 mmproj 文件可以与上述的任何 LLM 量化版本配合使用,因此这里的所有文件无需重新下载。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#quants 量化版本
每个量化版本都是一个包含 45 GB 分片的文件夹。将 llama.cpp 指向第一个分片(...-00001-of-000NN.gguf),其余分片会自动加载。尚未上传的量化版本大小均为估算值。
| 文件夹 | 比特数 | 大小 | imatrix | 状态 | 备注 |
|---|---|---|---|---|---|
IQ1_S | 1.60 | ~555 GB | 是 | 已上传 | 最小、极端、质量较差 |
IQ1_M | 1.75 | ~610 GB | 是 | 计划中 | |
IQ2_XXS | 2.06 | ~715 GB | 是 | 计划中 | 2比特级别中尺寸与质量的最佳平衡 |
Q2_K | 2.9 | ~1009 GB | 否 | 已上传 | |
Q3_K_S | 3.4 | ~1196 GB | 否 | 上传中 | |
Q8_0 | 8.5 | ~2955 GB | 否 | 已上传 | 转换基础版本,用于存档和重量化,不适合运行 |
imatrix.dat | 不适用 | 小 | 不适用 | 已上传 | 重要性矩阵,见下文 |
我们有意跳过了中间的 i-quants(IQ2_XS、IQ2_S、IQ3、IQ4)。它们大约在 0.8 到 1.2 TB 范围内,正好与 Q2_K 和 Q3_K_S 重叠,而后者已经覆盖了该范围且更简单。上面的集合涵盖了有用的范围,没有不必要的重复。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#measured-quality-perplexity 测量质量(困惑度)
在 wikitext-2 测试集上的困惑度(上下文 512,50 个块)。数值越低越好。请仅将这些数值相互比较:绝对 PPL 只在同一模型、数据集和上下文内具有可比性。我们将在每个量化版本完成后填写此表格。
| 量化版本 | 比特数 | PPL(wikitext-2,上下文 512) |
|---|---|---|
| IQ1_S | 1.60 | 14.81 |
| IQ1_M | 1.75 | 等待中 |
| IQ2_XXS | 2.06 | 等待中 |
| Q2_K | 2.9 | 等待中 |
| Q3_K_S | 3.4 | 等待中 |
作为参考,在 imatrix 计算过程中,Q3_K_S 在校准语料库上的 PPL 约为 3.85,因此预计完整表格的范围大致从 15(IQ1_S,重度 1.6 比特压缩,质量下降但连贯)向下到 Q3_K_S 时的约 4。后续将提供保留 KL 散度表格(以 Q3_K_S 为基准)。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#about-the-imatrix 关于 imatrix
imatrix.dat 是使用 calibration_datav3 语料库计算的,并应用于每个 i-quant(IQ1 和 IQ2)。
坦诚说明它是如何制作的:
- 源文件是 Q3_K_S 量化版本,而不是完整的 Q8_0。Kimi K3 的多 GPU 推理在 fork 中尚无法工作,而完整的 3 TB Q8 文件无法装入 RAM 以进行 CPU 推理,但 Q3_K_S(约 1.2 TB)可以装入并能在 CPU 上正常运行。从量化后的模型计算 imatrix 是一种标准做法,并且对最终 1 到 2 比特输出的影响相对于量化本身来说是次要的。
- 由于有 896 个专家,每个 token 只激活 16 个,少数不常使用的专家会略微欠采样,并退回到这些权重的默认量化。
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#usage 使用方法
# 下载一个量化版本文件夹
hf download AtomicChat/Kimi-K3-GGUF --include "IQ2_XXS/*" --local-dir ./kimi-k3
# 使用 fork 版本运行
./llama-cli -m ./kimi-k3/IQ2_XXS/Kimi-K3-IQ2_XXS-00001-of-000NN.gguf -p "Hello"
https://huggingface.co/AtomicChat/Kimi-K3-GGUF#attribution-and-license 归属与许可证
这是 Moonshot AI 的 Kimi K3 的衍生作品,根据 Kimi K3 许可证重新分发。原始版权声明和许可证保留在 LICENSE(https://huggingface.co/AtomicChat/Kimi-K3-GGUF/tree/main/LICENSE)文件中。
Kimi K3 License
Copyright (c) 2026 Moonshot AI
量化并发布由 AtomicChat(https://huggingface.co/AtomicChat)完成。
相似文章
自行量化 Kimi K3 (2.8T A50B) 至 GGUF 格式 - Q3_K_S 可行,磁盘占用 1.1 TB
我们成功使用 Q3_K_S 量化方式将 Kimi K3 2.8T 参数模型量化为 GGUF 格式,最终磁盘文件大小为 1.1 TB。
有人测试过 IQ1_M 342GB 剪枝版 Kimi K3 吗?能用吗?
这是一个高度实验性的 GGUF 版本,基于 2.8T 参数的 Kimi K3 MoE 模型,剪枝了 55% 的专家并量化至约 2.15 bpw(319 GiB)。运行它需要特定的 llama.cpp PR 和自定义补丁,并包含详细的使用说明。
Kimi k3 达到 2.8t!需要激进的 iQ2_XXS 或 IQ1.8 才行!
Kimi 发布了一个新的 2.8 万亿参数模型 k3,规模超出预期,要在消费级硬件上运行需要采用激进量化方案。
Kimi K3: 开放前沿智能
Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。
使用29 GB内存以0.50 tok/s运行Kimi K3
WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。