Kimi K3-256k
摘要
Kimi Code 发布了 Kimi K3-256k,这是其旗舰编码模型 K3 的 256k 上下文版本,在保持大多数任务中相似性能的同时,降低了配额消耗。
暂无内容
查看缓存全文
缓存时间: 2026/07/29 21:57
# 模型配置 | Kimi Code 文档
来源:https://www.kimi.com/code/docs/en/kimi-code/models
## 模型配置(https://www.kimi.com/code/docs/en/kimi-code/models#model-configuration)
本页介绍 Kimi Code 提供的模型以及如何在各个客户端中切换。
## 模型概览(https://www.kimi.com/code/docs/en/kimi-code/models#model-overview)
Kimi Code 目前提供两个模型——Kimi K3 和 Kimi K2.7 Code——共四个模型 ID,可在客户端或第三方工具中通过模型 ID 选择。模型规格如下:
推荐模型推出
`k3-256k` 现已可用。在 256k 上下文内,它能提供相同的结果。`k3`(1M)消耗的配额大约是 `k3-256k` 的两倍。适合日常问答、代码补全、常规功能开发以及单文件或小文件编辑——不支持视频输入。
> 💓 提醒 **从 K3 (1M) 切换到 K3-256k:**
> 当从 `k3`(1M)切换到 `k3-256k` 时,如果当前会话的上下文已超过 256k,某些编码工具(如 Kimi Code CLI 和 Claude Code)会在工具端执行压缩。
> 切换建议:(1)由于不同 Agent 工具处理方式不同,建议在切换前手动运行一次压缩,将上下文压缩到 256k 以内。这样可以保留任务的关键点,保持会话完整,并在切换后享受更持久的配额。(2)如果对话历史中包含视频文件,直接切换会失败,因为 K3-256k 不支持视频输入。请先压缩,再切换。
> **从 K3-256k 切换到 K3 (1M):**
> 当从 `k3-256k` 切换到 `k3`(1M)时,如果 `k3-256k` 接近 256k 上限且您不希望压缩丢失信息,可以直接切换到 1M。当前版本从 256k 切换到 1M 不影响缓存。
| 模型 ID | `k3` | `k3-256k` | `kimi-for-coding` | `kimi-for-coding-highspeed` |
| :--- | :--- | :--- | :--- | :--- |
| 模型版本 | Kimi K3 | Kimi K3 | Kimi K2.7 Code | K2.7 Code HighSpeed |
| 描述 | Kimi 最具能力的旗舰编码模型:2.8T 参数,1M 上下文窗口 | Kimi K3 的 256K 上下文版本,有效降低消耗 | 擅长代码补全和日常开发任务 | K2.7 Code 的高速版本,编码能力相同,输出速度约 5–6 倍 |
| 速度 | 普通 | 普通 | 普通 | 高速(6 倍速度,3 倍配额消耗) |
| 上下文窗口 | 最高 1M(适用于更高等级会员) | 仅 256k | 256k | 256k |
| 推理 | `reasoning_effort:low` / `high` / `max`(默认 `high`) | `reasoning_effort:low` / `high` / `max`(默认 `high`) | `Thinking:ON` | `Thinking:ON` |
| 可用性 | Moderato 及以上会员可用;Allegretto 及以上会员可使用 1M 上下文 | 所有 Moderato 及以上会员可用 | 所有会员 | Allegretto 及以上计划 |
| 多模态输入 | 图像、视频 | 仅图像 | 图像、视频 | 图像、视频 |
需要更高的会员计划?
不同会员计划解锁不同的模型、上下文窗口和速度。**升级您的计划 →** (https://www.kimi.com/code/#pricing)
为什么新模型推出后使用量上升了?
切换模型后,之前建立的上下文缓存无法命中新模型,因此该上下文需要重新预填充。因此切换后使用量看起来较高。建议操作:
- **使用新模型时开启新会话**:这样可以获得更好的结果并降低消耗。
为什么使用正确的模型 ID 仍然收到 401 错误?
当请求的能力超出您的计划权限时,服务器会返回 `401`。三种常见情况:
- **无 K3 访问权限**:您的计划低于 Moderato,无法调用 `k3`、`k3-256k`——请升级到 Moderato 或以上。
- **无 1M 访问权限**:Moderato 计划下,`k3` 最多支持 256K 上下文;Allegretto 及以上计划可使用最高 1M 上下文。`k3-256k` 固定 256K 上下文限制。
- **无 HighSpeed 访问权限**:某些计划不包括 HighSpeed——请升级到 Allegretto 或更高计划以调用 `kimi-for-coding-highspeed`。
完整的错误文本及处理方法请参见错误参考 (https://www.kimi.com/code/docs/en/kimi-code/error-reference.html)。
为什么 HighSpeed 没有明显更快?
两个常见原因:
- **模型 ID 输入错误**:HighSpeed ID 必须是 `kimi-for-coding-highspeed`;错误的值会静默回退到标准 `kimi-for-coding`——不会报错,也不会加速。
- **工具和脚本占主导**:HighSpeed 仅加速**模型输出**。工具调用(读写文件、运行命令等)和脚本执行不受影响,因此当它们占据大部分轮次时,整体加速效果不明显。
如何减少切换推理力度带来的开销?
切换推理力度会使您建立的上下文缓存失效,因此原本可以命中缓存的上下文需要重新预填充。为避免频繁触发重新预填充:
- 选择一个适合任务的力度,并在会话中保持一致;
- 当您确实需要不同的力度时,请开启新会话,而不是在长会话中来回切换。
## 如何切换模型(https://www.kimi.com/code/docs/en/kimi-code/models#switch-model)
使用说明
- **切换模型 ID 时请开启新会话**:切换模型会使您建立的上下文缓存失效。我们建议开启新会话以获得最佳体验并避免额外的消耗。
- **填写模型 ID,而非模型版本名称**:调用模型时,请使用上表中的模型 ID(`k3`、`k3-256k`、`kimi-for-coding`、`kimi-for-coding-highspeed`)。输入模型版本名称如 `Kimi K3` 或 `K2.7 Code` 会导致调用失败。
- **关闭 Thinking 的 K3 / K2.7 会路由到 K2.6**:请保持 Thinking 开启以使用 K3 或 K2.7 Code;关闭 Thinking 会将请求路由到 K2.6。
切换到目标模型的方式:
### 官方客户端(https://www.kimi.com/code/docs/en/kimi-code/models#official-clients)
- **官方 Kimi Code CLI**:输入 `/model` 切换模型——无需修改配置;如果最新的模型未列出,请先 `/logout` 再使用 `/login` 重新登录。
- **Kimi Code for VS Code**:从输入栏的下拉菜单中选择目标模型;如果尚未列出,请重启 VS Code 或重新安装扩展。
### 第三方工具(https://www.kimi.com/code/docs/en/kimi-code/models#third-party-tools)
将工具的模型 ID 设置为目标模型。详细步骤:
1. 在 Kimi Code 控制台 (https://www.kimi.com/code/console) 创建 API Key。
2. 在工具中填入 Base URL 和对应的模型 ID。
Kimi Code API 同时支持 OpenAI 和 Anthropic 协议。Base URL:
| 协议 | Base URL |
| :--- | :--- |
| OpenAI 兼容 | `https://api.kimi.com/coding/v1` |
| Anthropic 兼容 | `https://api.kimi.com/coding/` |
详细配置步骤请参考对应工具指南:
在第三方工具中使用 K3 之前
K3 的设置与 K2.7 Code 略有不同。使用前请检查以下两点:
- **上下文窗口**:某些工具默认的上下文窗口小于最大 1M——请手动将 context-window 字段设置为 `1048576` 以使用 K3 的最高 1M 上下文。
- **推理力度**:K3 支持 `low` / `high` / `max`;工具发送的力度映射如下:
```
# 默认值
null / undefined → high
任何其他未知值 → HTTP 400 错误
# → max
ultra / max / xhigh → max
# → high(推荐)
high / medium → high
# → low
low / minimum / light → low
# → 关闭思考
none → thinking.type disabled
```
相似文章
Kimi K3 编程基准测试
Kimi K3 编程基准测试文章,讨论 Kimi K3 模型在编程任务上的表现。
Kimi K3 (Unsloth) IQ2-XXS 从 711GB 降至 478GB!!! 仅移除多语言来缩减体积
Kimi K3 (IQ2-XXS) 的精简版纯英文 GGUF 通过移除多语言组件,将模型大小从 711GB 降至 478GB,早期测试表明它在编码任务上可能达到或超过标准 2-bit 版本。
在 C 语言中、于 CPU 上运行 Kimi K3(c99 和 cpu)
一个项目声称可以通过从 NVMe SSD 流式加载专家权重并使用 MXFP4 压缩,在仅有 8GB 内存的 CPU 上运行拥有 2.78T 参数的 MoE 模型 Kimi K3,以速度换取内存效率。
@skirano:推出 Kimi 2.6 Code——专为 Kimi K2.6 打造的类 Claude Code 终端体验,让它成为地球上最强大的开源编程智能体之一。只需带上 API 密钥,输入 /login 即可。仓库地址
推出 Kimi 2.6 Code:专为 Kimi K2.6 设计的类 Claude Code 终端体验,使其成为地球上最强大的开源编程智能体之一。只需带上 API 密钥,使用 /login 即可。仓库地址
Kimi K2.7 Code 务实胜过炫技
Kimi 发布了 K2.7 Code,这是一款专注于编程的 AI 模型,其基准测试成绩提升,且思考令牌使用量降低 30%。它更强调在长代码循环和智能体工具集成中的实际性能,而非炫目的分数。