Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps

Reddit r/LocalLLaMA 模型

摘要

Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。

Kimi K3 完整模型在 16x GB10 集群上运行,平均 20+ tps(llama-benchy coherent corpus),峰值 38tps,预填充 750tps。这是在我的集群上首次使用 dspark 运行完整的 k3。我将进行一些测试,并尝试通过 tp 来加速。一旦看起来准备就绪,我就会发布 vllm 镜像和说明。https://forums.developer.nvidia.com/t/full-kimi-k3-running-on-16x-gb10-cluster/379174
查看原文

相似文章

我成功运行了Kimi-k3......

Reddit r/LocalLLaMA

用户成功使用llama.cpp在高端硬件上运行Kimi-k3模型,实现了较低的每秒token数(提示评估0.41,生成0.23)。

Kimi K3 在家用实验室的首批结果 ~ 4t/s

Reddit r/LocalLLaMA

用户分享了在家用实验室运行 Kimi K3 的首批结果,配置为 768GB DDR5 和 2x5090,使用 llama.cpp 分支和 Q2_K 量化,报告预填充速度为 50-70 tps,解码 tps 随时间增长。

使用29 GB内存以0.50 tok/s运行Kimi K3

Hacker News Top

WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。