Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps
摘要
Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。
Kimi K3 完整模型在 16x GB10 集群上运行,平均 20+ tps(llama-benchy coherent corpus),峰值 38tps,预填充 750tps。这是在我的集群上首次使用 dspark 运行完整的 k3。我将进行一些测试,并尝试通过 tp 来加速。一旦看起来准备就绪,我就会发布 vllm 镜像和说明。https://forums.developer.nvidia.com/t/full-kimi-k3-running-on-16x-gb10-cluster/379174
相似文章
我成功运行了Kimi-k3......
用户成功使用llama.cpp在高端硬件上运行Kimi-k3模型,实现了较低的每秒token数(提示评估0.41,生成0.23)。
@UnTalNixon_exe: 忘掉GPU和百万美元集群吧。他们刚刚让全球最大的开源模型(Kimi K3 – 2.78万亿参数)……
一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。
Kimi K3 在家用实验室的首批结果 ~ 4t/s
用户分享了在家用实验室运行 Kimi K3 的首批结果,配置为 768GB DDR5 和 2x5090,使用 llama.cpp 分支和 Q2_K 量化,报告预填充速度为 50-70 tps,解码 tps 随时间增长。
用户成功通过25GbE以太网在80块RTX 5090上运行Kimi K3。
用户使用仅GDDR7和以太网(无HBM)在80块RTX 5090 GPU上运行Kimi K3,这是一个2.8T参数的开放权重MoE模型,实现了单流20 tok/s,这是首个在消费级硬件上运行的前沿模型。
使用29 GB内存以0.50 tok/s运行Kimi K3
WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。