我使用8块B300部署了Kimi K3(2.8T参数)。速率92令牌/秒,每百万令牌190美元
摘要
本文描述了使用8块B300 GPU托管具有2.8万亿参数的Kimi K3 AI模型,实现了每秒92个令牌,成本为每百万令牌190美元,同时与Unsloth的动态GGUF量化方法进行了比较。
我运行的配置:在Modal上使用8块B300,每小时56.79美元,vLLM,张量并行8,原生MXFP4。冷启动约27分钟(加载1.56 TB数据,即时编译,51次CUDA图捕获)。首令牌时间0.92至1.02秒,解码速率稳定92令牌/秒,4个提示平均83令牌/秒。每百万输出令牌190美元。一次干净运行大约消耗36美元的GPU时间。如果保持热状态,每天花费1363美元。我还运行了Unsloth的动态GGUF。他们的1位UD-IQ1_S(594 GB)通过llama.cpp可以在8块A100-80GB上运行。每小时19.99美元,便宜2.8倍。结果:约9令牌/秒,首令牌时间7至60秒,约620美元/百万令牌,因此每令牌贵3.3倍。1位质量良好(计算正确,文本连贯)。完整的文章,包含每个标志、Modal部署文件和原始基准测试JSON:https://books.vizuara.ai/book/kimi-k3-hosting
相似文章
Kimi K3 完整模型在 16x GB10 集群上运行,速度超过 20 tps
Kimi K3 完整模型在 16x GB10 集群上运行,平均每秒处理 20+ 个 token,并计划发布 vllm 镜像和说明。
@UnTalNixon_exe: 忘掉GPU和百万美元集群吧。他们刚刚让全球最大的开源模型(Kimi K3 – 2.78万亿参数)……
一个名为 kimi-k3-in-c 的新工具,在单个 CPU 上以低至 8.24 GB 的内存运行 2.78T 参数的 Kimi K3 开源模型,从磁盘流式加载专家,并以每 token 10-32 秒的确定性输出运行。
使用29 GB内存以0.50 tok/s运行Kimi K3
WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。
@QuixiAI:@Kimi_Moonshot K2.6 在我的 mi300x 上跑出了 56 tps(单请求),接下来做吞吐测试
Kimi K2.6 在单张 MI300X GPU 上达到 56 token/s,用户计划进一步测试整体吞吐。
自托管Kimi K3:硬件成本增加20%,任务解决能力提升20%
最新基准测试显示,在8个B300节点上自托管Kimi K3实现了86.4%的任务解决率,硬件成本大约比在B200节点上运行的GLM-5.2高出20%,尽管吞吐量较低。