我使用8块B300部署了Kimi K3(2.8T参数)。速率92令牌/秒,每百万令牌190美元

Reddit r/LocalLLaMA 新闻

摘要

本文描述了使用8块B300 GPU托管具有2.8万亿参数的Kimi K3 AI模型,实现了每秒92个令牌,成本为每百万令牌190美元,同时与Unsloth的动态GGUF量化方法进行了比较。

我运行的配置:在Modal上使用8块B300,每小时56.79美元,vLLM,张量并行8,原生MXFP4。冷启动约27分钟(加载1.56 TB数据,即时编译,51次CUDA图捕获)。首令牌时间0.92至1.02秒,解码速率稳定92令牌/秒,4个提示平均83令牌/秒。每百万输出令牌190美元。一次干净运行大约消耗36美元的GPU时间。如果保持热状态,每天花费1363美元。我还运行了Unsloth的动态GGUF。他们的1位UD-IQ1_S(594 GB)通过llama.cpp可以在8块A100-80GB上运行。每小时19.99美元,便宜2.8倍。结果:约9令牌/秒,首令牌时间7至60秒,约620美元/百万令牌,因此每令牌贵3.3倍。1位质量良好(计算正确,文本连贯)。完整的文章,包含每个标志、Modal部署文件和原始基准测试JSON:https://books.vizuara.ai/book/kimi-k3-hosting
查看原文

相似文章

使用29 GB内存以0.50 tok/s运行Kimi K3

Hacker News Top

WASTE是一个新的开源C语言推理引擎,它从磁盘流式加载专家权重,在仅29 GB内存的消费级笔记本电脑上运行拥有2.78万亿参数的Kimi K3模型,实现了0.49–0.54 tokens/s的速度。