双Tesla p100, q6_k量化, Qwen 3.8 27B 约60 tps V3.0

Reddit r/LocalLLaMA 工具

摘要

一位用户分享了针对Tesla P100 GPU的内核优化,以提升使用llama.cpp运行Qwen 3.8模型时的性能,实现了显著的推理加速。

大家好!我一直很兴奋想在这里分享这个。这是一个针对Tesla p100系列显卡(80美元)的内核优化项目。首先我想说,我17岁,没有正式学位。我使用了很多AI辅助,虽然理解一部分,但并不完全理解所有内容。注意:我的GPU功耗限制在175W/250W,所以这些数字可能还能提高。我也有轻微的热节流,温度保持在舒适的79度,这绝对影响数字(上面的表格是在热状态下,所以如果你有良好的冷却,预填充和解码可能提高5-10%)。我使用的是第三代PCIe,有两个x16插槽。另外,对于好奇的人,图像中显示的解码数字是从一系列问题(包括创意写作和编码)中平均得到的。改进:tps从0上下文时的7-15 tps提升到50-60,260k上下文从2-4 tps提升到30-35,预填充从0上下文时的220 tps提升到350,260k上下文从40 tps(据我记忆,我从未真正测量过因为太难)提升到110 tps,通过使用混合fp16/fp32数学操作修复了fp16数学错误,消除了舍入误差,并且截至9月22日已合并,所以应该支持Qwen 3.8 flash架构。此设置对标志有些特定(例如:(-c 262144 -b 32768 -ub 1024 -np 1 \) 没有-b 32768时,mtp会过载并导致接受率在全深度时接近0),所以在设置时请记住这一点。还有一件事,我对此非常重视回归测试。数学必须更准确或字节相同,否则测试会失败。构建、标志、数学证明以及您可能需要的其他内容将在下面链接。享受吧,大家!我很期待你们的反馈,并且正在查看拉取请求。Github: https://github.com/Kmic-68/llama.cpp/tree/p100-optimizations 详情构建、数学证明等:https://github.com/Kmic-68/llama.cpp/tree/p100-optimizations/p100-docs
查看原文

相似文章

Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s

Reddit r/LocalLLaMA

一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。