Ninfer 和 RTX 5090 配合 3.8 27B 模型让我喜极而泣,效果太棒了。

Reddit r/LocalLLaMA 工具

摘要

一位用户报告称,使用 Ninfer 工具在 NVIDIA RTX 5090 GPU 上运行 Qwen 3.8B 模型时,获得了高令牌吞吐量,显著优于 llama.cpp。

构建了最新版本,我获得了高达每秒 220 个令牌的吞吐量,平均在 170 左右,我简直不敢相信。如果这里有人参与了这个项目,真心致敬,做得太棒了。我无法相信我能够将吞吐量从 llama.cpp 提升一倍甚至更多。这是我设置的:命令:> ninfer-serve /models/qwen3_8_27b_nvfp4.ninfer --model-id qwen3.8-27b-nvfp4 --host 0.0.0.0 --max-context 240000 --kv-capacity 240000 --max-concurrency 2 --kv-dtype fp8 --host-kv-mib 16384 --spec mtp --draft-tokens 3 --lm-head-draft --vision --media-live-mib 2048
查看原文

相似文章