Ninfer 和 RTX 5090 配合 3.8 27B 模型让我喜极而泣,效果太棒了。
摘要
一位用户报告称,使用 Ninfer 工具在 NVIDIA RTX 5090 GPU 上运行 Qwen 3.8B 模型时,获得了高令牌吞吐量,显著优于 llama.cpp。
构建了最新版本,我获得了高达每秒 220 个令牌的吞吐量,平均在 170 左右,我简直不敢相信。如果这里有人参与了这个项目,真心致敬,做得太棒了。我无法相信我能够将吞吐量从 llama.cpp 提升一倍甚至更多。这是我设置的:命令:> ninfer-serve /models/qwen3_8_27b_nvfp4.ninfer --model-id qwen3.8-27b-nvfp4 --host 0.0.0.0 --max-context 240000 --kv-capacity 240000 --max-concurrency 2 --kv-dtype fp8 --host-kv-mib 16384 --spec mtp --draft-tokens 3 --lm-head-draft --vision --media-live-mib 2048
相似文章
Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。
Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。
NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进
NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。
(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试
一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。
NInfer RTX 4090 for Qwen 3.8 27B 更新 - 最高支持25万-35万令牌上下文在显存中
作者已更新其 NInfer 分叉,添加了 rk2v4-e8 量化选项用于 KV 缓存,使得在单张 RTX 4090 上实现最高25万-35万令牌上下文,无需溢出到系统内存,并进行了优化以提升生成速度。
单卡 RTX 5090:Qwen3.8-27B NVFP4 在 vLLM 中实现真实 262K 上下文长度 — 短上下文速度达 77 tok/s,128K 上下文时为 64.7 tok/s
本文展示了在NVIDIA RTX 5090显卡上使用vLLM框架运行Qwen3.8-27B模型的实际部署流程与性能基准测试,涵盖262K令牌上下文窗口的配置细节与各项关键指标。