NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进
摘要
NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。
Qwen3.8-27B 终于发布了,NInfer 已提供 Day-0 支持!权重:https://huggingface.co/neroued/Qwen3.8-27B-NInfer 只需更新到最新版本即可尝试。在单张 RTX 5090 上,NInfer 使用推测解码仍能达到约 200 tok/s 的生成速度。自上一篇文章以来,NInfer 也有了很大改进。现在 NInfer 支持多达 8 个并发请求,使用共享的分页 KV 缓存池,每个请求仍可使用完整的上下文长度。我还为 GDN + 推测解码实现了 ReplaySSM,这大大降低了并发下的循环状态内存开销,这也是 vllm 尚未完全支持的功能。还有许多 CUDA 内核优化,以及使用 PDL 进一步降低延迟。欢迎反馈和错误报告,我会尽快修复问题!
相似文章
Nifer 太疯狂了。在 Qwen 3.6 35B 上实现每秒 700 个 token(无思考模式)。专为 RTX 5090 打造。同时支持完整的 25 万上下文。
Nifer 是一款工具,能够在 Qwen 3.6 35B 上实现每秒 700 个 token 的推理(无思考模式),专为 RTX 5090 优化,并支持完整的 25 万上下文。
Qwen 3.6 27B 投机解码基准测试:单张 RTX 3090 上实现 ~100 TPS
一份详细的基准测试,比较了单张 RTX 3090 上 Qwen 3.6 27B 的投机解码引擎,显示 ik_llama 在代码生成中达到约每秒 100 个 token。结果包括 5 种引擎变体的解码 TPS、TTFT、显存占用和上下文退化情况。
Qwen3.6 27B 在 RTX 5090 上,调整 MTP/缓存设置后的 6.4k 采样 token/s 分布
在 RTX 5090 上运行 Qwen3.6 27B,调整 MTP 和缓存设置后达到每秒 6.4k 个 token,展示了推理优化技术。
双RTX 4060 Ti上Qwen3.6 q4xl达到125 tok/s,性价比惊人
有用户报告称,在两张RTX 4060 Ti显卡上运行Qwen3.6 q4xl达到了每秒125个token,强调性价比出色,并想知道进一步优化是否能达到150 tok/s。
三元 Qwen3.6 27B 在 3090 上测试!
用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。