NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进

Reddit r/LocalLLaMA 工具

摘要

NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。

Qwen3.8-27B 终于发布了,NInfer 已提供 Day-0 支持!权重:https://huggingface.co/neroued/Qwen3.8-27B-NInfer 只需更新到最新版本即可尝试。在单张 RTX 5090 上,NInfer 使用推测解码仍能达到约 200 tok/s 的生成速度。自上一篇文章以来,NInfer 也有了很大改进。现在 NInfer 支持多达 8 个并发请求,使用共享的分页 KV 缓存池,每个请求仍可使用完整的上下文长度。我还为 GDN + 推测解码实现了 ReplaySSM,这大大降低了并发下的循环状态内存开销,这也是 vllm 尚未完全支持的功能。还有许多 CUDA 内核优化,以及使用 PDL 进一步降低延迟。欢迎反馈和错误报告,我会尽快修复问题!
查看原文

相似文章

三元 Qwen3.6 27B 在 3090 上测试!

Reddit r/LocalLLaMA

用户在 RTX 3090 上测试了三元量化版本的 Qwen3.6 27B,使用两个槽位和 100k KV 缓存,占用 21GB 显存,达到了 60 tk/s 的速度,质量良好且工具调用稳定。