我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps
摘要
作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。
我回来了。昨天我发布了针对 RTX 3090 的首个超优化 Qwen3.8-27B 推理引擎版本,单请求达到 82 tps,峰值 672 tps。在过去的 24 小时里,我一直在探索如何进一步提升它(而不损失质量)。昨天我们进行了这三项优化:- fp8 kv cache - lm_head int8 - embed_tokens int8
现在我添加了:- fp16 循环状态 - int8 激活值,MLP - 所有组件的 int8 激活值 - draft_sample_method=probabilistic(从 MTP 分布中采样而非取最大值) - 不适用于贪婪采样。
对于单用户模式,用户可以启用 ctx=fast,它使用 FlashAttention、bf16 kv、64k 上下文,并为用户提供 99 tps,但代价是减少上下文长度。此外,预填充现在在 1k 上下文时达到 1812 tps,在 100k 上下文时达到 1000 tps - 增幅约为 50% 到 25%。
我已经更新了仓库,包含了开始快速运行所需的一切:https://github.com/syv-ai/qwen38-27b-rtx3090
目前我正在致力于让 KVarN 工作,以便我们可以减少上下文的内存占用,从而容纳完整的 262k 而不是 195k。
相似文章
Qwen3.8-27B在24GB RTX PRO 4000 SFF上以256K上下文运行(432 GB/s带宽):通过MTP实现每秒50个token
本文详细描述了一项实验,该实验在24GB GPU上使用多token预测和自定义优化,实现了Qwen3.8-27B在256K上下文下每秒50个token的推理速度。
Qwen3.6 27B 在 RTX 5090 上,调整 MTP/缓存设置后的 6.4k 采样 token/s 分布
在 RTX 5090 上运行 Qwen3.6 27B,调整 MTP 和缓存设置后达到每秒 6.4k 个 token,展示了推理优化技术。
Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。
一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。
Qwen3-8B 2.4T 在 Nvidia GB300 NVL72 上达到 288k tokens/s
NVIDIA 展示了在 GB300 NVL72 硬件上运行 Qwen3-8B 2.4T 参数模型的高吞吐量性能,实现每 GPU 超过 4k tokens/s。
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。