我将 Qwen3.8-27B 在 RTX 3090 上优化至单请求 99 tps 和批量请求 1150 tps

Reddit r/LocalLLaMA 工具

摘要

作者在 RTX 3090 GPU 上优化了 Qwen3.8-27B 模型的推理,通过各种量化和优化技术,实现了单请求高达 99 tps 和批量处理 1150 tps 的性能,并在 GitHub 上发布了更新的代码。

我回来了。昨天我发布了针对 RTX 3090 的首个超优化 Qwen3.8-27B 推理引擎版本,单请求达到 82 tps,峰值 672 tps。在过去的 24 小时里,我一直在探索如何进一步提升它(而不损失质量)。昨天我们进行了这三项优化:- fp8 kv cache - lm_head int8 - embed_tokens int8 现在我添加了:- fp16 循环状态 - int8 激活值,MLP - 所有组件的 int8 激活值 - draft_sample_method=probabilistic(从 MTP 分布中采样而非取最大值) - 不适用于贪婪采样。 对于单用户模式,用户可以启用 ctx=fast,它使用 FlashAttention、bf16 kv、64k 上下文,并为用户提供 99 tps,但代价是减少上下文长度。此外,预填充现在在 1k 上下文时达到 1812 tps,在 100k 上下文时达到 1000 tps - 增幅约为 50% 到 25%。 我已经更新了仓库,包含了开始快速运行所需的一切:https://github.com/syv-ai/qwen38-27b-rtx3090 目前我正在致力于让 KVarN 工作,以便我们可以减少上下文的内存占用,从而容纳完整的 262k 而不是 195k。
查看原文

相似文章

Wow!Qwen 3.6:35b-a3b 在 3090 上……太惊人了。

Reddit r/artificial

一位用户分享了在二手 RTX 3090 上运行量化版 Qwen 3.6:35b-a3b 模型的惊人结果:将模型放入显存后,输出速度达到每秒 160 个 token,并以 75 秒的视频处理时间展示了视觉能力。