运行 Qwen 3.6 27B 在 5-10 tok/s 的最低成本方案是什么(不使用投机解码)?

Reddit r/LocalLLaMA 工具

摘要

一个关于在不使用投机解码的情况下,以最低成本运行 Qwen 3.6 27B 达到 5-10 tok/s 的问题,聚焦于推理优化和成本降低。

暂无内容
查看原文

相似文章

Qwen 27B

Reddit r/LocalLLaMA

一位用户报告称,在q6kxl量化与多token预测下,Qwen 27B在4090+3090系统上使用LCPP实现了50-90 token/s的解码速度和1500-2200 token/s的预填充速度,并指出它在各种编码任务中表现稳定、快速且连贯。