Qwen 3.8 27B 比预期更快

Reddit r/LocalLLaMA 模型

摘要

一位用户报告称,Qwen 3.8 27B 模型在双 5060 TI 显卡上达到了 50-60 个令牌每秒的速度,显示出比之前版本(如 Qwen 3.6)更令人意外的速度提升。

我在我的两张 5060 TI 16GB 显卡上,使用 unsloth 和 LM studio 以 Q4 量化运行了这个模型(我下载了 NVFP4,但没有在 vLLM 中尝试)。我觉得它的运行速度比预期要快,MTP 模式下能给我 50 - 60 t/s。这很令人惊讶,因为它是一个密集模型,而 Qwen 3.6 在 MTP 模式下只能给我 30t/s。有人注意到文本生成速度达到峰值吗?还是这是设置问题,因为我上个月从 Windows 换到了 Linux,也许 Qwen 3.6 很快,但我用的是错误的操作系统。
查看原文

相似文章

Qwen3.8-27B:更慢的词元,更快更好的结果

Reddit r/LocalLLaMA

Qwen3.8-27B 是一款新型人工智能模型,强调实际运行时间而非词元生成速度,能在配备32GB显存的消费级硬件上本地部署,并提供卓越的智能表现。