在4x3090上运行Qwen 3.8 Flash Next与27B相比是否值得?

Reddit r/LocalLLaMA 新闻

摘要

用户正在寻求建议:在多GPU上运行Qwen 3.8 Flash Next是否优于使用更大的27B模型,考虑到性能问题和模型犹豫不决。

有人能告诉我,在4x3090上运行Qwen 3.8 Flash Next是否比27B更值得吗?27B性能不错,但问题在于它犹豫不决。我看着它'几乎'要解决问题,却又花上2小时'让我再检查一下/证明一下',这让我很沮丧。看起来Flash Next的4位量化版本应该能与SSD中的ngrams配合使用,并且速度会快很多,但听起来架构还不太成熟。有比我更聪明、更有耐心的人能告诉我该怎么办吗?谢谢。
查看原文

相似文章

48GB VRAM + Qwen 3.6 27B 的最佳设置

Reddit r/LocalLLaMA

一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。

Qwen3.8-Flash-Next-NVFP4 对比 Qwen3.8-27B-FP 测试结果

Reddit r/LocalLLaMA

本文详细测试了Qwen3.8-Flash-Next-NVFP4与Qwen3.8-27B-FP8两款AI模型在各类任务中的性能表现,结果显示Flash-Next版本在速度与失败率方面更具优势,但在处理多步骤符号任务时表现较弱。