Qwen3.8-Flash-Next: 是时候更新那些基准测试了

Reddit r/LocalLLaMA 模型

摘要

本文对Qwen3.8-Flash-Next模型进行了基准测试,显示其在个人基准测试中突破了94%,并比较了其在编程、通用知识和科学方面与其他模型的性能。

硬件规格:M4 Max 128GB Studio,推理引擎:oMLX 和 llama.cpp。见解:目前仍处于早期阶段,因此不得不禁用oMLX K/V缓存,qwen4_exp架构尚未得到支持。加上明显的n-gram问题,整个4位量化占用约100G,所以相当紧张。尽管如此,这是今年第一个在我的cupel基准测试中突破94%的模型。一个有趣的地方是Qwen 3.8 27B显然很出色,但表现并不那么好,因为我的测试包括编程、通用知识和科学。它在编程方面确实优于大多数模型,但通用知识部分输给了Gemma 31B和Qwen 3.6 omlx。这是我使用oMLX尝试的量化版本,由于混合量化,它比其他4位量化表现更好:pipenetwork/Qwen3.8-Flash-Next-MLX-mixed-4_8bit。构建困惑度:bfloat16 4.4708,mixed-4_8bit 4.5286。llama.cpp,这是Unsloth提供的一个很好的量化版本,它不如"MLX-mixed-4_8bit"强大,但我无法从unsloth安装更大的版本来进行基准测试。你可以在上面排行榜的第6位看到它:unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS。我正在整理过去几个月在编程方面的所有工作,并将向基准测试中添加更多内容(如hermes => pi / opencode等),因为模型变得太优秀以至于难以区分:我喜欢这样!
查看原文

相似文章

Qwen3.8-Flash-Next-NVFP4 对比 Qwen3.8-27B-FP 测试结果

Reddit r/LocalLLaMA

本文详细测试了Qwen3.8-Flash-Next-NVFP4与Qwen3.8-27B-FP8两款AI模型在各类任务中的性能表现,结果显示Flash-Next版本在速度与失败率方面更具优势,但在处理多步骤符号任务时表现较弱。