Qwen3.8-Flash-Next: 是时候更新那些基准测试了
摘要
本文对Qwen3.8-Flash-Next模型进行了基准测试,显示其在个人基准测试中突破了94%,并比较了其在编程、通用知识和科学方面与其他模型的性能。
硬件规格:M4 Max 128GB Studio,推理引擎:oMLX 和 llama.cpp。见解:目前仍处于早期阶段,因此不得不禁用oMLX K/V缓存,qwen4_exp架构尚未得到支持。加上明显的n-gram问题,整个4位量化占用约100G,所以相当紧张。尽管如此,这是今年第一个在我的cupel基准测试中突破94%的模型。一个有趣的地方是Qwen 3.8 27B显然很出色,但表现并不那么好,因为我的测试包括编程、通用知识和科学。它在编程方面确实优于大多数模型,但通用知识部分输给了Gemma 31B和Qwen 3.6 omlx。这是我使用oMLX尝试的量化版本,由于混合量化,它比其他4位量化表现更好:pipenetwork/Qwen3.8-Flash-Next-MLX-mixed-4_8bit。构建困惑度:bfloat16 4.4708,mixed-4_8bit 4.5286。llama.cpp,这是Unsloth提供的一个很好的量化版本,它不如"MLX-mixed-4_8bit"强大,但我无法从unsloth安装更大的版本来进行基准测试。你可以在上面排行榜的第6位看到它:unsloth/Qwen3.8-Flash-Next-GGUF:UD-IQ4_XS。我正在整理过去几个月在编程方面的所有工作,并将向基准测试中添加更多内容(如hermes => pi / opencode等),因为模型变得太优秀以至于难以区分:我喜欢这样!
相似文章
Qwen3.8-Flash-Next-NVFP4 对比 Qwen3.8-27B-FP 测试结果
本文详细测试了Qwen3.8-Flash-Next-NVFP4与Qwen3.8-27B-FP8两款AI模型在各类任务中的性能表现,结果显示Flash-Next版本在速度与失败率方面更具优势,但在处理多步骤符号任务时表现较弱。
Qwen3.8-27B 与 Qwen3.8-Flash-Next 较小量化版本对比?
一位用户在128GB内存环境下比较Qwen3.8-27B和Qwen3.8-Flash-Next模型的智能与编程性能,寻求关于哪个更好的建议。
本地智能体编码基准测试:Qwen3.8-Flash-Next NVFP4 对比 27B(以及其他...)
基准测试显示,Qwen3.8-Flash-Next-NVFP4 在本地模型中取得了接近最高分数,在请求处理和令牌生成方面表现出卓越效率,尽管训练不足,但速度仍然显著。
Qwen3.8-Flash-Next: 一种新架构,迈向极致成本效率
Qwen3.8-Flash-Next 引入了一种新的人工智能架构,专注于实现模型性能的极致成本效率。
Qwen 3.8 Flash Next:以一半参数超越 DS V4 Flash,强于 Opus 4.6
Qwen团队发布了一个开放权重模型Qwen 3.8 Flash Next,它在性能上以一半的参数超越DS V4 Flash,并且强于Opus 4.6,为Qwen 4架构提供了预览。