V4-Flash-0731 - 首个周末使用后的感受

Reddit r/LocalLLaMA 模型

摘要

一位用户在周末测试后分享了V4-Flash-0731的实际使用感受,指出量化会严重降低性能,Q3权重可以在代理工作流中替代Qwen3.6-27B,全精度版本以极低的成本接近GLM 5.2级别,但在通用知识方面较弱。

这个周末在V4-Flash-0731上花了太多时间,想尽可能简短地分享我的感受。我让它处理了一些实际工作,也跑了一些个人基准测试。我的快速想法是:量化对这家伙影响巨大——我试了一堆Q2和Q3权重,它的表现就像完全不同的模型。推理看起来/感觉都不一样了,结果比官方/服务端V4-Flash-0731整整低一个档次。Q4没怎么来得及测。Q3终于可以替代你的Qwen3.6-27B了(如果你的显存够的话..)——它做的工作和Qwen3.6-27B一样,只是更稳定。在简单的单次任务中它们差不多,但当你把它们放进更大的代码库或大型框架中(比如带工具的Claude Code,系统提示词大约从30k tokens开始..),V4-Flash-0731在Q3下明显领先于Qwen3.6-27B在Q8下。Q2有点太过分了——在所有Q2的使用场景中,我最终都更倾向于Qwen3.6-27B的Q8权重。Q2_K_XL有点可疑,但它比IQ3_XXS小了约4GB,所以我甚至不会推荐它。全精度才是真正厉害的地方——我认为它正在接近GLM 5.2的水平,这非常让人兴奋。是的,它在复杂任务上会进行大量推理,但最终成本仍然低得令人难以置信。说它能打败GLM 5.2(更不用说Opus 5、Fable等了..)有点傻..但如果只看价格,这家伙自成一档。它显然非常专注于代理型工作——我一直认为Deepseek的发布是"通用型"模型的旗舰,但V4-Flash-0731在知识方面有点弱。如果你使用工具调用,这不是问题,因为模型在使用工具和推理结果方面非常聪明,但如果你有隔离环境的使用场景,就需要考虑一下了。
查看原文

相似文章

Qwen3.6-35B-A3B-Abliterated-Heretic-MLX-4bit

Reddit r/LocalLLaMA

用户评价了通过MLX为Apple Silicon优化的Qwen3.6-35B模型的量化微调版本,称赞其速度快、智能化程度高且没有安全免责声明。