本地基准测试:Muse Glimmer 30B vs Qwen 3.6 27B vs Gemma4 31B(以及许多其他模型和微调)
摘要
本地基准测试,对比 Muse Glimmer 30B、Qwen 3.6 27B 和 Gemma4 31B,记录请求次数和最终得分,并附有详细结果的链接。
相似文章
我为本地模型制作了一个网页设计基准测试(Muse Glimmer 30B vs Qwen 3.6 27b vs Deepseek V4 Flash 0731)
作者为本地AI模型创建了一个网页设计基准测试,并比较了Muse Glimmer 30B、Qwen 3.6 27b和Deepseek V4 Flash 0731。
通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it
Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd
SVG并排对比:Qwen3.8-27B 对比 Muse Glimmer 30B 对比 Gemma 4 26B A4B,以及 Gemini 3.7 Flash 作为对照。
本文比较了本地AI模型Qwen3.8-27B、Muse Glimmer 30B和Gemma 4 26B A4B在SVG生成方面的性能,使用Gemini 3.7 Flash作为云对照,并突出了输出质量的差异。
个人评测后续:Gemma4 26B MoE(Q8)vs Qwen3.5 27B Dense vs Gemma4 31B Dense 对比
个人基准测试显示,Qwen3.5-27B Dense 与 Gemma4-31B Dense 在 37 个失败用例中修复率 100%,即使 8-bit 量化的 Gemma4-26B MoE 也望尘莫及,同时消耗更少 token 与更短挂钟时间。
DeepSeek v4 Flash 对比 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 基准测试
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。