RTX 5090 上的 Bonsai 2 27B、Gemma 4 12B 和 Qwen 3.5 9B:日式体素宝塔生成对比

Reddit r/LocalLLaMA 新闻

摘要

本文对比了 Bonsai 2 27B、Gemma 4 12B 和 Qwen 3.5 9B 模型在使用 RTX 5090 生成日式体素宝塔时的性能,结论是 Bonsai 在内存占用方面提供了更优的智能和细节,对本地 AI 社区有益。

昨天我看到 prismml 发布了新的 bonsai,这是 qwen 3.8 27b 的重度量化版本,声称与 fp16 相比 top-1% 超过 98%,而内存占用从 Q1 的约 6gb 到 Q2 的约 8gb。我想看看这个模型在相同内存范围内与其他模型的对比表现,于是我选择了 gemma 4 12B 和 qwen 3.5 9B。我在一块 rtx 5090 上运行了所有测试,并给模型相同的宝塔提示词(结果是单次运行,是的,bonsai 使用了更多的 token,但 90% 的预算都用在了思考上,这证明了相比其他模型,bonsai 的自主性更强,我认为这是好事。)配置 设置 值 GPU 1x RTX 5090 32 GB 运行时 llama-server, PrismML llama.cpp fork, 版本 prism-b10683-d8f26ee, CUDA 12.8 构建 为什么使用 fork Bonsai GGUF 在原版 llama.cpp 中无法加载,所以我使用了相同的二进制文件用于所有三个模型。标志 -ngl 999 -fa on -c 262144 -np 1 --jinja 上下文 262,144 tokens 用于所有三个模型 采样 temp 1.0, top-p 0.95, top-k 20, min-p 0 思考开启用于所有三个模型。Bonsai 使用 reasoning effort xhigh(默认值),其他两个没有此设置 输出限制 无 运行 每个模型一次 提示词 ~770 字,三.js 中的体素日本宝塔场景作为单个 HTML 文件 模型和结果 模型 量化 大小 输出 tokens 时间 速度 三元 Bonsai 2 27B PQ2_0 (prism-ml) 7.2 GB 106,396 ~17.5 分钟 ~101 tok/s Qwen 3.5 9B Q6_K (unsloth) 7.5 GB 12,105 ~70 秒 ~168 tok/s Gemma 4 12B Q8_0 (unsloth) 12.7 GB 9,159 ~95 秒 ~96 tok/s。在这三个模型中,bonsai 看起来明显更好,并且在整个场景中都有相当好的细节。gemma 的输出看起来也不差,但明显更模糊,而 qwen 则完全崩溃了。我认为这次 qwen 的 bonsai 版本实际上值得运行,因为它在这个内存大小下提供了无与伦比的智能,这很酷,因为这对本地 AI 社区来说是一个巨大的胜利,这个模型可以在 3060 上轻松运行,具有不错的 tps,并能完成一些不错的工作。设置:atomic.chat fork,后端由 prismml 提供(我是那里的创始人,所以任何反馈都欢迎。)
查看原文

相似文章

通俗版对比:Qwen3.6 35b-a3b 与 Gemma4-26b-a4b-it

Reddit r/LocalLLaMA

Gemma 4-26b-a4b-it 基本是个基础扎实、能稳妥完成任务的 B 等生。Qwen3.6-35b-a3b 则是考出 A+ 的优等生,做完任务后还有余力搞点锦上添花的发挥。在我的 16GB 显存显卡上,两款模型运行速度相当。测试环境为 Windows 下的 LM Studio,采用推荐推理设置。使用的模型:unsloth/gemma-4-26B-A4B-it-UD-Q4_K_S 与 AesSedai/Qwen3.6-35B-A3B IQ4_XS。大家有不同意见吗?**更新:** 看来我之前用 Gemma 4 的方式不太对。[Sadman782 的评论](https://www.redd