缓存时间:
2026/08/18 15:32
# Qwen3.8 vs Qwen3.6 vs Gemma 4:24GB显卡测试
来源:https://kingy.ai/blog/qwen3-8-27b-vs-qwen3-6-27b-vs-gemma-4-31b/
## Kingy 热门趋势
继续阅读当前最受关注的报道:
1. 博客 · 8月14日
### Qwen3.8-27B 可在笔记本电脑运行——但你需要这些硬件
阅读报道 (https://kingy.ai/blog/qwen3-8-27b-local-hardware-requirements/)
2. 博客 · 8月17日
### 如何使用 Qwen3.8-27B 构建私有本地编程代理
阅读报道 (https://kingy.ai/blog/qwen3-8-27b-local-coding-agent/)
3. 博客 · 8月14日
### Qwen3.8-27B:基准测试、规格、本地硬件与结论
阅读报道 (https://kingy.ai/blog/qwen3-8-27b-specs-benchmarks-local-hardware/)
## 简要结论
对于购买或改造24GB显卡用于严肃本地工作的大多数用户而言,**Qwen3.8-27B 是这三者中的最佳默认选择**。在单张 RTX 4090 上,其 Q4_K_M 文件达到了与 Qwen3.6-27B 大致相当的约 49 token/s 解码速度及内存曲线,却在首次声明种子下完成了全部 12 项编码任务,跨三个种子在 39/40 的推理案例中通过,并回答了 23/24 个文档问题。相比 Qwen3.6,这是实质性的实用升级且无显著吞吐量损失。
Gemma 4 31B-it 是可靠的替代方案。它实现了最干净的结构化工具调用结果——90/90 单次调用和 30/30 多步运行——并在视觉任务中以 19/20 的成绩领先。在盲评写作标准上也以一分之差胜出。代价是更高的显存占用、约 8.3% 更慢的合成解码速度、更慢的首 token 预热时间,以及较弱的编程代理完成率。
Qwen3.6-27B 在现有集成稳定或严格调优其模板时仍有意义。但对于新部署,其推荐度难及 Qwen3.8。
上述结论适用于以下确切固定的 GGUF 文件及运行时。我们测试的最高稳定上下文为 64K——而非模型标称的 262K——且“能容纳”并不意味着“舒适运行”,一旦投影器、推测解码、桌面显示或多任务并发消耗剩余显存后。其他硬件层级可参阅 Qwen3.8-27B 硬件需求 (https://kingy.ai/blog/qwen3-8-27b-local-hardware-requirements/#qwen38-27b-local-hardware-requirements-at-a-glance)。
## 一分钟选择器
没有脱离工作负载的单一最佳答案。**等量 Q4 测试组**评估当三者均使用相同量化家族、完整 GPU 卸载及 F16 K/V 缓存时的表现。**最佳适配组**则考察每个模型在相同 24GB 上限内能维持的配置。这是不同的问题:例如 Gemma 的 64K 配置在使用 F16 K/V 时失败,改用 Q8_0 K/V 缓存后则通过。
| 如果您的优先级是... | 选择 | 本次测试依据 | 重要注意事项 |
|----------------------|------|--------------|--------------|
| **编程代理与仓库级编辑** | Qwen3.8-27B | 12/12 pass@1;35/36 种子运行通过 | 仅为小型 Python 任务,非完整生产仓库基准测试 |
| **固定 token 预算下的推理** | Qwen3.8-27B | 39/40 pass@3;117/120 次运行通过 | 更大预算可能改变结果,尤其对 Qwen3.6 而言 |
| **私有文档问答** | Qwen3.8-27B | 23/24,略优于 Gemma 的 22/24 | 在 8K 和 32K 上下文下使用合成证据包测试 |
| **严格声明的工具调用** | Gemma 4 31B-it | 90/90 单次调用与 30/30 多步运行通过 | 其迭代式编程工具循环可靠性较低 |
| **视觉密集型本地任务** | Gemma 4 31B-it | 19/20,Qwen3.8 为 18/20 | 使用小型合成图像集;无视频或音频结论 |
| **写作与文案编辑** | 实际平局 | 盲评得分分别为 94/96、93/96 和 93/96 | 单一评估者,每个模型 12 个样本 |
| **最具余量的 64K 上下文** | Qwen3.8 或 Qwen3.6 | F16 K/V 下有 4.20 GiB 可用空间 | Qwen3.6 在关键任务中的可靠性低得多 |
| **最小迁移工作量** | Qwen3.6-27B | 保留已验证的集成方案 | 并非新安装的最强选择 |
若您的实际约束是其他显卡、系统内存或 CPU 卸载容忍度,请使用更广泛的本地 AI 兼容性指南 (https://kingy.ai/ai-hardware/local-ai-compatibility/),而非直接套用这些 RTX 4090 数据。
## 为何选择这三个模型——为何不测试所有 24GB 模型?
本次对比范围特意限定。**Qwen3.8-27B** (https://huggingface.co/Qwen/Qwen3.8-27B/tree/1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0) 是核心发布版本。**Qwen3.6-27B** (https://huggingface.co/Qwen/Qwen3.6-27B/tree/6a9e13bd6fc8f0983b9b99948120bc37f49c13e9) 是同尺寸的直接密集型多模态前代产品。**Gemma 4 31B-it** (https://huggingface.co/google/gemma-4-31B-it/tree/842da3794eaa0b77d5f08bae87a17459d91ff475) 是最接近的非 Qwen 密集型多模态模型,在 Q4 量化下可完整运行于 24GB 显卡。
该设计隔离了一个有价值的采购与升级问题。Qwen3.8 与 Qwen3.6 共享相同的 64 层混合模式、词表规模及视觉编码器深度,因此对比异常清晰。Gemma 提供不同的架构与训练谱系,同时未进入服务器级内存需求范畴。
我们排除了以速度为核心的混合专家模型(如 Qwen3.6-35B-A3B 和 Gemma 4 26B-A4B),因为活跃参数吞吐量会改变问题性质。我们也排除了需要 CPU 卸载的旧版密集检查点和更大模型。它们或许有价值,只是属于另一个以速度或多层级为重点的对比范畴。Kingy.ai 的更广泛开放权重模型对比 (https://kingy.ai/news/best-open-source-ai-models-specs-benchmarks-hardware-requirements-and-when-to-use-each/) 覆盖了更广领域。
我们使用 **开放权重** 作为精确的总称。三个模型卡均采用 Apache 2.0 许可,但“开源”也可能意味着公开训练数据、完整配方及超越可下载权重的可复现性。在评估开放性与本地可用性时,这一区别很重要。
## 模型标识、规格与确切文件
标识错误可能使对比失效。此处的 Gemma 检查点是经过指令微调的 `google/gemma-4-31B-it`,而非基础模型 `google/gemma-4-31B`。Qwen 仓库是经过后训练的 27B 检查点,而非同名 API 或更小变体。完整的 Qwen3.8-27B 规格与发布分析 (https://kingy.ai/blog/qwen3-8-27b-specs-benchmarks-local-hardware/#qwen3-8-27b-specifications) 提供了更广的发布背景;本页聚焦于相同 GPU 上的决策。
基于固定配置,两个 Qwen 模型均有 64 个文本层:48 个线性注意力层和 16 个全注意力层(每四层一个全注意力层),其视觉编码器有 27 层。Gemma 有 60 个文本层——50 个滑动注意力层和 10 个全注意力层——以及 27 层视觉编码器。三种配置均声明最大位置数为 262,144。该声明是架构限制,并非保证 Q4 构建能在 24GB 显卡上分配所需缓存。
运行时计数显示 Qwen3.8 为 273.2 亿参数,Qwen3.6 为 269.0 亿,Gemma 为 307.0 亿。具体文件如下。大小为二进制 GiB;SHA-256 值在测试前已核对。
| 模型/文件 | 固定版本 | 文件与大小 | SHA-256 |
|-----------|----------|------------|---------|
| Qwen3.8-27B 源 | `1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0` | 后训练模型记录 (https://huggingface.co/Qwen/Qwen3.8-27B/resolve/1d4bf0f2ff6012fd82039f2fa52739d0dd7c60c0/config.json) 配置快照保留在证据包中 |
| Qwen3.8 Q4 | `f1bfb127c64f7072bdd2cad55f258b9c8b2910fe` | Qwen3.8-27B-Q4_K_M.gguf (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/f1bfb127c64f7072bdd2cad55f258b9c8b2910fe/Qwen3.8-27B-Q4_K_M.gguf?download=true),15.932 GiB | `7e78da5d7e3ae28d178121f58646953305f3e5bd3cb46f4a75584e8b6c6fe169` |
| Qwen3.6-27B 源 | `6a9e13bd6fc8f0983b9b99948120bc37f49c13e9` | 后训练模型记录 (https://huggingface.co/Qwen/Qwen3.6-27B/resolve/6a9e13bd6fc8f0983b9b99948120bc37f49c13e9/config.json) 配置快照保留在证据包中 |
| Qwen3.6 Q4 | `82d411acf4a06cfb8d9b073a5211bf410bfc29bf` | Qwen3.6-27B-Q4_K_M.gguf (https://huggingface.co/unsloth/Qwen3.6-27B-GGUF/resolve/82d411acf4a06cfb8d9b073a5211bf410bfc29bf/Qwen3.6-27B-Q4_K_M.gguf?download=true),15.662 GiB | `5ed60d0af4650a854b1755bd392f9aef4872643dc25a254bc68043fa638392a0` |
| Gemma 4 源 | `842da3794eaa0b77d5f08bae87a17459d91ff475` | 指令微调模型记录 (https://huggingface.co/google/gemma-4-31B-it/resolve/842da3794eaa0b77d5f08bae87a17459d91ff475/config.json) 配置快照保留在证据包中 |
| Gemma 4 Q4 | `c1ac76e99d5513b141e8adde7288b85c3f9c32ec` | gemma-4-31B-it-Q4_K_M.gguf (https://huggingface.co/unsloth/gemma-4-31B-it-GGUF/resolve/c1ac76e99d5513b141e8adde7288b85c3f9c32ec/gemma-4-31B-it-Q4_K_M.gguf?download=true),17.065 GiB | `38bd64c852c4b460434cc7162fa9bdcf242faf86502581a754cb72956bb17f84` |
视觉模块为可选组件,并非隐式集成于文本测试中。Qwen 投影器各为 0.864 GiB(Qwen3.8 投影器 (https://huggingface.co/unsloth/Qwen3.8-27B-GGUF/resolve/f1bfb127c64f7072bdd2cad55f258b9c8b2910fe/mmproj-F16.gguf?download=true),Qwen3.6 投影器 (https://huggingface.co/unsloth/Qwen3.6-27B-GGUF/resolve/82d411acf4a06cfb8d9b073a5211bf410bfc29bf/mmproj-F16.gguf?download=true));Gemma 投影器 (https://huggingface.co/unsloth/gemma-4-31B-it-GGUF/resolve/c1ac76e99d5513b141e8adde7288b85c3f9c32ec/mmproj-F16.gguf?download=true) 为 1.117 GiB。这些是文件大小,并非声明显存峰值会精确增加相同数值。
## Kingy.ai 如何测试这些模型
Kingy.ai 在一张报告为 24,564 MiB 的物理 NVIDIA GeForce RTX 4090 上测试了全部三款模型,其显示输出已禁用,功耗限制为 450W。主机使用 Ryzen 9 7950X、128 GiB 级系统内存(无交换空间)、Ubuntu 22.04.3、NVIDIA 驱动 570.195.03 和 CUDA 11.8。捕获期间显卡以 PCIe 4.0 x8 模式运行,因此绝对数值不应视为通用 RTX 4090 规格。
运行时为 llama.cpp b10453 (https://github.com/ggml-org/llama.cpp/releases/tag/b10453),确切提交 `3cb7ffb1a1f612d5e4a46244ae5a3c77ad934a70`,针对 CUDA 架构 89 编译。通用设置为完整 GPU 卸载、开启闪存注意力、F16 K/V 缓存、批次大小 2,048、微批次 512、16 线程及单个并行槽位。文本测试未加载视觉投影器。核心质量测试关闭推测解码。
测试包含两个公平性通道:
- **等量 Q4:** 三个确切的 Q4_K_M 文件、相同运行时、F16 K/V 及通用生成控制。
- **24GB 内最佳可用:** 允许配置更改以使可用上下文配置适配。关键变更是 Gemma 在 64K 下使用 Q8_0 K/V 缓存。
控制性非思维任务使用温度零和固定种子。控制性推理使用温度 1.0、top-p 0.95、中等推理努力及三个声明种子。Qwen 和 Gemma 不暴露相同的思维语义,因此我们也为每个模型运行三个简短原生默认提示作为非排名用户体验样本。这些原生样本未并入评分卡。
确定性套件包含 50 条指令检查;三个种子下的 40 个推理案例;三个种子下的 30 个单工具和 10 个多步案例;三个种子下的 12 个编码任务;8K 和 32K 包中的 24 个文档问题;12 个写作编辑;中文、西班牙语和法语的 18 个机械多语言检查;以及 20 个合成视觉图像。编程代理编辑小型 Python 工作区并运行测试。声称成功但未通过测试的案例仍记为失败。
性能方面,`llama-bench` 在 512、8,192 和 32,768 提示 token 下各运行五次重复,加 256 token 解码。上下文运行需要三次成功轮次;分配失败记为内存不足而非从表格中消失。预热流式测试排除一次预热。二项比例使用 Wilson 95% 区间。配对模型比较使用双侧精确 McNemar 检验;p 值描述反对对称配对结果的证据,而非实际重要性。
一个评分夹具和两种精确匹配模式在检查后更正:一个工作日键值错误,而有效的 `63 km` 和 `y = 11` 答案匹配过于严格。保留输出重新评分;未重新运行推理。两个格式错误的 Qwen3.6 工具调用最初终止了其测试通道,因此测试框架被修正为记录错误并继续。中止点尝试仍记为失败,仅真正未启动的案例随后运行。
证据 ZIP 包含提示、原始响应、工具转录、日志、GPU 遥测、命令、评分脚本和源代码快照。它排除权重、凭证和私有用户数据。这是单张 GPU、单次 llama.cpp 提交、单个 GGUF 发布商及合成套件——并非对所有运行时或工作负载的声明。方法论遵循 Kingy.ai 的指南如何评估 Qwen3.8-27B 实际工作 (https://kingy.ai/blog/qwen3-8-27b-specs-benchmarks-local-hardware/#how-to-evaluate-qwen3-8-27b-for-real-work)。
三个证据标签规定解释方式:**Kingy.ai 测量** 表示数值由本主机保留运行重新生成。**基于固定配置推导** 表示架构事实来自冻结配置而非观测行为。**厂商报告** 表示模型卡数字未重现或与我们的分数合并。显示置信区间是因为小分母可能使相邻百分比显得比实际更确定。未创建复合分数:等权重一个编码任务、一个视觉图像和一个指令检查会制造答案而非揭示偏好。夹具公开且确定,读者可检查其难度,但无法代表每个仓库、文档、语言、图像或攻击面。生产选择应使用预期系统提示、工具模式、采样策略和失败预算重复最高风险任务。因此,以下工作负载建议是基于此证据的限定决策,而非关于无关用途的排名声明。
## 内存与上下文:24GB 能容纳什么?
16-17 GiB 权重文件不会留下七或八个 GiB 用于任意上下文。运行时需要工作缓冲区;K/V 缓存随分配上下文增长;投影器和推测组件增加各自分配。“能加载”、“能回答一个简短提示”和“能在长多轮会话中舒适运行”是三种不同状态。
| 模型/等量 Q4 配置 | 8K 峰值 | 32K 峰值 | 64K 结果 | 64K 余量 | 解释 |
|-------------------|---------|----------|----------|----------|------|
| Qwen3.8-27B, F16 K/V | 16,626 MiB | 18,186 MiB | 20,266 MiB, 通过 | 4,298 MiB (4.20 GiB) | 在所有测试上下文下通过三轮 |
| Qwen3.6-27B, F16 K/V | 16,626 MiB | 18,186 MiB | 20,266 MiB, 通过 | 4,298 MiB (4.20 GiB) | 与 Qwen3.8 相同的测量内存曲线 |
| Gemma 4 31B-it, F16 K/V | 19,962 MiB | 21,906 MiB | CUDA 内存不足 | 不适用 | 32K 通过,剩余 2,658 MiB |
| Gemma 4 31B-it, Q8_0 K/V | 非等量 Q4 缓存通道 | 未要求 | 21,956 MiB, 通过 | 2,608 MiB (2.55 GiB) | 最佳适配 64K 配置;三轮通过 |
在 32K 下,两个 Qwen 峰值均为 17.76 GiB,剩余 6.23 GiB。Gemma 峰值为 21.39 GiB,剩余 2.60 GiB。这足以运行测试的文本会话,但桌面合成器、投影器、MTP、并行槽位或更大输出预留可快速消耗余量。
在 64K 下,两个 Qwen 以 F16 K/V 和 4.20 GiB 剩余通过。Gemma 的 F16 缓存在上下文分配期间失败。仅将 Gemma 的 K/V 切换为 Q8_0 足以在 63,482 输入 token 下通过三轮,峰值达 21.44 GiB。其首次预填充耗时 36.57 秒,速率为 1,756.9 提示 token/s;在此合成检查中缓存后续轮次约需一秒。
这些是最高测试稳定配置,而非最大可能上下文。我们未测试 128K 或 262K,且剩余余量并非每个提示的保证。上下文分配也因运行时而异。更广泛的容量图景可参阅完整的 Qwen3.8-27B 内存梯度 (https://kingy.ai/blog/qwen3-8-27b-local-hardware-requirements/#the-exact-memory-ladder) 及为何 262K 上下文