@DogukanUrker: 单张RTX 3060上运行Gemma 4 12B:完整262,144上下文,速度约100 tok/s。(配置如下)密集模型 -> MTP推测…
摘要
DogukanUrker演示了在单张RTX 3060上使用推测解码和KV缓存拆分运行Gemma 4 12B,拥有完整262,144上下文,速度约100 tok/s,实现了接近满GPU利用率且无需CPU卸载。
查看缓存全文
缓存时间: 2026/07/21 18:47
Gemma 4 12B 在单张 RTX 3060 上:完整 262,144 上下文,约 100 tok/s。(配置如下)
稠密模型 -> 开启 MTP 投机解码后,通过将 drafter 启动,速度从原来的约 2.4 x 42 提升至约 100 tok/s(而 26B MoE 仅达到约 1.3x)。
完全在 GPU 上运行,零 CPU 卸载,显存占用稳定在 12GB 的约 97%。
适配完整上下文 + MTP 的技巧:对 KV 缓存进行拆分——目标模型用 q8_0,草稿模型用 f16。量化草稿缓存并接受失效。在 262K 上下文下保持约 70% 的有效性。
llama-swap 配置:
llama-server -m gemma-4-12B-it-qat-UD-Q4_K_XL.gguf –model-draft mtp-gemma-4-12B-it.gguf -ngld 99 –spec-type draft-mtp –spec-draft-n-max 4 -ngl 99 -c 262144 -fa on –jinja -np 1 -ctk q8_0 -ctv q8_0 -ctkd f16 -ctvd f16 -b 4096 -ub 1280 –temp 1.0 –top-p 0.95 –top-k 64 –repeat-penalty 1.0
相似文章
Gemma 4 26B 在单块 RTX 5090 上达到 600 Tok/s
一项基准测试显示,使用 vLLM 搭配 DFlash 投机解码,在单块 RTX 5090 上将 Gemma 4 26B 的推理速度提升至约 578 tokens/s,相比基线实现了 2.56 倍的加速。
@analogalok: Gemma 4 12B QAT(密集)在8GB显存和120k上下文下实现超过1000 tokens/秒的预填充速度 Gemma 4 12B QAT(密集),TurboQ…
Gemma 4 12B QAT(密集)使用TurboQuant在8GB RTX 4060上实现超过1000 tokens/秒的预填充速度,支持120k上下文,实现完整的GPU层卸载。相比之前的方法,预填充速度提升了42%。
昨天在我的3090上跑了gemma 4 12b,我觉得本地模型领域已经变了
一位用户报告称,通过GGUF量化在单张RTX 3090上本地运行了谷歌的Gemma 4 12B模型,发现其性能强劲,包括真实的256k上下文、多模态能力以及函数调用功能,在编码任务上甚至优于更大的70B模型。
@leopardracer: GEMMA 4 26B 在 RTX 4060 上运行,拥有 248K Token 上下文窗口,每秒 20 个 Token,上下文窗口大得可以……
Gemma 4 26B 在 RTX 4060 上运行,通过 llama.cpp 和 Q4_K_XL 量化实现 248K Token 上下文和每秒 20 Token 的速度,从而在消费级硬件上本地处理整个代码库。
在老款GTX 1080(8GB显存,128k上下文)上,约30B的MoE模型达到24+ tok/s的推理速度
一位开发者展示了如何使用llama.cpp,通过MoE卸载和TurboQuant KV缓存量化技术,在老款GTX 1080(8GB显存)上以128k上下文运行Qwen 3.6 35B-A3B和Gemma 4 26B-A4B等MoE模型,达到24+ tok/s的推理速度,并揭示了针对Gemma MTP投机解码的优化技巧。