@ProTekkFZS:在 3090 上用 Q4_K_M 3.6 35B、768k 上下文加 YaRN,爽到飞起
摘要
用户报告称,通过 llama.cpp 分支,在 RTX 3090 上成功以 Q4_K_M 量化运行 35B 参数 MoE 模型,上下文长达 768K,仅把 8 个专家卸载到 CPU,性能依旧可接受。
查看缓存全文
缓存时间: 2026/04/21 08:09
Q4_K_M 3.6 35B 在 3090 上用 yarn 跑 768k,爽到飞起,不骗人。用的是 @no_stp_on_snek 的 llama.cpp 分支,开了 turboquant,只把 8 个 expert 扔到 CPU,速度依旧能接受。10k prompt 回忆准确。
相似文章
Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s
一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。
首次本地LLM调优尝试:在RTX 5080 16GB上实现Qwen3.8-27B真实Q4_K_M量化,上下文长度约50-61K时速度为13.2 tok/s
一位用户详细描述了他们首次在RTX 5080 16GB上对Qwen3.8-27B模型进行Q4_K_M量化的调优尝试,通过选择性将FFN张量卸载到CPU,在50-61K上下文长度下实现了约13.2 tokens per second的速度,以提升性能。
7900XTX 24GB 显存,终于能够在 131k 上下文下容纳 Q6K+MTP 和 Qwen 3.6 27B
在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。
Qwen3.6-35B-A3B APEX 在单张 RTX 3090 上——充分发挥其潜力
在 RTX 3090 上运行 Qwen3.6-35B-A3B APEX 模型的详细指南:比较两个 llama.cpp 分支及量化方法,以达到最佳速度与质量。
实验:Qwen3.8-2.4T-A95B 在 RTX 5090 + RTX 5060 Ti 上本地运行,约 0.80 tok/s
一个实验,使用 llama.cpp 在双消费级 GPU(RTX 5090 + 5060 Ti)上本地运行 Qwen3.8-2.4T-A95B MoE 模型,启用 MTP 推测解码后达到约 0.8 tok/s。