@ProTekkFZS:在 3090 上用 Q4_K_M 3.6 35B、768k 上下文加 YaRN,爽到飞起

X AI KOLs Following 新闻

摘要

用户报告称,通过 llama.cpp 分支,在 RTX 3090 上成功以 Q4_K_M 量化运行 35B 参数 MoE 模型,上下文长达 768K,仅把 8 个专家卸载到 CPU,性能依旧可接受。

Q4_K_M 3.6 35B 在 3090 上跑 768k 上下文加 YaRN,真的太爽了,不骗人。用的是 @no_stp_on_snek 的 llama.cpp 分支,turboquant 加持,只把 8 个专家甩给 CPU,性能依旧在线。10k prompt 回忆稳稳的。
查看原文
查看缓存全文

缓存时间: 2026/04/21 08:09

Q4_K_M 3.6 35B 在 3090 上用 yarn 跑 768k,爽到飞起,不骗人。用的是 @no_stp_on_snek 的 llama.cpp 分支,开了 turboquant,只把 8 个 expert 扔到 CPU,速度依旧能接受。10k prompt 回忆准确。

相似文章

Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s

Reddit r/LocalLLaMA

一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。