hardware-config

标签

Cards List
#hardware-config

在 8GB 显存和 32GB 内存上运行 Qwen3.6 35b a3b,~190k 上下文

Reddit r/LocalLLaMA · 2026-05-10

作者分享了一种高性能的本地推理配置,使用支持 TurboQuant 的修改版 llama.cpp,在硬件受限(8GB 显存、32GB 内存)的情况下运行 Qwen3.6 35B A3B,实现了 ~37-51 tok/sec 的生成速度,并支持 ~190k 上下文。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈