标签
Escha-W2 是 Qwen3.6-35B-A3B MoE 模型的 2 位量化版本,打包了运行时,可通过兼容 OpenAI 的 API 进行本地部署。它需要 24 GB 显存的 GPU(16 GB 也可,但需权衡),可在 Hugging Face 上获取。
Unsloth 成功将 GLM-5.2 模型以 2-bit 量化压缩至 238GB,可在 256GB Mac 上本地运行,保留约 82% 的准确率。
Unsloth 推出 2-bit 量化的 Gemma 4 12B 模型,仅 4.66GB 可在本地运行,具备自主联网搜索、深度分析等类麦肯锡咨询能力。