q4-k-m

标签

Cards List
#q4-k-m

@mylifcc: 我已经在mac上用上Gemma-4-12b了,技术栈是: llama.cpp + GGUF Q4_K_M + Metal 32K context,本地 OpenAI-compatible API 实测约 36 tok/s,常驻 RSS 约…

X AI KOLs Timeline · 2026-06-03 缓存

用户分享在Mac上使用llama.cpp配合GGUF Q4_K_M量化版Gemma-4-12b模型的经验,实现了约36 tok/s的本地推理速度和约10GB内存占用。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈