@iluciddreaming: 玩了两个月本地 LLM。 用 Windows 11 + llama.cpp + llama-swap 狂测各种开源模型,这是我的最终成绩单: 硬件:i7-13700 + 64GB RAM + RTX 4070 目前最能打的组合是 gemm…
摘要
经过两个月本地 LLM 测试,作者认为 gemma-4-12B-it-QAT 和 MTP 辅助组合在速度和可用性上表现最佳,硬件为 i7-13700 + 64GB RAM + RTX 4070。
查看缓存全文
缓存时间: 2026/06/15 17:07
玩了两个月本地 LLM。
用 Windows 11 + llama.cpp + llama-swap 狂测各种开源模型,这是我的最终成绩单:
硬件:i7-13700 + 64GB RAM + RTX 4070
目前最能打的组合是 gemma-4-12B-it-qat-UD-Q4_K_XL + MTP 辅助。
其他模型也都跑过,这个在速度和实际可用性的平衡上目前最优。
接下来就期待 DiffusionGemma 进到 llama.cpp 之后,再来继续玩
相似文章
@mylifcc: 我已经在mac上用上Gemma-4-12b了,技术栈是: llama.cpp + GGUF Q4_K_M + Metal 32K context,本地 OpenAI-compatible API 实测约 36 tok/s,常驻 RSS 约…
用户分享在Mac上使用llama.cpp配合GGUF Q4_K_M量化版Gemma-4-12b模型的经验,实现了约36 tok/s的本地推理速度和约10GB内存占用。
@TraffAlex: 消费级GPU的最佳本地LLM——llama.cpp指南(2026年6月)我目前在消费级硬件上实际运行的内容。Eve…
截至2026年6月,面向消费级GPU的最佳本地LLM指南,使用llama.cpp在8-32GB显存上运行如Gemma 4-12B、Qwen3.6-27B和Nex-N2-Mini等模型,包含设置和启动命令。
我在相同Web开发提示下测试了9个LLM约8小时 — RTX 3060 12GB结果(请为最佳打分!)
本文呈现了在一个Web开发提示下对比9个LLM的8小时测试结果,重点关注哪些本地模型能在RTX 3060 12GB GPU上匹配前沿AI性能,包括详细的生成时间和实用见解。
在单个16GB GPU + 64GB RAM上的本地LLM自动补全与代理式编码
使用 llama.cpp 在单块 16GB GPU 及 64GB+ 内存上设置本地 LLM 自动完成(Qwen2.5-Coder-7B)与代理编码(Qwen3.6-35B-A3B)的技术指南,包含命令与性能基准。
实测 OpenCode 与自托管 LLM 的协作:Qwen 3.5、3.6、Gemma 4、Nemotron 3、GLM-4.7 Flash - v2
一位开发者在 RTX 4080 上用 OpenCode 对多款自托管 LLM(Qwen 3.5/3.6、Gemma 4、Nemotron 3、GLM-4.7)进行两项编码任务基准测试,揭示了速度与质量的权衡。